애플, 라벨 없는 음성 데이터로 연합학습 음성인식 모델 훈련하는 방법 논문 공개
애플이 9월 24일(현지시간) 자사 머신러닝 연구 사이트(Apple Machine Learning Research)에 사용자 기기의 라벨 없는 음성 데이터로 음성인식(ASR) 모델을 훈련하는 방법을 다룬 논문을 공개했다. 논문 제목은 「A Practical Recipe for Semi-Supervised Federated ASR: Online Pseudo-Labels with Server Update Stabilization」이다. 제목을 풀면 '준지도 연합학습 음성인식을 위한 실용적 방법: 온라인 의사 라벨과 서버 업데이트를 통한 안정화'다. 애플은 연구 성과를 외부 논문 공유 플랫폼보다 자사 사이트에 먼저 올리는 경우가 많아, 이 사이트는 애플의 AI 연구 방향을 엿볼 수 있는 창구로 꼽힌다.
공개된 초록에 따르면 연구진이 다룬 주제는 '준지도 연합학습(SSFL)'이다. 연합학습은 데이터를 서버로 모으지 않고 각 사용자 기기(클라이언트)에서 모델을 학습시킨 뒤 그 결과만 합치는 방식이다. 이때 기기에 있는 데이터에는 대개 정답 라벨이 없다. 음성 데이터라면 녹음은 있어도 그 녹음을 받아 적은 텍스트가 없는 셈이다. 준지도 연합학습은 이 문제를 풀기 위해 '교사(teacher)' 모델이 라벨 없는 데이터에 임시 정답인 의사 라벨(pseudo-label)을 붙이고, 서버에는 정답이 달린 소규모 '시드(seed)' 데이터만 둔다.
초록은 음성인식이 이런 구조에서 특히 취약하다고 짚었다. 음성인식은 단어나 글자를 순서대로 이어 출력하는 작업이라 의사 라벨의 오류 하나가 출력 문장 전체로 번진다. 게다가 연합학습은 여러 차례 학습 라운드를 반복하기 때문에 오류가 라운드마다 쌓이다가 결국 학습이 발산(divergence)해 버린다. 연구진은 이 때문에 준지도 연합학습 음성인식이 정답 라벨을 모두 갖춘 완전 지도 연합학습보다 성능이 크게 떨어져 왔다고 설명했다.
연구진은 이 격차를 줄이는 열쇠로 서로 맞물린 두 가지 설계 축을 제시했다. 하나는 의사 라벨을 만드는 모델을 무엇으로 할지 정하는 '교사'이고, 다른 하나는 서버가 정답 라벨 데이터로 모델을 업데이트해 학습을 안정시키는 '앵커(anchor)'다. 논문 제목의 '온라인 의사 라벨'과 '서버 업데이트 안정화'가 각각 이 두 축에 해당하는 것으로 보인다. 다만 이번에 확인한 초록 발췌본은 교사 설계를 설명하는 대목에서 끊겨 있어, 연구진이 교사와 앵커를 구체적으로 어떻게 구성했는지, 완전 지도 학습과의 격차를 얼마나 줄였는지 같은 수치는 확인되지 않았다.
이번 연구는 개인정보를 기기 밖으로 내보내지 않으면서 모델 성능을 끌어올리는 방법을 찾는 흐름 위에 있다. 음성은 개인 정보가 많이 담긴 데이터라 서버로 모아 사람이 받아 적는 방식에는 부담이 따른다. 연합학습은 원본 데이터를 기기에 둔 채 학습할 수 있다는 장점이 있지만, 기기의 음성 데이터에 정답 라벨이 없다는 점이 걸림돌이었다. 라벨 없는 데이터를 안정적으로 활용할 수 있다면 적은 양의 정답 데이터만으로도 실제 사용 환경의 다양한 음성을 학습에 반영할 여지가 생긴다. 논문이 제목에 '실용적 방법(Practical Recipe)'을 내건 것도 개념 제시보다 실제로 돌아가는 학습 절차를 정리하는 데 초점을 뒀다는 뜻으로 읽힌다.
다만 이번 연구가 애플의 음성 비서나 받아쓰기 기능 등 실제 제품에 적용됐는지, 또는 적용될 계획이 있는지는 확인되지 않았다. 애플 연구 사이트에 올라오는 논문은 학회 동료평가를 거쳤는지가 논문마다 달라, 이번 논문의 동료평가 여부도 초록만으로는 확인되지 않았다.