기사 검색

이슈부터 IT·AI·연예·게임까지, 메타브리프의 기사를 찾아보세요.

AI

애플, 기기 속 '정답 없는 음성'으로 음성인식 학습하는 연합학습 방법론 논문 공개

애플이 사용자 기기에 흩어진 라벨 없는 음성 데이터로 음성인식(ASR) 모델을 학습시키는 방법을 정리한 논문을 공개했다. 애플 머신러닝 연구 사이트(Apple Machine Learning Research)에 따르면, 애플은 지난 24일 「A Practical Recipe for Semi-Supervised Federated ASR: Online Pseudo-Labels with Server Update Stabilization」이라는 논문을 이 사이트에 올렸다. 제목을 우리말로 옮기면 '준지도 연합 음성인식을 위한 실용적 레시피: 온라인 의사 라벨과 서버 업데이트 안정화' 정도다.


논문이 다루는 분야는 '준지도 연합학습(SSFL)'이다. 연합학습은 데이터를 서버로 모으지 않고 각 기기 안에서 모델을 학습시킨 뒤, 그 결과만 합쳐 전체 모델을 개선하는 방식이다. 개인정보가 기기 밖으로 나가지 않는다는 점에서 주목받아 왔다. 문제는 기기에 쌓이는 음성에는 '정답'이 없다는 것이다. 사용자가 자기 말을 일일이 받아 적어 두지 않기 때문에 기기 속 데이터는 대부분 라벨 없는 상태로 남는다.


초록 설명에 따르면 SSFL은 이 문제를 '교사(teacher)' 모델로 푼다. 교사 모델이 기기 속 라벨 없는 데이터에 임시 정답인 의사 라벨(pseudo-label)을 붙이고, 서버는 사람이 라벨을 단 소규모 '씨앗(seed)' 데이터셋을 갖고 학습을 돕는다.


연구진은 음성인식이 이런 구조에서 특히 취약하다고 짚었다. 음성인식은 결과를 단어나 글자의 연속으로 내놓는데, 의사 라벨에 섞인 오류가 이 출력 시퀀스를 따라 번지고 학습 라운드가 거듭될수록 쌓인다. 초록은 이렇게 쌓인 오류가 결국 학습을 발산(divergence)시키고, 모든 데이터에 정답이 있는 완전 지도 연합학습과의 성능 격차를 크게 벌린다고 설명한다.


연구진은 이 격차를 줄이는 열쇠로 서로 맞물린 두 가지 설계 축을 제시했다. 하나는 어떤 모델이 의사 라벨을 만드느냐는 '교사', 다른 하나는 서버가 라벨 있는 데이터로 수행하는 업데이트, 곧 학습을 안정시키는 '앵커(anchor)'다. 논문 제목에 들어간 '온라인 의사 라벨'과 '서버 업데이트 안정화'가 각각 이 두 축에 해당하는 것으로 보인다. 다만 공개된 초록 요지가 교사 부분 설명 중간에서 끝나, 연구진이 두 축을 구체적으로 어떻게 설계했는지와 완전 지도 학습 대비 격차를 얼마나 줄였는지 같은 수치는 확인되지 않았다.


이번 논문은 '레시피'라는 표현대로 새 이론보다 실제 적용할 수 있는 설계 지침에 초점을 맞춘 것으로 읽힌다. 기기 안의 데이터를 밖으로 내보내지 않으면서 음성인식 성능을 끌어올리는 일은 온디바이스 AI와 개인정보 보호를 함께 내세워 온 애플에 현실적인 과제다. 그렇다고 이 연구가 애플의 특정 제품이나 서비스에 적용됐거나 적용될 예정인지는 논문 초록만으로는 확인되지 않는다.


애플은 연구 성과를 외부 논문 공유 플랫폼보다 자사 머신러닝 연구 사이트에 먼저 올리는 경우가 많다. 그래서 이 사이트는 애플의 AI 연구 방향을 엿볼 수 있는 창구로 꼽힌다. 이 사이트에 올라오는 논문은 동료 평가를 거쳤는지가 저마다 다르며, 이번 논문이 학회나 학술지 심사를 거쳤는지는 확인되지 않았다.