애플 "다국어 음성 AI, 언어 구별 능력 키우면 단일언어 모델과의 격차 줄어든다"
애플은 다국어 음성 AI 모델이 학습 단계에서 언어를 더 잘 구별하게 만들면 단일언어 모델과의 성능 격차를 줄일 수 있다는 연구 결과를 내놓았다. 애플은 지난 2일 자사 머신러닝 연구 사이트(Apple Machine Learning Research)에 논문 「Language Discrimination Improves Linguistic Learning in Multilingual Speech Models(언어 구별이 다국어 음성 모델의 언어 학습을 개선한다)」를 공개했다. 논문 초록에 따르면 연구진은 사전학습 중 언어 구별 능력을 강화한 결과, 일부 지표에서는 다국어 모델과 단일언어 모델의 격차가 사라졌다고 밝혔다.
이 연구는 '자기지도 학습' 음성 모델을 다룬다. 자기지도 학습은 사람이 일일이 정답을 달지 않은 대량의 음성 데이터에서 모델이 스스로 소리의 구조를 익히는 방식이다. 여러 언어를 한 모델로 학습시키면 언어끼리 정보를 나눠 쓰는 이점이 있다. 그러나 애플 연구진은 전체 사전학습 데이터 양을 똑같이 맞춰 비교하면 다국어 모델이 여전히 단일언어 모델보다 성능이 떨어진다고 지적했다. 같은 데이터 예산을 여러 언어가 나눠 써야 하는 다국어 모델의 구조적 약점이 이른바 '다국어 격차'로 나타난다는 것이다.
연구진은 실험을 단순화하려고 영어와 프랑스어 두 언어만 쓰는 통제된 환경을 만들었다. 기반 모델로는 대표적인 자기지도 음성 표현 학습 모델인 휴버트(HuBERT)를 썼다. 이 환경에서 언어 구별 능력을 강화하는 두 가지 방법을 시험했다. 초록에 따르면 그중 하나는 보조적인 언어 관련 학습 목표(auxiliary language…)를 추가하는 방식이다. 다만 공개된 초록 요지가 중간에서 끊겨 있어 두 방법의 구체적인 내용은 이번 자료로는 확인되지 않았다.
결과는 두 측면에서 나왔다. 하나는 연속적인 음성학적 지표, 즉 모델이 소리 단위를 얼마나 정밀하게 구분해 표현하는지다. 다른 하나는 그보다 높은 수준의 언어학적 지표다. 연구진은 두 측면 모두에서 다국어 격차가 줄었고, 일부 지표에서는 격차가 완전히 사라졌다고 밝혔다. 또 언어 구별을 강화했는데도 언어 간 정보 공유가 상당 부분 유지됐다고 설명했다.
이 결과가 눈길을 끄는 이유는 '언어를 구별하는 것'과 '언어 간 공유'가 서로 충돌하지 않을 수 있음을 보여줬기 때문이다. 언어를 뚜렷하게 나눠 인식하도록 훈련하면 공유 효과가 약해질 것이라고 예상할 수 있지만, 초록에 따르면 공유 이점을 크게 잃지 않으면서 언어별 학습 품질을 끌어올렸다. 데이터 예산이 정해진 상황에서 한 모델로 여러 언어를 처리해야 하는 음성 인식·음성 비서 분야에서 의미 있는 방향이다.
다만 해석에는 한계가 있다. 실험은 영어와 프랑스어 두 언어로 한정됐다. 한국어처럼 음운 체계가 크게 다른 언어나 더 많은 언어를 함께 학습할 때도 같은 효과가 나는지는 초록만으로는 확인되지 않았다. 이 연구가 시리(Siri) 같은 애플 제품에 적용될지도 밝혀지지 않았다. 논문이 동료평가를 거쳤는지 여부도 이번 자료에는 나와 있지 않다.
애플은 연구 성과를 아카이브(arXiv) 같은 논문 공유 플랫폼보다 자사 머신러닝 연구 사이트에 먼저 올리는 경우가 많다. 그래서 이 사이트는 애플의 AI 연구 방향을 엿볼 수 있는 창구로 꼽힌다. 이번 논문은 애플이 다국어 음성 처리의 기초 연구에도 힘을 쏟고 있음을 보여주는 사례다.