애플, 확산 언어모델 성능 높이는 '프로브 가이던스' 논문 공개… 추론 시 추가 연산 없이 무조건부 생성 최고 성능
애플이 텍스트를 만드는 확산(diffusion) 방식 언어모델의 생성 품질을 높이는 새 기법을 내놨다. 애플은 지난 23일 자사 머신러닝 연구 사이트(Apple Machine Learning Research)에 논문 「How to Guide Your Language Flow」를 공개했다. 논문 초록에 따르면 연구진이 '프로브 가이던스(probe guidance)'라고 이름 붙인 이 기법은 연속 확산 언어모델의 무조건부 생성(unconditional generation)에서 새로운 최고 성능(state-of-the-art)을 기록했다.
초록을 보면 프로브 가이던스는 '플로 매칭(flow matching)' 모델을 원하는 방향으로 이끄는 가이던스 기법이다. 핵심은 이미 학습된 확산 모델의 내부 상태를 고정(frozen)한 채 그대로 활용해 가이던스 신호를 만든다는 점이다. 연구진은 이 방식이 기존 '오토가이던스(autoguidance)'와 비슷한 원리로 작동한다고 설명했다. 오토가이던스는 성능이 낮은 '약한 모델'과 성능이 높은 '강한 모델'의 출력 차이를 이용해 생성 결과를 더 나은 쪽으로 끌어가는 방식이다.
애플이 내세운 차별점은 두 가지다. 첫째, 추론 단계에서 모델을 한 번 더 돌리는 추가 순전파(forward pass)가 필요 없다. 오토가이던스처럼 약한 모델을 따로 두는 방식은 결과를 낼 때마다 연산이 늘어나는 부담이 있는데, 프로브 가이던스는 기존 모델의 내부 상태를 재활용해 이 과정을 없앴다는 것이다. 둘째, 약한 모델과 강한 모델이 비슷한 동역학(dynamics)을 공유하도록 보장하는 '신뢰할 수 있는 경로'를 제공한다고 연구진은 밝혔다. 두 모델의 성격이 지나치게 다르면 가이던스가 오히려 결과를 엉뚱한 방향으로 끌고 갈 수 있는데, 이 문제를 구조적으로 줄였다는 설명이다.
이 연구가 주목받는 배경에는 언어모델 설계의 흐름 변화가 있다. 지금 널리 쓰이는 대형 언어모델 대부분은 단어(토큰)를 앞에서부터 하나씩 차례로 만들어 내는 '자기회귀' 방식이다. 반면 확산 모델은 잡음에서 시작해 여러 단계에 걸쳐 전체 결과물을 한꺼번에 다듬어 가는 방식으로, 이미지 생성 분야에서 먼저 자리 잡았다. 최근에는 이 방식을 텍스트 생성에 적용하려는 연구가 늘고 있다. 이미지 확산 모델에서는 가이던스 기법이 품질을 끌어올리는 핵심 도구로 쓰여 왔는데, 이번 논문은 이를 언어모델 쪽으로 옮기면서 추론 비용 부담까지 줄이려 했다는 점에서 의미가 있다. 연산 자원이 제한된 기기에서 AI를 돌리는 데 공을 들여 온 애플로서는 추가 연산 없이 품질을 높이는 방법이 특히 중요한 과제다.
다만 이번 성과의 범위는 좁혀서 볼 필요가 있다. 초록에서 최고 성능이라고 밝힌 부분은 별도 조건 없이 텍스트를 생성하는 '무조건부 생성'이다. 사용자 지시를 따르는 질의응답이나 대화처럼 조건이 붙은 작업에서 어떤 결과를 냈는지는 공개된 초록 요지만으로는 확인되지 않았다. 초록은 이 기법을 다른 영역에 적용한 결과를 소개하는 대목에서 끊겨 있다. 어떤 벤치마크와 비교 모델을 썼는지, 수치상 개선 폭이 얼마인지도 초록에는 나와 있지 않다. 동료평가를 거쳤는지, 학회에 채택됐는지도 확인되지 않았다. 이 기법이 애플 제품이나 서비스에 적용될지에 대해서도 애플은 언급하지 않았다.
애플은 AI 연구 성과를 외부 논문 공유 플랫폼보다 자사 머신러닝 연구 사이트에 먼저 올리는 경우가 많다. 그래서 이 사이트는 애플의 AI 연구 방향을 엿볼 수 있는 창구로 꼽힌다. 이번 논문은 애플이 자기회귀 방식 외에 확산 기반 언어모델도 연구하고 있음을 보여 주는 사례다.