메이퇀 연구진, 작은 AI 모델이 교사 모델에게 배울 때 '교정 지점'에 감독을 몰아주는 증류 기법 'SAKI' 공개
중국 생활서비스 기업 메이퇀(Meituan) 연구진이 작은 언어모델(학생)이 큰 모델(교사)에게 배우는 과정에서 학습 신호를 어디에 어떻게 줄지 자동으로 정하는 증류 기법 'SAKI'를 내놓았다. 미테토 웨이(Miteto Wei) 등 연구자 10명은 arXiv에 「SAKI: Maximal-Coupling-Routed Teacher Supervision for On-Policy Distillation」(arXiv:2609.36601) 논문을 공개했다. 공개된 초록에 따르면 이 기법은 수학 추론 벤치마크 7종에서 매개변수 17억 개(1.7B)와 6억 개(0.6B) 규모의 학생 모델 모두에서 비교 기준 방법보다 좋은 성적을 냈다. 이 논문은 연구자 커뮤니티 플랫폼 허깅페이스의 일일 논문 목록에서 추천 36회를 받았다.
배경에는 '온폴리시 증류(OPD)'라는 학습 방식이 있다. 지식 증류는 큰 모델의 능력을 작은 모델에 옮기는 기술이다. 교사가 만든 답안만 보고 배우면 학생은 실제로 쓰일 때 자기가 만든 문장 흐름에서 길을 잃기 쉽다. 학습할 때 본 상황과 실제로 쓰일 때 마주하는 상황이 다르기 때문이다. OPD는 학생이 직접 생성한 문장 흐름 위에서 교사의 평가를 받게 해 이 차이를 줄인다. 연구진은 이 방식에도 한계가 있다고 짚었다. 실력이 약한 학생은 교사라면 가지 않았을 방향으로 풀이를 끌고 가는 경우가 많은데, 그런 지점에서는 교사의 감독 신호가 제 역할을 하기 어렵다는 것이다.
SAKI(Supervision Allocation with KL-constrained Interpolation)는 이 문제를 두 단계로 다룬다. 먼저 학생이 문장을 생성할 때 교사가 정해진 범위 안에서 개입하도록 한다. 이 범위는 KL 발산이라는 확률분포 간 거리로 제한한다. 이때 '최대 결합(maximal coupling)'이라는 확률 기법을 써서 토큰마다 학생의 선택을 그대로 받아들일지(수용), 교사 쪽으로 고칠지(교정)를 정한다. 다음으로 이렇게 생긴 수용·교정 기록을 그대로 활용해 토큰마다 감독 방식을 다르게 준다. 수용된 위치에서는 기존처럼 학생이 뽑은 토큰을 기준으로 역방향 KL 감독을 준다. 교정이 일어난 위치에서는 교사가 가장 높은 확률을 준 토큰을 직접 가르친다.
초록은 이 설계가 이론적으로 깔끔하다고 강조한다. 최대 결합에서는 교정이 일어날 확률이 두 분포의 총변동거리(TV)와 정확히 같다. 그래서 신뢰 영역 반경이라는 설정값 하나로 생성 경로가 학생 본래 분포에서 얼마나 벗어날지, 그리고 교사 개입과 특화 감독이 얼마나 자주 일어날지의 상한을 함께 조절할 수 있다. 연구진은 이를 '충돌에 적응하는 감독 신호'라고 불렀다. 학생과 교사의 판단이 어긋나는 곳에서만 강한 감독이 켜진다는 뜻이다. 감독 위치를 바꿔 본 대조 실험과 풀이 앞부분을 고정한 분석에서도 이 해석을 뒷받침하는 결과가 나왔다고 밝혔다.
효율 면에서는 추론 엔진 안에 투기적 검증기(speculative verifier)를 넣었다. 연구진에 따르면 이 검증기는 궤적 분포와 결합 방식을 그대로 유지하면서, 같은 작업량 기준으로 생성 처리량을 4.22배 높였다. 증류 과정에서 학생의 생성 단계는 계산 비용이 큰 부분이어서, 이 수치는 기법을 실제로 쓸 수 있는지와 직접 연결된다.
성능은 Mean@8과 Pass@8 지표로 평가했다. Mean@8은 한 문제에 답을 8번 생성했을 때의 평균 정답률이고, Pass@8은 8번 중 한 번이라도 맞힐 확률이다. 다만 초록에는 벤치마크 이름과 개선 폭이 적혀 있지 않아 구체적인 수치는 확인되지 않았다. 비교 대상도 '조건을 맞춘 교사 유도 방식'으로만 소개돼, 다른 증류 기법들과 비교한 결과는 초록만으로는 알 수 없다. 실험이 수학 추론에 한정됐다는 점도 함께 봐야 한다.
이 연구는 소형 모델을 효율적으로 키우려는 업계 흐름 위에 있다. 교사가 언제 개입하고 어떻게 가르칠지를 하나의 확률 틀 안에서 정리하려 했다는 점이 특징이다. 이 기사는 저자들이 공개한 초록을 바탕으로 정리했으며, 논문은 동료평가를 거치지 않은 사전공개 논문이다.