애플 "AI가 구조를 말로 풀면 얼마나 남나"…수식 '왕복 실험' 논문 공개
애플이 언어모델이 구조화된 정보를 자연어로 풀어 쓸 때 원래 내용이 얼마나 온전히 전달되는지를 측정하는 연구를 공개했다. 애플 머신러닝 리서치(Apple Machine Learning Research) 사이트에 29일(현지시간) 올라온 논문 「The Communication Bottleneck: A Round-Trip Study of Tree-Structured Expression Serialization in Language Models」(소통의 병목: 언어모델의 트리 구조 표현 직렬화에 관한 왕복 연구)의 초록을 보면, 연구진은 트리 구조의 수식을 문장으로 바꿨다가 다시 수식으로 되돌리는 '왕복(round-trip)' 방식의 평가 절차를 제안했다.
연구가 문제로 삼은 것은 언어모델이 추론하고 소통하는 방식 자체다. 언어모델은 사고사슬(chain-of-thought) 방식으로 단계를 밟아 추론하거나, 여러 모델이 자유 형식의 텍스트로 중간 결과를 주고받을 때 구조화된 정보를 자연어로 '직렬화'한다. 계층과 순서가 분명한 정보를 한 줄의 문장으로 펼쳐 놓는 셈이다. 초록은 이 과정을 일종의 병목으로 보고, 트리 구조를 가진 조합적 내용이 이 병목을 통과한 뒤에도 얼마나 살아남는지를 실험으로 확인하겠다고 밝혔다.
실험 방법은 비교적 단순하다. 먼저 규칙에 따라 자동으로 산술식을 만든다. '생성기' 역할을 맡은 모델이 이 수식을 문장제(word problem), 즉 말로 풀어 쓴 문제로 바꾼다. 이어 별도의 '추출기' 모델이 원래 수식은 보지 못한 채 문장제만 읽고 수식을 복원한다. 마지막으로 복원된 수식이 원래 수식과 수학적으로 같은지를 기호적 동치성(symbolic equivalence)으로 판정한다. 연구진은 이 판정 방식이 정확한 '오라클'(정답 판정 기준) 역할을 한다고 설명했다. 사람이 평가하거나 다른 AI가 채점할 때 생기는 주관성과 오차를 피하고, 정보가 보존됐는지를 맞고 틀림으로 명확하게 가를 수 있다는 뜻이다.
초록에 따르면 연구진은 16개 모델을 서로 짝지을 수 있는 모든 조합을 평가했다. 한 모델이 쓴 문장을 다른 모델이 읽고 복원하는 구조여서 모델 간 '소통 능력'을 비교할 수 있는 설계다. 다만 이번에 확인한 초록 요약은 평가 결과 대목에서 끊겨 있어, 모델별 성적이나 정보 손실 정도, 실험에 쓴 16개 모델이 무엇인지는 확인되지 않았다. 논문이 동료평가를 거쳤는지도 공개된 자료로는 확인되지 않았다.
이 연구는 AI 업계에서 쓰임이 늘고 있는 두 가지 흐름과 맞닿아 있다. 하나는 모델이 답을 내기 전에 중간 추론 과정을 글로 풀어 쓰게 하는 사고사슬 기법이고, 다른 하나는 여러 AI 모델이 역할을 나눠 텍스트로 협업하는 방식이다. 두 방식 모두 중간 단계를 자연어로 주고받는다는 전제를 깔고 있다. 그 과정에서 구조 정보가 새어 나간다면 최종 결과의 정확도에도 영향을 줄 수 있다. 연구진이 '병목'이라는 표현을 쓴 이유다. 이번 연구는 그 손실을 감으로 짐작하지 않고 정답이 분명한 산술식을 이용해 측정 가능한 문제로 바꿨다는 점에서 의미가 있다.
애플은 AI 연구 성과를 외부 논문 공유 플랫폼보다 자사 머신러닝 연구 사이트에 먼저 올리는 경우가 많다. 그래서 이 사이트는 공개적인 발언이 적은 애플의 AI 연구 방향을 엿볼 수 있는 창구로 꼽힌다. 이번 논문은 특정 제품이나 기능 발표가 아니라 언어모델의 추론과 소통 방식을 점검하는 기초 연구 성격이 강하다. 애플 제품에 어떻게 반영될지는 확인되지 않았다.