기사 검색

이슈부터 IT·AI·연예·게임까지, 메타브리프의 기사를 찾아보세요.

AI

"32B 모델도 마라티어로 풀면 영어 10B 수준"…덴마크 연구진, 다국어 수학 데이터셋으로 언어 간 능력 전이 요인 분석

대형언어모델(LLM)이 한 언어에서 익힌 능력이 다른 언어로 얼마나 옮겨 가는지, 그리고 그 정도를 무엇이 좌우하는지를 수치로 분석한 연구가 나왔다. 사전공개 논문 저장소 arXiv에 따르면, 덴마크 연구 그룹 Danish Foundation Models 소속 케네스 에네볼센(Kenneth Enevoldsen) 등 25명은 「Multilingual GSM-Symbolic: What determines capability transfer across languages?」 논문을 공개했다. 저자들이 공개한 초록을 보면, 언어별 성능을 가장 크게 좌우한 요인은 모델 크기였다. 이어 해당 언어의 자원 수준, 추론 기능, 언어 유형론적 거리 순이었다.


연구진은 분석을 위해 'Multilingual GSM-Symbolic'이라는 다국어 수학 데이터셋을 새로 만들었다. 15개 언어에 걸쳐 언어끼리 문항이 1대1로 대응되는 질문·답변 3만 쌍으로 구성됐다. 기호 템플릿 방식을 적용해 예제 하나에서 수백만 개의 변형 문제를 만들 수 있다. 모델이 특정 문제를 외워 점수를 올리는 과적합을 막고, 진짜 일반화 능력을 측정하기 위한 설계다. 연구진은 언어를 계속 추가할 수 있는 확장형 데이터셋이라는 점도 강조했다.


이 연구가 나온 배경에는 다국어 평가 방식의 한계가 있다. 연구진은 언어 간 능력 전이에 대해 알려진 것이 많지 않다고 지적했다. 기존 평가는 서로 비교하기 어렵고 금세 점수가 포화되는 데이터셋에 의존해 왔고, 전이를 결정하는 요인들을 함께 검토한 사례도 드물었다는 설명이다. 어떤 요인이 전이를 예측하는지 알면 모든 언어 조합을 일일이 평가하지 않아도 된다. 개발자는 저자원 언어의 성능을 떨어뜨리는 요인을 골라 개선할 수 있다. 데이터가 적은 언어일수록 모델 성능이 처진다는 문제를 정량적으로 접근하려는 시도인 셈이다.


분석 결과 각 요인의 회귀계수(β)는 모델 크기 1.77, 언어 자원 수준 0.77, 추론 0.67, 유형론적 거리 -0.25였다. 여러 요인을 한꺼번에 추정했기 때문에 한 요인의 효과를 다른 요인으로 환산할 수도 있다. 연구진이 든 예에 따르면, 320억(32B) 파라미터 모델을 인도 마라티어로 평가하면 영어로 평가한 100억(10B) 파라미터 모델과 비슷한 성능을 낸다.


모델 개발 측면에서도 시사점이 있다. 모델 크기를 키우고 추론 기능을 더하면 저자원 언어와 고자원 언어 사이의 성능 격차가 줄었다(각각 β=-0.27, β=-0.20). 다만 영어 등과 유형론적으로 거리가 먼 언어에서는 같은 방법이 거의 효과가 없었다. 모델 규모를 키우거나 추론을 강화하는 일반적인 방법만으로는 언어 구조가 크게 다른 언어의 성능을 끌어올리기 어렵다는 뜻으로 읽힌다.


연구진이 만든 분석 틀은 언어 간 성능 차이의 92%를 설명했다. 그러나 특정 모델과 특정 언어의 조합에서 생기는 차이는 23%만 설명했다. 이 틀로 학습에 쓰지 않은 언어에서의 모델 성능을 예측하자 오차는 6.0%포인트 이내였고 상관계수는 0.96이었다. 대상 언어의 템플릿 10개만 측정에 추가하면 오차는 4.19%포인트로 줄었다. 평가용 데이터가 거의 없는 언어에서도 성능을 어느 정도 추정할 수 있다는 의미다.


이 논문은 연구자 커뮤니티 플랫폼 허깅페이스의 일일 논문 목록에서 추천 41회를 받았다. 동료평가를 거치지 않은 사전공개 논문이며, 이 기사는 초록 내용을 바탕으로 했다. 15개 언어에 한국어가 들어 있는지, 실험에 어떤 모델이 쓰였는지는 초록에서 확인되지 않았다.