기사 검색

이슈부터 IT·AI·연예·게임까지, 메타브리프의 기사를 찾아보세요.

AI

"트랜스포머는 너무 일찍 생각을 멈춘다"… 초소형 LoRA 하나로 참조 추적 정확도 15%→99%

대형 언어모델이 문맥 안의 참조를 몇 단계 따라가다 멈추는 이유가 모델 능력 부족이 아니라, 이미 갖춘 연산 능력을 다 쓰지 못하기 때문이라는 연구가 나왔다. Zehao Jin 등 연구자 3명은 사전공개 논문 저장소 arXiv에 「Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It(트랜스포머는 너무 일찍 생각을 멈추며, 작은 LoRA가 이를 고친다)」를 공개했다. 저자들이 공개한 초록에 따르면, 모델의 가중치는 모두 고정한 채 초기 층 하나에 아주 작은 어댑터만 붙여도 참조를 따라가는 거리가 크게 늘었다. 이 논문은 연구자 커뮤니티 플랫폼 허깅페이스의 일일 논문 목록에서 추천 54회를 받았다.


연구진이 다룬 과제는 문맥 속 참조를 연달아 따라가는 일이다. 한 줄이 앞의 다른 줄을 가리키고, 그 줄이 또 다른 줄을 가리키는 사슬을 끝까지 추적해 답을 찾아야 한다. 초록에 따르면 사전학습된 트랜스포머는 이 과제에 자기 깊이(층 수)를 거의 활용하지 못했다. 기본 모델 13종을 시험한 결과 안정적으로 따라간 사슬은 1.4~3.6줄에 그쳤다. 사전학습 단계에서 루프(반복 연산)를 더해도 개선 폭은 작았다.


연구진의 해법은 랭크 8짜리 LoRA다. LoRA는 원래 가중치는 그대로 두고 작은 보조 행렬만 학습하는 경량 미세조정 기법으로, 랭크 8이면 매우 작은 규모에 속한다. 연구진은 이 LoRA를 과제에 맞춰 학습시켜 초기 층 한 곳에만 붙였다. 그러자 알리바바의 Qwen3-8B는 24줄짜리 사슬에서 완전일치 정확도가 15.5%에서 99%로 올랐다. 더 오래 학습한 LoRA를 쓰면 50줄까지 추적했다. 반복 연산 구조인 Ouro-1.4B는 루프를 네 번 돌렸을 때 60줄, 여덟 번 돌렸을 때는 최소 160줄까지 따라갔다.


연구진은 성능이 오른 이유도 분석했다. 초록은 LoRA가 일종의 '릴레이'를 시작한다고 설명한다. 프로그램의 각 줄이 자신이 어느 사슬에 속하는지를 중간 층 몇 개를 거치며 다음으로 넘겨주고, 고정된 어텐션 헤드들은 층을 지날수록 사슬의 더 앞쪽을 읽어낸다. 상위 줄(parent line)을 향한 어텐션을 제거하면 이 릴레이가 멈췄다. 연구진은 이를 근거로 새로운 연산 회로를 만든 것이 아니라 모델 안에 이미 있던 회로를 더 길게 돌린 것이라고 해석한다.


실용적인 결과도 함께 제시됐다. 연구진은 가중치를 고정한 모델에서 측정만으로 'LoRA를 붙여 효과를 볼 수 있는 마지막 층'의 위치를 추정하는 방법을 내놓았다. 학습에 쓰지 않은 모델 4종 가운데 3종에서 이 추정이 허용 오차 안에 들었다. 과제별로 학습한 LoRA는 여러 단계 추론이 필요한 질의응답 벤치마크 MuSiQue 성능도 끌어올렸다고 초록은 밝혔다. 다만 개선 폭이 구체적으로 얼마인지는 초록에 나와 있지 않다.


연구진은 "모델이 기본으로 내놓는 답은 아주 작은 수정만으로 끌어낼 수 있는 연산 능력을 과소평가한다"고 결론 내렸다. 그동안 언어모델의 다단계 추론 한계는 모델 크기를 키우거나 사고 과정을 길게 생성하는 방식으로 보완하는 경우가 많았다. 이 연구는 모델 내부에 쓰이지 않은 연산 여력이 있고, 이를 적은 비용으로 꺼낼 수 있다는 가능성을 보여준다. 연구진은 코드와 인터랙티브 데모를 프로젝트 페이지에 공개했다.


다만 이 논문은 동료평가를 거치지 않은 사전공개 논문이다. 이 기사는 저자가 공개한 초록을 바탕으로 정리한 것으로, 실험의 세부 설정이나 다른 과제에서도 같은 결과가 나오는지는 확인되지 않았다. 논문 번호는 arXiv:2609.36585다.