기사 검색

이슈부터 IT·AI·연예·게임까지, 메타브리프의 기사를 찾아보세요.

AI

언어모델 답변 속 '의심'을 토큰 단위로 본다…다름슈타트공대, 불확실성 측정 기법 'U-Space' 공개


독일 다름슈타트공과대학교(Technical University of Darmstadt) 멀티모달 AI 연구실(Multimodal AI Lab) 연구진이 대규모 언어모델이 답변을 만들면서 언제, 왜 불확실해지는지를 내부 상태에서 직접 읽어내는 기법을 내놨다. 논문 사전공개 플랫폼 arXiv에 올라온 「U-Space: Uncovering When and Why Uncertainty Arises in Language Models」(arXiv:2610.09087)의 저자 초록에 따르면, 연구진은 모델 내부에 불확실성을 측정할 수 있는 저차원 부분공간 'U-Space'를 정의했다. 이 방법은 정답 라벨이나 반복 생성, 별도 학습 없이도 기존 기법보다 신뢰도를 더 잘 추정했다고 한다.


논문은 토비아스 브라운(Tobias Braun) 등 7명이 함께 썼다. 연구자 커뮤니티 플랫폼 허깅페이스의 일일 논문 목록에서는 추천 29회를 받았다. 동료평가를 거치지 않은 사전공개 논문이며, 이 기사는 저자가 공개한 초록을 바탕으로 정리했다.


연구진이 이 문제를 다룬 배경은 언어모델이 점점 더 중요한 결정에 쓰이고 있다는 데 있다. 오류가 낳는 결과가 커질수록 '이 답변 하나를 얼마나 믿을 수 있는가'라는 물음을 피하기 어려워진다. 그런데 언어모델은 틀린 결론도 매끄러운 설명과 단정적인 어조로 내놓는 경우가 많아, 사용자가 언제 모델의 답을 그대로 받아들이지 말아야 할지 판단하기 어렵다. 불확실성 정량화(Uncertainty Quantification)는 개별 예측이 얼마나 믿을 만한지를 추정해 이 간극을 메우려는 연구 분야다.


연구진은 기존 방법의 한계도 짚었다. 상당수는 같은 질문에 답을 여러 번 생성하게 하거나 별도로 학습한 구성요소가 필요하다. 결과도 숫자 하나로만 나와서 불확실성이 답변의 어느 지점에서 생기고 추론 과정에서 어떻게 바뀌는지는 알려주지 않는다. 최근 연구에서는 생성된 답변의 길이 자체가 불확실성 추정치나 정답 여부와 강하게 연관된다는 결과도 나왔다. 기존 추정 기법의 예측력 가운데 얼마가 진짜 불확실성 정보에서 오고 얼마가 단순히 답변 길이에서 오는지 따져봐야 한다는 것이다.


연구진은 해법을 기계적 해석가능성(Mechanistic Interpretability)에서 찾았다. 사람이 이해할 수 있는 개념을 모델의 중간 내부 상태와 연결하는 연구 분야다. 초록에 따르면 연구진은 먼저 '의심'과 '확신'을 나타내는 의미적 기준점(semantic anchor)을 정했다. 이어 이 단어들의 언임베딩(unembedding) 방향, 즉 모델이 내부 표현을 단어로 바꿀 때 쓰는 방향을 잔차 공간(residual space)으로 되돌려 대응시켰다. 그다음 두 개념 사이의 대비를 결합해 서로 직교하는 기저(basis)를 만들었다. 이렇게 만든 저차원 공간이 U-Space다.


함께 제안한 'U-Lens'는 모델이 토큰을 하나씩 만들 때마다 그 내부 상태를 U-Space 기저 벡터에 투영한다. 그러면 토큰 단위로 불확실성이 어떻게 분포하는지 보여주는 지도가 나온다. 연구진은 이 지도를 직접 들여다볼 수도 있고, 합산해 하나의 불확실성 점수로 쓸 수도 있다고 설명했다. 답변의 어느 부분에서 모델이 흔들렸는지 짚어볼 수 있다는 점이 숫자 하나만 내놓는 기존 방식과 다르다.


성능 면에서 연구진은 여러 추론 벤치마크에서 U-Space 기반 신뢰도 점수가 기존 기준 기법들보다 좋은 결과를 냈다고 밝혔다. 일반 평가뿐 아니라 답변 길이의 영향을 통제한 평가에서도 마찬가지였다고 한다. 또 정답 데이터로 학습시킨 지도학습 방식 추정기보다 다른 조건으로 옮겨 썼을 때 더 안정적으로 작동했다고 덧붙였다. 다만 초록에는 구체적인 수치와 실험에 쓴 모델·벤치마크 이름이 나오지 않아 개선 폭은 확인되지 않았다. 연구진은 코드를 깃허브(github.com/s2labres/U-Space)에 공개했다.