기사 검색

이슈부터 IT·AI·연예·게임까지, 메타브리프의 기사를 찾아보세요.

AI

"AI 동반자는 사람을 얼마나 이해하나"…실제 대화 2만7천 건으로 만든 벤치마크 'RealCompanion' 공개

몇 달씩 사람과 대화하는 AI 동반자(컴패니언)가 상대를 실제로 얼마나 이해하는지 평가하는 벤치마크가 나왔다. 사전공개 논문 저장소 arXiv에 공개된 논문에 따르면, Quis Lab 소속 아르만 베남(Arman Behnam) 등 연구진 3명은 실제 사람과 AI 동반자의 장기 대화 기록으로 만든 벤치마크 'RealCompanion'을 발표했다. 연구진은 실제 기록을 분석해 보니 과거 대화가 필요한 경우는 드물었고, 기존 평가 방식은 AI의 기억 능력을 부풀려 보이게 할 수 있다고 밝혔다.


연구진이 문제 삼은 것은 기존 벤치마크의 구조다. 사람을 오래 상대하는 AI라면 상대가 한 말을 기억하고, 그가 어떤 사람인지 추론하고, 지금 받은 메시지에 과거 대화가 언제 관련되는지 알아야 한다. 이를 검증하려면 실제 사람의 대화 기록이 필요하지만 이런 기록은 사생활 정보라 공개하기 어렵다. 그래서 기존 벤치마크는 가상의 인물과 질문을 만들어 쓰고, 무엇이 중요한지도 미리 정해 두는 경우가 많았다는 것이 연구진의 설명이다.


RealCompanion에는 실제 사용자 10명이 AI 동반자와 맺은 관계가 담겼다. 최장 120일 동안 오간 메시지 2만7218건이다. 연구진은 대화 원본과 함께 이를 바탕으로 만든 파일 4종도 공개했다. 프로필, 페르소나, 대화 정답 레이블, 질문 세트이며, 각 파일에는 근거가 된 메시지가 표시돼 있다. 대화 레이블마다 그 레이블을 도출한 추론 과정이 붙어 있고, 이 과정은 단계별로 실제 대화와 대조해 검증했다고 한다.


연구진은 세 가지 결과를 내놨다. 첫째, 과거 대화가 필요한 경우는 드물고, 필요할 때는 대개 오래전 대화였다. 연구진은 전체를 뭉뚱그린 지표가 착시를 일으킨다고 지적했다. 최근 대화만 보는 방식으로도 전체 검증 질의의 95.9%에서 필요한 메시지를 찾았지만, 실제로 기억이 필요한 질의에서는 성공률이 2.2%에 그쳤다. 또 실제 대화에서 나타나는 비율 그대로 따져 보면, 기록된 증거를 넣어줬을 때 생긴 성능 향상의 96%는 애초에 기억이 필요 없는 메시지에서 나왔다. 성적이 올라도 기억 능력이 좋아졌다고 보기 어렵다는 뜻이다.


둘째, 실제 메시지를 두고 기억이 필요한 순간을 가려내는 데 성공한 탐지기는 연구진이 시험한 것 중 하나도 없었다. 같은 대화 기록에 사람이 질문을 따로 써 넣으면 질문 안에 '기억을 꺼내라'는 단서가 새어 들어갔다. 같은 메시지에 '기억'이라는 표시를 붙이기만 해도 모델이 그 메시지를 활용하는 비율이 10~14%포인트 올랐다. 인위적으로 만든 질문으로 평가하면 AI의 기억 능력이 실제보다 좋게 나올 수 있다는 의미다.


셋째, 대화를 바탕으로 사용자의 페르소나를 재구성하는 과제에서 에이전트 시스템 세 종은 F1 점수가 같았지만 비용은 최대 31배 차이가 났다. 비싼 시스템이 더 정확하게 사용자를 파악하지는 않았다는 것이다. 논문 초록에는 이들 에이전트 시스템의 구체적인 이름이 나와 있지 않다.


AI 동반자 서비스는 장기 기억을 앞세워 '나를 기억하는 AI'를 내세우고 있다. 이번 연구는 그 기억 능력을 측정하는 방식부터 따져 봐야 한다는 문제를 제기했다. 다만 데이터가 10명의 관계에 한정돼 있어 결과를 얼마나 일반화할 수 있는지는 후속 검증이 필요하다. 이 논문은 동료평가를 거치지 않은 사전공개 논문이며, 연구자 커뮤니티 플랫폼 허깅페이스의 일일 논문 목록에서 추천 187회를 받았다. 논문 번호는 arXiv:2610.01780이다.