처음 보는 게임 규칙, AI 에이전트는 얼마나 배울까…싱가포르국립대 'Learn2Play Bench' 공개

대규모언어모델(LLM) 에이전트가 처음 보는 환경에서 경험을 쌓으며 얼마나 잘 배우는지 측정하는 벤치마크가 나왔다. 사전공개 논문 저장소 arXiv에 올라온 논문에 따르면, 싱가포르국립대(National University of Singapore) 소속 Yibo Li 등 연구자 7명이 'Learn2Play Bench'를 개발하고 이를 활용한 평가 결과를 공개했다. 논문 번호는 arXiv:2610.08215다. 이 논문은 연구자 커뮤니티 플랫폼 허깅페이스의 일일 논문 목록에서 추천 32회를 받았다. 다만 동료평가를 거치지 않은 사전공개 논문이다.
연구진은 기존 평가 방식으로는 LLM 에이전트의 '경험 학습' 능력을 제대로 가려내기 어렵다고 봤다. 에이전트가 낯설고 계속 바뀌는 환경에 적응하려면 경험에서 배우는 능력이 꼭 필요하다. 기존 벤치마크도 이 능력을 측정하려 했다. 그러나 대부분 규칙을 지시문에 미리 알려주거나 사전학습 모델이 이미 잘 아는 과제를 다뤘다. 이래서는 에이전트가 상호작용을 통해 새로 배운 것인지, 원래 알던 지식으로 추론한 것인지 구분하기 어렵다는 것이 연구진의 문제의식이다.
이를 해결하기 위해 연구진은 텍스트 기반 게임을 새로 설계했다. 게임 규칙은 새롭거나 직관에 어긋나도록 만들었다. 사전학습 지식에만 기대서는 풀 수 없고, 직접 해보면서 규칙을 익혀야 하는 구조다. 게임은 매번 같은 피드백을 돌려주고 점수도 자동으로 매긴다. 덕분에 여러 번 반복해서 도전할 때 실력이 얼마나 늘어나는지 통제된 조건에서 비교할 수 있다. 연구진은 게임 인스턴스도 다양하게 바꿨다. 한 판에서 배운 것을 새로운 상황에도 적용할 수 있는지 확인하기 위해서다.
연구진은 이 벤치마크로 백본 모델, 자기진화(self-evolving) 기법, 에이전트 하네스(모델을 감싸 작동시키는 실행 체계)가 에이전트의 학습 능력에 어떤 영향을 주는지 평가했다. 그 결과 세 가지 발견을 제시했다.
첫째는 '경험 보존'이다. 행동과 피드백 기록을 빠짐없이 남겨두는 편이 경험을 규칙이나 전략으로 요약해 저장하는 것보다 더 효과적인 학습으로 이어질 수 있다는 것이다. 둘째는 사람과 에이전트의 격차다. 상위권 인간 플레이어의 최고 점수는 평가 대상 에이전트들보다 높았다. 사람은 더 다양한 전략을 시도했고 같은 행동을 덜 반복했다. 셋째는 '하네스의 중요성'이다. 백본 모델을 그대로 두고 하네스만 바꿔도 성능은 오르고 추정 추론 비용은 내려갈 수 있었다.
이번 결과는 최근 에이전트 개발의 흐름과 맞닿아 있다. 경험을 요약해 기억하는 방식에 다시 생각해볼 지점이 있다는 것, 그리고 모델 자체만큼 이를 운용하는 구조도 중요하다는 것이다. 하네스 개선만으로 성능과 비용을 함께 잡을 수 있다면, 더 큰 모델을 쓰지 않고도 에이전트 성능을 끌어올릴 여지가 있다는 뜻으로 읽힌다. 다만 공개된 초록에는 어떤 백본 모델을 평가했는지, 사람과 에이전트의 점수 차이가 구체적으로 얼마인지는 나와 있지 않아 확인되지 않았다. 연구진은 별도 프로젝트 웹사이트(https://liushiliushi.github.io/learn2play-bench-website/)도 공개했다.