기사 검색

이슈부터 IT·AI·연예·게임까지, 메타브리프의 기사를 찾아보세요.

AI

BAAI, 스스로 답을 고쳐 나가는 AI 에이전트 'AREX-2' 논문 공개

중국 베이징인공지능연구원(BAAI) 연구진이 대형언어모델(LLM) 에이전트의 '자기 개선' 능력을 높이는 학습 방법을 담은 논문을 내놨다. 사전공개 논문 저장소 arXiv에 올라온 「AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks」의 저자 초록에 따르면, 연구진은 머신러닝과 알고리즘 프로그래밍 과제에서 긴 개선 과정을 합성 데이터로 만들었다. 이 데이터로 학습한 에이전트는 학습 영역 밖인 딥리서치 과제에서도 높은 점수를 냈다. Hongjin Qian 등 14명이 쓴 이 논문은 연구자 커뮤니티 플랫폼 허깅페이스의 일일 논문 목록에서 추천 45회를 받았다.


연구진은 자기 개선 능력을 '테스트 시점에 해법을 반복해서 다듬는 능력'으로 정의했다. 이 능력은 두 가지로 나뉜다. 하나는 지금보다 나은 해법을 만들어 내는 '반성(reflection)'이고, 다른 하나는 반복이 여러 라운드 이어져도 효과가 떨어지지 않게 하는 '장기 실행(long-horizon execution)'이다. 연구진은 두 능력이 특정 분야에 묶이지 않는다고 가설을 세웠다. 그렇다면 지도학습을 하기 좋은 분야에서 익힌 능력을 다른 분야에도 옮겨 쓸 수 있다는 것이다.


학습 분야로는 머신러닝 과제와 알고리즘 프로그래밍을 골랐다. 연구진은 두 분야를 고른 이유로, 결과가 맞았는지 검증할 수 있는 피드백이 있고 꾸준히 반복할수록 성과가 오른다는 점을 들었다. 모델이 짠 코드는 실제로 돌려 점수나 정답 여부를 확인할 수 있다. 그래서 '이전보다 나아졌는가'를 객관적으로 판정하기 쉽다.


에이전트는 Qwen3.8-27B를 기반으로 만들었다. 초록에 따르면 학습 분야와 같은 계열의 평가에서 MLE-bench Lite 81.8점, Frontier-CS 70.7점을 기록했다. 학습하지 않은 딥리서치 분야로도 성능이 이어졌다는 게 연구진의 설명이다. 웹 탐색 능력을 보는 BrowseComp에서 84.0점, 고난도 지식 문제로 이뤄진 HLE에서 52.6점, 범용 AI 비서 평가인 GAIA에서 92.2점, DeepSearchQA에서 93.8점을 얻었다. 연구진은 개선 라운드 예산을 늘릴수록 성능이 계속 올랐다고도 밝혔다. 다만 초록에는 다른 모델과 비교한 수치나 기존 최고 성능 대비 순위가 나오지 않는다. 이 점수가 동급에서 어느 수준인지는 초록만으로는 확인되지 않았다.


이번 연구는 최근 AI 업계에서 커지는 흐름과 맞닿아 있다. 모델을 더 크게 키우는 대신, 답을 내는 시점에 연산을 더 들여 결과를 끌어올리는 이른바 '테스트 시점 확장'이다. 에이전트가 한 번에 정답을 내지 못해도 스스로 결과를 점검하고 고치는 과정을 길게 이어 갈 수 있다면 복잡한 과제를 더 잘 풀 수 있다. 다만 오래 반복할수록 방향을 잃거나 개선이 멈추는 문제가 그동안 걸림돌로 꼽혀 왔다. AREX-2는 이 문제를 데이터로 풀려고 했다. 검증이 쉬운 코딩 분야에서 '오래, 꾸준히 고쳐 나가는 경험'을 학습시키면 그 습관이 정보 검색이나 조사 같은 다른 분야에도 옮겨 간다는 주장이다. 연구진은 결론에서 "장기적 반성 데이터가 자기 개선 에이전트로 가는 효과적인 경로"라고 밝혔다.


이 논문은 동료평가를 거치지 않은 사전공개 논문이다. 위 내용은 저자가 공개한 초록을 정리한 것이어서 구체적인 실험 설계와 학습 데이터 규모, 재현 가능성은 검증되지 않았다. 논문 번호는 arXiv:2609.38288이다.