기사 검색

이슈부터 IT·AI·연예·게임까지, 메타브리프의 기사를 찾아보세요.

AI

MS 연구진 "AI 에이전트 학습 시나리오도 함께 진화해야"…'액티브새들러' 논문 공개

마이크로소프트(Microsoft) 소속 연구진이 대규모언어모델(LLM) 에이전트의 '하네스(harness)'를 자동으로 최적화할 때 학습 시나리오를 고정하지 않고 상황에 맞게 바꿔 주는 기법 '액티브새들러(ActiveSaddler)'를 내놨다. 사전공개 논문 저장소 arXiv에 올라온 논문(arXiv:2610.00906)에 따르면, 이 기법은 두 가지 에이전트 벤치마크에서 기존 방식보다 테스트 정답률(Pass@1)을 각각 4.4%포인트와 7.5%포인트 끌어올렸다.


논문 제목은 「ActiveSaddler: Automated Curriculum Learning for Agent Harness Optimization」이다. 박성호(Sungho Park) 등 11명이 공동 저자로 참여했다. 연구자 커뮤니티 플랫폼 허깅페이스의 일일 논문 목록에서는 추천 26회를 받았다. 동료평가를 거치지 않은 사전공개 논문이고, 이 기사는 저자들이 공개한 초록을 토대로 정리했다.


하네스는 LLM 에이전트를 감싸고 움직이게 하는 장치를 통틀어 부르는 말이다. 프롬프트, 도구 인터페이스, 제어 로직 등이 여기에 들어간다. 같은 모델이라도 하네스를 어떻게 짜느냐에 따라 성능이 크게 달라질 수 있다. 그래서 에이전트를 실제로 돌려 보고 그 결과(실행 피드백)에 맞춰 하네스를 반복 수정하는 '자동 하네스 최적화'가 주목받고 있다.


연구진은 기존 방법들의 빈틈을 짚었다. 지금까지는 하네스를 '어떻게' 고칠지에 주로 집중했고, 피드백을 만들어 내는 학습 시나리오, 곧 '무엇으로' 연습시킬지는 대체로 고정해 뒀다는 것이다. 하네스가 개선될수록 다음 개선에 가장 쓸모 있는 시나리오도 바뀔 수 있는 만큼, 학습 순서(커리큘럼)도 하네스와 함께 바뀌어야 한다는 게 연구진의 주장이다. 사람으로 치면 실력이 늘수록 연습 문제를 바꿔 주는 셈이다. 연구진은 이 문제를 '자동 커리큘럼 학습'으로 정의했다.


액티브새들러는 변하는 커리큘럼을 '비정상(non-stationary) 밴딧' 문제로 다룬다. 밴딧은 여러 선택지 중 무엇을 고를지 결과를 보며 조정해 나가는 의사결정 틀이다. 비정상이라는 말은 선택지별 가치가 시간에 따라 변한다는 뜻이다. 이 기법은 에이전트가 반복해서 저지르는 실패를 재사용할 수 있는 '실패 패턴'으로 묶고, 각각을 하나의 선택지로 삼는다. 그런 다음 패턴마다 더 공략했을 때 얻을 수 있는 학습 진전을 추정해, 이미 아는 약점을 다시 공략할지 아직 보지 못한 시나리오를 탐색해 새 약점을 찾을지를 저울질한다. 최적화 결과가 나올 때마다 발견된 실패 패턴 목록과 우선순위가 함께 갱신되기 때문에 커리큘럼이 하네스와 함께 진화한다고 연구진은 설명했다.


성능 검증에는 에이전트 벤치마크인 GAIA2와 Terminal-Bench 2.0이 쓰였다. 비교 대상은 똑같은 하네스 최적화기에 시나리오 순서만 최적화 전에 고정해 둔 방식이었다. 그 결과 액티브새들러는 두 벤치마크 모두에서 더 강한 하네스를 꾸준히 찾아냈고, Pass@1은 GAIA2에서 4.4%포인트, Terminal-Bench 2.0에서 7.5%포인트 높았다. 구성 요소를 하나씩 빼 보는 절제(ablation) 실험에서는 최적화 목표를 동적으로 구성하는 것, 목표별 효용 변화를 추정하는 것, 기존 약점 공략과 새 실패 발견 사이에서 균형을 잡는 것이 모두 성능 향상에 필요한 것으로 나타났다.


연구진은 자동 커리큘럼 학습이 하네스 최적화에서 중요한 새 축이 될 수 있다고 결론 내렸다. 다만 초록에는 절대 성능 수치, 최적화에 든 연산 비용, 사용한 기반 모델 등은 나와 있지 않다. 코드 공개 여부나 마이크로소프트 제품에 적용할지도 확인되지 않았다.