EverMind, 에이전트 '하네스'를 자동으로 만들고 엮는 오픈소스 시스템 'Raven' 논문 공개
AI 기업 EverMind가 여러 AI 에이전트의 작업 환경, 곧 '하네스(harness)'를 자동으로 만들고 개선하며 서로 엮어 쓰는 오픈소스 멀티 에이전트 생태계 'Raven'을 내놨다. 사전공개 논문 저장소 arXiv에 공개된 논문 「Raven: The Harness of Harnesses for Composable Agentic Intelligence」(arXiv:2609.33439)에 따르면, 연구진은 복잡하고 오래 걸리는 작업에서 Raven이 최신 에이전트 시스템보다 크게 앞섰다고 밝혔다. 이 논문은 연구자 커뮤니티 플랫폼 허깅페이스의 일일 논문 목록에서 추천 55회를 받았다.
하네스는 대규모언어모델(LLM)이 실제로 일을 하도록 감싸는 실행 틀을 말한다. 도구 호출 방식, 작업 절차, 기억 관리 같은 장치가 여기에 들어간다. 초록에서 연구진은 LLM이 발전하면서 AI 에이전트가 특정 분야의 단발성 작업을 넘어, 여러 분야에 걸친 긴 작업 흐름을 맡는 단계로 가고 있다고 진단했다. 이 과정에서 두 가지 문제가 생긴다고 봤다. 하네스가 복잡해질수록 사람이 손으로 설계하는 방식은 규모를 키우기 어렵고, 특정 분야에 맞춰 짤수록 하나의 하네스로 여러 분야를 다루기 어려워진다는 것이다. 그래서 연구진은 '한 분야에서 더 강한 하네스를 어떻게 만드느냐'에서 '분야별 하네스를 자동으로 만들고, 경험으로 개선하고, 분야를 넘나들며 조율하느냐'로 질문을 바꿔야 한다고 주장했다.
Raven은 특정 모델과 분야에 맞는 모듈형 하네스를 자동으로 만들고 발전시킨다. 실행할 수 있는 '모델-하네스' 한 쌍을 조합 가능한 지능의 기본 단위로 다루는 점이 특징이다. 연구진은 이를 바탕으로 '전 분야 협업 네트워크(All-Domain Collaboration Network)'를 구상했다. 중심에는 '호스트 에이전트'가 있다. 호스트 에이전트는 목표를 하위 작업으로 나누고, 각 작업에 맞는 전문 에이전트를 배정하며, 작업 사이의 실행 순서를 조율하고 결과를 하나로 합친다.
경험을 쌓는 장치도 들어갔다. 호스트 아카이브와 'EverOS'가 작업마다 얻은 경험을 보존하고, '스킬 포지(Skill Forge)'가 이 경험을 다시 쓸 수 있는 절차로 바꿔 제공한다. 한 번 풀어본 문제의 노하우를 다음 작업에서 꺼내 쓰는 구조다. 연구진은 이론적 분석도 내놨다. 같은 자원 예산 안에서 에이전트들을 조합했을 때, 개별 에이전트만으로 처리할 수 있는 범위보다 안정적으로 처리하는 작업 범위가 넓어지는 '충분조건'을 제시했다고 설명했다.
다만 초록에는 어떤 벤치마크에서 어느 시스템과 비교했는지, 성능 차이가 얼마인지 같은 구체적인 수치는 나와 있지 않다. '최신 에이전트 시스템을 크게 앞섰다'는 평가는 연구진 스스로 밝힌 것이며, 이 논문은 동료 평가를 거치지 않은 사전공개 논문이다. 오픈소스로 공개한다고 했지만, 코드 공개 범위와 라이선스 같은 세부 사항은 초록만으로는 확인되지 않았다.
이번 연구는 AI 에이전트 경쟁의 초점이 모델 성능에서 모델을 둘러싼 실행 구조로 옮겨가는 흐름 위에 있다. 사람이 하네스를 일일이 설계하던 방식을 자동 생성과 경험 축적, 에이전트 간 조합으로 대신하려는 시도다. 이 접근이 실제 업무 환경에서도 통할지는 검증 결과가 더 나와야 판단할 수 있다.