애플 "강한 AI 에이전트에 복잡한 '하네스'가 얼마나 필요한가"… ML 엔지니어링 자동화 논문 공개
애플이 머신러닝(ML) 엔지니어링을 스스로 수행하는 AI 에이전트에 복잡한 보조 장치가 얼마나 필요한지 따져 보는 논문을 내놨다. 애플 머신러닝 연구 사이트(Apple Machine Learning Research)에 따르면 애플은 1일(현지시간) 「How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering?(강한 에이전트는 자율 ML 엔지니어링에 얼마나 많은 하네스가 필요한가?)」 논문을 이 사이트에 공개했다.
'하네스(harness)'는 대형언어모델(LLM)을 감싸 작업을 나누고 도구를 연결하고 실행 흐름을 관리하는 외부 구조를 가리킨다. 논문 제목은 성능이 좋아진 에이전트에도 이런 구조를 계속 덧붙여야 하는지를 묻는다.
공개된 초록을 보면 연구진은 먼저 업계 상황부터 짚었다. 최근 자율 ML 엔지니어링(MLE) 에이전트는 공개 리더보드에서 성과를 크게 끌어올렸다. 그런데 이 에이전트들은 점점 더 정교한 장치 위에서 돌아가고 있다. 여러 에이전트를 지휘하는 '멀티에이전트 오케스트레이터', 정보 검색만 따로 맡는 '검색 전용 하위 에이전트' 같은 것들이다. 초록은 이런 구조가 늘어난 이유로 두 가지를 든다. 긴 작업 주기를 거치는 동안 성능 개선이 멈추는 문제, 그리고 LLM이 쓸 수 있는 기본 기능(프리미티브)이 제한적이라는 점이다.
연구진이 주목한 것은 그 반대편이다. 초록은 하네스가 커지는 사이 "더 원시적이지만 개선된 코딩 에이전트"는 학계에서 거의 다뤄지지 않았다고 지적했다. LLM이 파일 읽기(read)·쓰기(write)와 배시(bash) 명령만으로 실행 환경에 직접 접근하는 방식이다. 별도의 지휘 체계나 전용 하위 에이전트 없이 모델이 코드를 읽고 고치고 실행하는 단순한 구조를 말한다.
이 질문이 나온 배경에는 모델 성능의 빠른 향상이 있다. 초기 LLM 에이전트는 혼자서는 긴 작업을 끝까지 해내기 어려웠다. 그래서 개발자들은 작업을 잘게 나누고 역할별로 에이전트를 따로 두는 식으로 약점을 메웠다. 하지만 기반 모델의 코딩·추론 능력이 좋아지면 과거의 약점을 메우려고 만든 복잡한 장치가 여전히 필요한지, 오히려 짐이 되는지 다시 따져 볼 필요가 생긴다. 이번 논문은 데이터 처리, 모델 학습, 실험 반복 등 ML 엔지니어링 업무를 그 시험대로 삼은 것으로 보인다.
다만 공개된 초록 요약에는 연구진이 어떤 모델과 벤치마크로 실험했는지, 단순한 코딩 에이전트가 복잡한 하네스를 쓴 에이전트와 비교해 어떤 결과를 냈는지는 담겨 있지 않다. 결론과 구체적 수치는 확인되지 않았다. 이 논문이 동료평가를 거쳤는지, 학회 발표용인지도 밝혀지지 않았다.
애플은 연구 성과를 논문 공유 플랫폼보다 자사 머신러닝 연구 사이트에 먼저 올리는 경우가 많다. 그래서 이 사이트는 애플의 AI 연구 방향을 엿볼 수 있는 창구로 꼽힌다. 이번 논문은 에이전트 구조를 더 복잡하게 쌓기보다 강해진 모델에 실행 환경을 직접 맡기는 단순한 방식의 가능성을 다시 살펴본다는 점에서, AI 에이전트 설계 방향을 둘러싼 논의에 참고가 될 전망이다.