애플, 장기 작동 AI 에이전트 훈련·평가용 실행 기반 'SCLATE' 논문 공개
애플이 9월 30일 자사 머신러닝 연구 사이트 'Apple Machine Learning Research'에 논문 「SCLATE: A Substrate for Continual-Learning Agent Training and Evaluation」을 올렸다. 제목은 '지속학습 에이전트의 훈련과 평가를 위한 기반'이라는 뜻이다. 공개된 초록을 보면, 이 논문은 여러 세션에 걸쳐 오래 작동하는 AI 에이전트를 시험하고 학습시키는 데 쓰는 공통 실행 환경 'SCLATE'를 제안한다.
초록에서 말하는 '지속학습 에이전트'는 단일 모델이 아니다. 모델과 하네스(모델을 감싸 실제 작업을 수행하게 하는 실행 틀), 메모리가 함께 묶인 시스템이다. 이런 에이전트는 대화 한 번으로 끝나지 않는다. 여러 세션을 오가며 긴 시간 동안 작동한다. 그래서 평가하거나 훈련하려면 과제만 주어서는 부족하다. 세션 종료와 재시작, 정해진 시각에 실행되는 예약 작업(크론), 쌓인 기억을 정리하는 메모리 통합 같은 '에이전트 쪽 사건'을 과제 사이사이에 끼워 넣어야 한다.
논문은 기존 도구의 한계를 여기서 찾는다. 지금의 벤치마크와 훈련 프레임워크는 벤치마크 자체의 사건만 일정에 넣는다. 그 결과 벤치마크와 에이전트를 짝지을 때마다 연구자가 맞춤형 스케줄링 루프를 따로 만들어야 했다는 것이다. 벤치마크 하나에 에이전트 여럿을 시험하거나 에이전트 하나를 여러 벤치마크에 돌리려면 조합마다 같은 작업을 되풀이해야 하는 구조다.
SCLATE는 이 부분을 하나로 묶는다. 초록에 따르면 벤치마크와 에이전트가 각자 어댑터를 통해 자신의 사건을 하나의 공개 이벤트 스케줄러에 등록한다. 애플은 에이전트를 '수정하지 않은 상태'로 쓸 수 있다는 점을 강조했다. 이미 만들어진 에이전트의 내부를 고치지 않고 어댑터만 붙이면 같은 환경에서 평가하고 훈련할 수 있다는 뜻이다.
초록은 '하이브리드 시뮬레이션 시계(hybrid simulated clock)'도 언급한다. 다만 제공된 초록이 이 대목에서 끊겨 있어 이 시계가 어떻게 작동하는지는 확인되지 않았다. 여러 날, 여러 세션에 걸친 시간 흐름을 실제 시간보다 빠르게 재현하는 장치일 가능성도 있지만, 이는 초록으로 확인된 내용이 아니다. 실험 결과, 어떤 벤치마크와 에이전트로 검증했는지, 코드 공개 여부도 공개된 초록 범위에서는 확인되지 않았다.
이 연구는 AI 에이전트 경쟁의 초점이 옮겨 가는 흐름과 맞닿아 있다. 질문 하나에 답하는 성능을 넘어 사용자의 작업을 며칠, 몇 주에 걸쳐 이어 가고 그 과정에서 배운 것을 기억하는 능력이 중요해지고 있다. 그런데 이런 능력은 짧은 단발성 과제로는 재기 어렵다. 세션이 끊겼다 다시 이어질 때, 예약 작업이 끼어들 때, 기억이 정리될 때 에이전트가 어떻게 행동하는지를 재현할 수 있어야 한다. SCLATE는 모델 성능을 직접 끌어올리는 연구가 아니다. 그런 능력을 공정하게 비교하고 학습시키기 위한 인프라를 다룬다는 점이 특징이다.
애플은 연구 성과를 외부 논문 공유 플랫폼보다 자사 머신러닝 연구 사이트에 먼저 올리는 경우가 많다. 그래서 이 사이트는 애플의 AI 연구 방향을 엿볼 수 있는 창구로 꼽힌다. 이번 논문이 동료평가를 거쳤는지, 특정 학회에 채택됐는지는 확인되지 않았다. 이 연구가 애플의 제품이나 서비스에 적용될지도 현재로서는 알 수 없다.