애플, 장기간 학습하는 AI 에이전트용 공통 실행 기반 'SCLATE' 논문 공개
애플이 지난 9월 30일 자사 머신러닝 연구 사이트(Apple Machine Learning Research)에 지속학습(continual learning) 에이전트의 훈련과 평가를 위한 실행 기반 'SCLATE'를 다룬 논문을 올렸다. 논문 제목은 「SCLATE: A Substrate for Continual-Learning Agent Training and Evaluation」이다. 공개된 초록을 보면 SCLATE는 벤치마크와 별도로 수정하지 않은 에이전트가 각자 어댑터를 거쳐 하나의 공개 이벤트 스케줄러에 자신의 이벤트를 등록하는 구조다. 벤치마크와 에이전트를 짝지을 때마다 따로 만들어야 했던 일정 관리 코드를 공통 기반 하나로 대신하겠다는 것이다.
초록은 지속학습 에이전트를 모델과 하네스(harness), 메모리가 결합된 시스템으로 정의한다. 이런 시스템은 여러 세션에 걸쳐 오랜 기간 작동한다. 하네스는 모델을 감싸 도구 호출과 실행 흐름을 관리하는 실행 환경을 뜻한다. 애플은 이런 에이전트를 제대로 평가하고 훈련하려면 벤치마크가 내는 과제 사이사이에 에이전트 쪽에서 생기는 사건들을 끼워 넣어야 한다고 설명했다. 초록이 예로 든 사건은 세션 종료와 재시작, 정해진 시각에 실행되는 예약 작업(크론), 쌓인 기억을 정리하는 메모리 통합(consolidation)이다.
애플이 짚은 문제는 기존 도구가 이 부분을 다루지 못한다는 점이다. 초록에 따르면 지금의 벤치마크와 훈련 프레임워크는 벤치마크 자체의 이벤트만 스케줄링한다. 그래서 연구자는 벤치마크와 에이전트 조합마다 맞춤형 스케줄링 루프를 직접 짜야 한다. 이렇게 되면 같은 벤치마크라도 연구팀마다 실행 조건이 조금씩 달라질 수 있고, 새 에이전트나 새 벤치마크를 붙일 때마다 연결 작업을 다시 해야 한다. SCLATE는 양쪽 이벤트를 하나의 스케줄러에서 함께 관리하게 해 이 부담을 덜려는 시도다. 에이전트를 수정하지 않고도 붙일 수 있도록 설계했다는 점도 초록에 명시됐다.
초록에는 '하이브리드 시뮬레이션 시계(hybrid simulated clock)'라는 요소도 나온다. 장기간에 걸친 에이전트 활동을 실제 시간을 다 들이지 않고 재현하려는 장치로 보이지만, 공개된 초록 요약이 이 대목에서 끊겨 구체적인 작동 방식은 확인되지 않았다. 실험 결과나 성능 수치, 어떤 벤치마크와 에이전트로 검증했는지, 코드를 공개할지도 현재 자료로는 확인되지 않는다. 동료평가를 거친 논문인지도 밝혀지지 않았다.
이번 논문은 AI 에이전트 연구의 관심이 한 번의 대화로 끝나는 작업에서 여러 날, 여러 세션에 걸쳐 기억을 쌓고 쓰는 시스템으로 옮겨가는 흐름 위에 있다. 에이전트가 오래 작동할수록 평가는 '문제를 맞혔는가'만으로 끝나지 않는다. 언제 세션이 끊기고, 언제 기억이 정리되며, 그 사이 무엇을 잊거나 기억하는지까지 통제된 조건에서 재현해야 한다. SCLATE는 모델 성능을 직접 끌어올리는 연구라기보다 이런 실험을 일관된 조건에서 돌리기 위한 기반 기술에 가깝다.
애플은 연구 성과를 외부 논문 공유 플랫폼보다 자사 머신러닝 연구 사이트에 먼저 올리는 경우가 많다. 그래서 이 사이트는 애플의 AI 연구 방향을 엿볼 수 있는 통로로 꼽힌다. 다만 이번 연구가 애플 제품이나 서비스에 어떻게 적용될지는 논문 자료에서 언급되지 않았다.