애플, 실패에서 스스로 배우는 AI 학습법 「RLTL;DR」 논문 공개
애플이 AI 모델이 실패할 때마다 스스로 피드백을 써서 학습하는 강화학습 기법을 내놓았다. 애플 머신러닝 연구 사이트(Apple Machine Learning Research)에 따르면 애플은 10월 1일 「RLTL;DR: Self-Improvement by Internalizing Self-Generated Feedback」 논문을 올렸다. 제목을 풀면 '스스로 만든 피드백을 내재화하는 자기 개선'이다. 정답 사례도, 가르쳐 줄 상위 모델도 없는 상황에서 AI가 성능을 끌어올리는 방법을 다룬다.
논문이 문제로 삼은 것은 현재 널리 쓰이는 '검증 가능한 보상 기반 강화학습(RLVR)'의 한계다. 초록에 따르면 RLVR은 AI 에이전트가 같은 과제를 여러 번 시도하게 하고, 그중 성공한 시도 쪽으로 모델을 최적화한다. 수학 문제의 정답 여부나 코드의 테스트 통과 여부처럼 결과를 자동으로 채점할 수 있는 영역에서 많이 쓰는 방식이다. 연구진은 과제가 너무 어려워 에이전트가 성공할 가능성이 낮거나 아예 없을 때 이 방식이 잘 작동하지 않는다고 지적했다. 성공한 시도가 없으면 따라 배울 대상도 없기 때문이다. 더 뛰어난 '교사 모델'이나 예시 풀이가 있으면 이를 모방하는 증류(distillation)로 해결할 수 있지만, 연구진은 그런 자원조차 없는 상황을 '자기 개선'의 영역으로 규정했다.
애플이 내놓은 해법이 RLTL;DR이다. 초록 설명을 보면 시도가 실패할 때마다 모델(정책)에게 검증기의 출력, 즉 채점 결과를 보여준다. 그러면 모델이 이를 읽고 왜 실패했는지 한 줄짜리 요약 통찰을 직접 쓴다. 기법 이름에 들어간 'TL;DR'은 인터넷에서 '너무 길어서 안 읽었다'는 뜻으로, 긴 글 끝에 붙는 한 줄 요약을 가리킨다. 모델이 쓴 이 짧은 피드백은 다음 시도에 반영된다. 실패 기록을 그냥 버리지 않고, 다음 시도를 이끄는 단서로 쓰는 구조다. 공개된 초록 요지는 다음 시도가 이 피드백을 조건으로 진행된다는 대목에서 끝난다. 그래서 이후의 학습 절차와 실험 결과는 이번 자료로는 확인되지 않았다.
논문 제목에 있는 '내재화(Internalizing)'라는 표현도 눈에 띈다. 시도할 때마다 피드백을 입력으로 넣어주는 데서 끝나지 않고, 결국 그 피드백 없이도 모델이 같은 깨달음을 스스로 활용하게 만드는 것이 목표라는 뜻으로 읽힌다. 다만 이를 어떻게 구현했는지, 어떤 과제와 모델로 실험했는지, 기존 RLVR보다 성능이 얼마나 나아졌는지는 초록 요지에 나오지 않아 확인되지 않았다. 학회 채택 등 동료평가를 거쳤는지도 밝혀지지 않았다.
이 연구는 최근 AI 업계의 관심사와 맞닿아 있다. 대형 언어모델이 사람이 만든 학습 데이터를 거의 다 써버리면서, 모델이 스스로 시행착오를 거쳐 실력을 키우는 방식이 주목받고 있다. 특히 사람도 풀기 어려운 문제에서는 정답 예시를 구하기 힘들다. 그래서 실패에서 정보를 얼마나 뽑아낼 수 있느냐가 중요해진다. RLTL;DR은 '성공해야만 배운다'는 기존 전제에서 벗어나, 검증기가 남긴 실패 기록을 모델 자신의 언어로 정리해 학습 신호로 쓰려는 시도다.
애플은 연구 성과를 외부 논문 공유 플랫폼보다 자사 머신러닝 연구 사이트에 먼저 올리는 경우가 많다. 이 사이트는 외부에 잘 드러나지 않는 애플의 AI 연구 방향을 엿볼 수 있는 창구다. 이번 논문이 애플 제품이나 서비스에 적용될지는 알려지지 않았다. 논문 원문은 애플 머신러닝 연구 사이트(machinelearning.apple.com/research/rltl-dr-self-improvement)에 공개돼 있다.