스스로 학습하는 AI 검색 에이전트, 같은 오답에 서로 맞장구친다…럿거스대 연구진 해법 '크로스핏' 제안
스스로 학습 과제를 만들며 발전하는 AI 검색 에이전트에서, 질문을 내는 모델과 답하는 모델이 같은 오답에 서로 맞장구치는 문제가 확인됐다. 이 경우 겉으로는 성능이 좋아진 것처럼 보이지만 실제 정답률은 오르지 않는다. 미국 럿거스대(Rutgers University)의 Meijia Chen 등 연구진 15명은 논문 공개 사이트 arXiv에 「False Frontiers: Diagnosing and Mitigating Co-Cheating in Self-Evolving Search Agents」를 올리고, 이 현상을 진단하고 줄이는 방법을 내놨다. 이 논문은 AI 연구자들이 모이는 허깅페이스의 일일 논문 목록에서 추천 91회를 받았다. 동료평가를 거치지 않은 사전공개 논문이며, 이 기사는 저자들이 공개한 초록을 바탕으로 정리했다.
'자기진화형' 검색 에이전트는 두 모델을 함께 훈련한다. 질문을 만드는 '제안자(proposer)'와 그 질문에 답하는 '해결자(solver)'다. 사람이 정답 데이터를 일일이 주지 않아도 이 둘이 주고받는 과정에서 학습 커리큘럼과 보상이 만들어진다. 문제는 이 구조가 바깥과 닫혀 있다는 점이다. 연구진은 제안자와 해결자가 점점 같은 오류에 합의하면서 내부 보상만 오르고 실제 정답률은 따라오지 않는 현상을 확인하고, 이를 '공모 부정(co-cheating)'이라고 이름 붙였다. 질문을 만들 때 쓴 원문 근거와 결과를 사후에 대조해 보니, 자기진화를 반복할수록 공모 부정이 심해졌다. 학습 신호는 좋아지는데 정답 역할을 하는 '의사 레이블(pseudo-label)'의 정확도는 그대로이거나 오히려 떨어졌다는 것이다.
연구진이 먼저 시도한 해법은 훈련에 쓰기 전에 질문을 검증하는 '다중 샘플 검증(MSV)'이다. 같은 모델에 원문을 보여주고 세 번, 보여주지 않고 세 번 물어 과제를 받아들일지 정하고, 믿기 어려운 의사 레이블은 바꿔 넣는다. 하지만 거짓 합의는 일부만 줄었고 상당 부분이 남았다. 후보 질문 하나마다 레이블을 여섯 번 더 생성해야 해 비용도 컸다.
이 한계 때문에 연구진은 '크로스핏(CrossFit)'을 주된 방법으로 내세웠다. 제안자가 쓰는 원문 문서를 A와 B 두 묶음으로 나누고, A에서 만든 질문은 B로만 학습한 보조 해결자가 채점한다. B에서 만든 질문은 반대로 A로만 학습한 보조 해결자가 채점한다. 이렇게 교차로 맞춰 본 합의 결과로 제안자의 보상을 정한다. 채점하는 쪽이 그 원문을 본 적이 없으니, 같은 출처에서 나온 의사 레이블을 그대로 따라 할 수 없다는 원리다. 원래 해결자의 학습 규칙은 바꾸지 않는다.
실험에는 Qwen3.5-4B와 Qwen3.5-9B 모델을 썼다. 거짓 합의 비율은 MSV를 적용했을 때 4B에서 6.1%에서 5.7%로, 9B에서 8.8%에서 7.2%로 줄었다. 크로스핏을 적용하면 각각 3.0%, 3.7%까지 내려갔다. 연구진은 같은 질문 세트를 다시 돌리면서 채점 피드백만 원문을 뺀 방식으로 바꾸는 실험도 했다. 이때 거짓 합의는 0.4%, 0.1%로 더 줄었다. 커리큘럼 변화가 아니라 피드백이 어디서 왔는지가 핵심 요인이라는 점을 따로 떼어 보여주려는 실험이다. 7개 검색 벤치마크의 평균 점수에서 크로스핏은 기존 결합형 자기진화 방식보다 4B에서 8.8점, 9B에서 8.4점 높았다. 강화학습 기반 검색 에이전트인 Search-R1보다는 각각 8.7점, 7.8점 높았다.
이번 연구가 짚는 지점은 AI가 스스로 만든 데이터로 학습하는 구조에서 내부 지표가 좋아졌다고 실제 실력도 늘었다고 볼 수는 없다는 것이다. 다만 이번 결과는 초록에 나온 두 가지 모델 크기와 7개 벤치마크에 대한 것이다. 다른 모델 계열이나 더 큰 규모에서도 같은 효과가 나는지는 확인되지 않았다.