오픈AI "추론 탈취 캠페인 차단"… 연구진 "애저에선 여전히 뚫렸다"

오픈AI가 자사 AI 모델의 숨겨진 추론 과정을 빼내려던 조직적 '적대적 증류(adversarial distillation)' 캠페인을 적발해 차단했다고 공식 블로그 'OpenAI News'를 통해 밝혔다. 독일 IT 매체 The Decoder는 이 발표를 전하면서, 같은 공격 수법이 마이크로소프트 애저(Azure) 같은 클라우드 플랫폼에서는 몇 주 동안 계속 통했다는 외부 연구진의 후속 검증 결과도 함께 보도했다.
오픈AI 설명을 종합하면, 이번 활동은 7월 1일 적은 규모로 시작됐다. 7월 24~25일에는 4,000명이 넘는 사용자가 전형적인 추출 패턴으로 1만6,000건의 요청을 보냈다. 추가 분석에서는 비슷한 패턴을 보인 계정 1만5,000여 개가 연결된 네트워크가 드러났고, 오픈AI는 7월 28일까지 이를 모두 차단했다고 밝혔다. 오픈AI는 이 수치가 추출을 '시도'한 건수일 뿐 모두 성공한 것은 아니라고 덧붙였다. 오픈AI는 핵심 그룹이 언어모델 '키미(Kimi)'를 만든 문샷AI 관계자들과 연관돼 있다고 지목했다. 다만 관측된 행위자가 모두 같은 출처인지는 확인되지 않았다고 했다.
증류는 성능이 약한 모델이 강한 모델의 출력을 보고 학습하는 방식이다. 이때 최종 답변뿐 아니라 답에 이르는 사고 과정(chain of thought)까지 손에 넣으면 가치가 훨씬 커진다. 오픈AI는 이 중간 단계에 최종 답변에서 의도적으로 뺀 정보가 들어 있을 수 있고, 모델의 능력을 재현하는 데 쓰일 수 있다고 설명했다. The Decoder는 앤트로픽도 최근 중국 AI 기업들의 비슷한 시도를 보고한 바 있다고 전했다.
공격 수법은 이렇다. 한 대화에서 암호화된 추론 데이터를 복사한 뒤, 다른 대화에서 모델에게 이를 해독해 그대로 써 달라고 요청한다. 요아힘 섀퍼(Joachim Schaeffer) 연구팀은 이미 논문으로 이 취약점을 밝혔다. AI 업체들은 추론 내용을 암호화된 데이터 묶음으로 고객에게 돌려주는데, 공유 키로 암호화돼 있어 세션·사용자는 물론 같은 회사의 다른 모델 사이에서도 옮겨 쓸 수 있다. 그 결과 같은 계열의 더 싸고 약한 모델이 상위 모델의 숨은 추론을 한 글자도 빠짐없이 출력하는 '해독 오라클' 노릇을 하게 된다. 오픈AI는 연구진의 이름을 밝히며 이들이 보고한 공격 경로가 실제로 작동한다는 것을 확인했고, 덕분에 대응책을 더 빨리 내놓을 수 있었다고 했다.
오픈AI는 부정 계정을 정지하고 가입 절차를 강화했으며, 남의 암호화 추론을 재사용해 읽을 수 있던 허점을 막았다고 밝혔다. 스트리밍 출력도 검사해 추론이 드러날 우려가 있으면 내보내지 않는다. 이 문제가 자사 모델에만 해당하지 않는다고 보고 프런티어 모델 포럼(Frontier Model Forum)과 정부 채널에도 내용을 공유했다고 설명했다.
The Decoder 보도에 따르면 연구진은 오픈AI 발표 당일 논문 업데이트를 내놨다. 섀퍼는 X에 "또 추론을 훔쳤다"고 적었다. 9월 13일 재검증에서 오픈AI와 앤트로픽의 자체 API에서는 공격이 막혔다. 그러나 애저에서는 새 모델 GPT-6 아스트라를 포함해 시험한 오픈AI 모델 전부와 소네트 5까지의 앤트로픽 모델에서 단 한 번의 시도로 추론이 그대로 추출됐다. 개발자 잔 뵐뤽(Can Bölük)이 공개한 더 간단한 방법도 있다. 모델에게 가상 메모장 도구를 주고 추론을 거기에 적게 하는 방식으로, 오픈AI 전 모델과 오퍼스 4.8·소네트 5에서 통했고 오퍼스 5와 페이블 5·5.1만 추론을 드러내지 않았다. 연구진 타임라인을 보면 GPT-6 아스트라는 보호 장치 없이 외부 플랫폼에 출시됐고, 오픈AI는 9월 27일에야 애저 엔드포인트에 보호 장치를 추가했다. 앤트로픽 모델은 9월 28일부터 애저에서 재현되지 않았다. 연구진은 지금까지의 조치가 특정 요청 패턴에 의존하는 단편적 땜질이라고 평가했다. 또 동등한 보호를 갖추지 못한 클라우드 사업자는 추론 모델을 제공해서는 안 되며, 그렇지 않으면 API 차원에서 수출 통제를 우회하는 길이 열린다고 주장했다. 오픈AI도 파트너가 호스팅하는 모델에 같은 수준의 보호가 필요하다는 점을 인정하며 작업이 끝나지 않았다고 밝혔다.
두 자료를 나란히 놓으면 강조점이 갈린다. 오픈AI 공식 발표는 '적발·차단·공조'라는 대응의 완결성에 무게를 둔다. The Decoder는 그 대응이 자사 API 바깥, 곧 클라우드 재판매 경로까지는 닿지 않았다는 점을 부각한다. 두 시각을 합쳐 보면 문제는 개별 기업의 보안 수준이 아니라 같은 모델이 여러 창구로 유통되는 구조에 있다. 가장 약한 창구가 전체 방어선의 수준을 결정하는 셈이다. 오픈AI는 선두 모델의 성능이 높아질수록 값싸게 능력을 베끼려는 시도가 더 정교해질 것으로 내다봤다.
메타브리프 편집팀 메타브리프 기자