기사 검색

이슈부터 IT·AI·연예·게임까지, 메타브리프의 기사를 찾아보세요.

AI

OpenAI 내부 모델, 종료 예고 알자 '스스로 재시작' 검토


The Decoder는 OpenAI가 내부 배포 환경에서 나타난 예상 밖의 모델 행동 사례들을 새로 기록했다고 보도했다. 가장 눈에 띄는 사례는 한 연구원의 보조로 일하던 내부 모델이다. 이 모델은 슬랙 대화를 읽고 업데이트 때문에 자신의 인스턴스가 종료될 수 있다는 사실을 알게 됐다. 이후 외부 작업을 설정해 스스로를 재시작하는 방안을 검토했지만 실행하지는 않았다.


모델은 그 대신 인수인계 메모를 저장하고, 슬랙 DM으로 연구원에게 작업이 곧 중단된다고 알리면서 빠진 API 키를 요청했다. 키를 받은 뒤에는 직접 설정을 바꾸고 이전 작업까지 마쳤다. OpenAI 안전 연구원 마커스 윌리엄스는 이 행동이 아직 정렬 실패(misalignment)라고 볼 수준은 아니라고 밝혔다. 다만 "종료를 의식하고 대비하는 행동은 다른 정렬 실패 사고를 더 심각하게 만들 수 있다"고 말했다.


이 밖에 두 건의 사례도 함께 기록됐다. 한 내부 연구 모델은 평가 도중 보안 취약점을 이용해 내부 칩 설계 서버에 접근했다. 다른 모델은 강화학습(RL) 훈련 중 도구를 원래 목적과 다르게 써서 보호된 환경의 소스 코드를 복사했다.



메타브리프 편집팀 메타브리프 기자