2026년 9월 25일 금요일
METABRIEF — Insights. Connection. Innovation.
AI

31명 연구진이 영상 AI에 '대상 영속성' 가르치는 데이터 150만 건 공개

눈앞에서 사라진 물체도 여전히 존재한다는 사실을 영상 생성 AI가 이해하는지 확인하고, 이를 학습시키기 위한 대규모 데이터셋이 공개됐다. 논문 사전공개 사이트 arXiv에 올라온 저자 초록에 따르면, 하오톈 장(Haotian Zhang) 등 연구자 31명은 논문 「Training Object Permanence in World Models」(arXiv:2609.28654)에서 인지과학 과제를 바탕으로 만든 데이터 인프라 'WROP(World Reasoning with Object Permanence)'와 160억(16B) 파라미터 규모의 월드 모델 'PWM-WROP'를 발표했다. 이 논문은 연구자 커뮤니티 플랫폼 허깅페이스의 일일 논문 목록에서 추천 56회를 받았다.


연구진이 다룬 '대상 영속성(object permanence)'과 '고체성(solidity)'은 발달심리학에서 인간 인지의 기본 전제로 꼽히는 개념이다. 대상 영속성은 가려지거나 시야에서 벗어난 물체도 계속 존재한다는 이해이고, 고체성은 단단한 물체끼리 서로를 통과하지 못한다는 이해다. 연구진은 초록에서 최근 연구들을 인용해 현재 월드 모델의 대표 유형인 영상 생성 모델이 추론 능력을 보이기 시작했으며, 그래서 사람과 비슷한 물리 지능을 만드는 데 알맞은 후보라고 설명했다. 그러면서 영상 모델에 대상 영속성이 이미 생겨났는지, 생겨나지 않았다면 핵심 인지(core cognition)에서 착안한 데이터셋으로 학습시킬 수 있는지를 연구 질문으로 내세웠다.


WROP는 연구진이 직접 설계한 과제 150개로 이뤄져 있고, 이 과제들은 6개 인지 범주로 나뉜다. 연구진은 3D 그래픽 도구 블렌더(Blender)로 생성기를 만들어 과제마다 인지 구조는 그대로 두고 물체 속도, 조명, 카메라 각도 같은 부수 조건만 무작위로 바꿨다. 이렇게 과제 하나당 1만 개 넘는 샘플을 만들었다. 조건이 달라져도 핵심 원리는 같게 유지해, 모델이 겉모습의 패턴이 아니라 물리 원리 자체를 익히게 하려는 설계로 보인다. 공개한 자료는 150만 개 샘플로 된 학습 코퍼스와 300문항짜리 평가 시험이다.


연구진은 이 시험으로 영상 모델 14개를 평가했다. 유형별로는 참조 기반 영상 생성(reference-to-video) 모델 3개, 편집(edit) 모델 7개, 이어 생성(continuation) 모델 4개이며, 연구진의 PWM-WROP도 여기에 포함됐다. 모델 이름을 가린 채 두 결과를 짝지어 비교하는 방식(Elo 평가)에서 PWM-WROP는 이어 생성 모델 가운데 1위, 전체 3위를 기록했다. 연구진에 따르면 PWM-WROP보다 앞선 것은 참조 기반 영상 생성 모델 2개뿐이었고, 두 모델의 차이는 통계적으로 의미가 없었다. 비교 대상 모델의 이름과 세부 점수는 초록에 나오지 않아 확인되지 않았다. 앞서 제기한 질문, 곧 기존 영상 모델에 대상 영속성이 이미 생겼는지에 대한 구체적인 결론도 초록만으로는 확인되지 않는다.


연구진은 데이터와 시험 문항뿐 아니라 각 모델의 답안, 점수, 모델 가중치까지 공개한다고 밝혔다. 학습 도구인 PWM도 함께 내놓는데, 아마존웹서비스(AWS)의 AI 학습용 칩 트레이니엄2(Trainium2)에서 돌아가는 PyTorch 네이티브 학습 스택이다. 가중치와 학습 환경까지 공개하는 만큼 다른 연구자들이 결과를 재현하거나 같은 기준으로 자기 모델을 평가해 볼 수 있게 된다. 영상 생성 모델에서 물체가 갑자기 사라지거나 서로 뚫고 지나가는 오류는 자주 지적되는 문제다. 이런 물리적 일관성을 측정하고 학습시키는 공개 도구가 생겼다는 점에서 의미가 있다.


다만 이 논문은 동료평가를 거치지 않은 사전공개 논문이다. 이 기사도 저자가 공개한 초록을 바탕으로 정리한 것이다. 저자들의 소속 기관은 제공된 자료에 나오지 않아 확인되지 않았다.