기사 검색

이슈부터 IT·AI·연예·게임까지, 메타브리프의 기사를 찾아보세요.

AI

애리조나주립대 연구진, 영상 생성 AI '사후학습·정렬' 기법 총정리…"이 분야 첫 종합 서베이"

미국 애리조나주립대(Arizona State University) 소속 연구진이 영상 생성 인공지능(AI) 모델의 '사후학습(post-training)'과 '정렬(alignment)' 기법을 종합 정리한 서베이 논문을 내놨다. 논문 사전공개 사이트 arXiv에 올라온 「Video Generation Models: A Survey of Post-Training and Alignment」(arXiv:2610.00812)에 따르면, 연구진은 이 분야의 기존 연구를 네 갈래로 분류했다. 저자는 Chaoyu Li 등 13명이며, 스스로 이 논문을 영상 생성 모델의 사후학습·정렬을 다룬 '첫 종합 리뷰'라고 소개했다. 이 논문은 AI 연구자 커뮤니티 허깅페이스의 일일 논문 목록에서 추천 43회를 받았다.


연구진이 초록에서 짚은 배경은 이렇다. 영상 생성 기술은 짧고 화질이 낮은 클립에서 시작해, 시간과 공간에 걸친 복잡한 움직임을 담은 고해상도·장시간 영상으로 빠르게 발전했다. 대규모 사전학습으로 강한 생성 능력을 갖췄지만, 사전학습만 마친 모델은 사람의 의도를 제대로 따르지 못하거나, 시간이 흐르면서 장면의 일관성이 흐트러지거나, 물리 법칙과 안전 기준을 지키지 못하는 경우가 많다는 것이다.


연구진은 영상의 정렬이 이미지나 텍스트보다 까다로운 이유로 네 가지를 들었다. 프레임이 이어지면서 오류가 쌓이는 문제, 움직임과 외형이 서로 얽혀 있어 한쪽만 고치기 어려운 문제, 여러 목표를 동시에 맞출 때 생기는 상충 관계, 그리고 시간적 특성을 가르칠 감독 데이터가 부족하다는 점이다. 모델을 처음부터 다시 학습시키는 데는 막대한 비용이 들기 때문에, 이미 학습된 모델을 고쳐 쓰는 체계적인 사후학습 전략이 필요하다는 게 연구진의 설명이다.


논문은 사후학습을 하나의 통합된 틀로 보고, 정렬 신호를 어떤 방식으로 적용하느냐에 따라 '암묵적 정렬'과 '명시적 정렬'로 나눴다. 이를 바탕으로 기존 기법을 △지도 미세조정(SFT) △자기학습·증류 △선호·보상 기반 방법 △추론 시점(inference-time) 방법 등 네 범주로 정리했다. 연구진은 이 분류가 학습 단계와 실제 서비스 배포 단계 모두에서 정렬 신호가 모델의 행동을 어떻게 바꾸는지 한눈에 보여준다고 설명했다.


기법 정리 외에도 자주 쓰이는 데이터셋과 벤치마크, 평가 관행을 함께 검토했다. 앞으로 풀어야 할 과제로는 확장 가능한 보상 설계, 긴 영상에서의 시간적 일관성 유지, 안정성과 표현력 사이의 균형, 안전을 고려한 생성 등을 꼽았다.


이번 서베이는 언어 모델에서 먼저 자리 잡은 흐름이 영상 생성으로 넘어오고 있음을 보여준다. 대화형 AI는 사전학습 뒤 사람의 선호를 반영하는 미세조정과 강화학습으로 쓸 만한 수준에 올라섰다. 영상 생성 모델도 '그럴듯한 영상'을 만드는 단계를 넘어 '원하는 영상을 정확하고 안전하게' 만드는 쪽으로 관심이 옮겨가고 있다. 흩어져 있던 사후학습 연구를 한 틀에 묶었다는 점에서 연구자와 개발자에게 참고 지도 구실을 할 수 있다는 게 연구진의 설명이다. 이들은 논문의 목표를 통제할 수 있고 신뢰할 만한 영상 생성 모델을 만드는 데 필요한 개념적 기반과 실용적 지침을 제공하는 것이라고 밝혔다.


다만 이 논문은 동료평가를 거치지 않은 사전공개 논문이다. 이 글은 저자들이 공개한 초록을 바탕으로 정리했다. 각 범주에 구체적으로 어떤 모델과 기법이 들어갔는지, 정량 비교가 실렸는지는 초록만으로는 확인되지 않았다.