기사 검색

이슈부터 IT·AI·연예·게임까지, 메타브리프의 기사를 찾아보세요.

AI

난징대, 실시간 영상 보며 기억하고 먼저 답하는 AI 'OneStreamer' 공개…4B 모델로 8개 벤치마크 최고 성적

중국 난징대학교(Nanjing University) 연구진이 실시간으로 들어오는 영상을 이해하면서 지나간 장면을 기억하고, 답할 근거가 모이면 스스로 응답하는 스트리밍 비디오 AI 모델 'OneStreamer'를 공개했다. 논문 사전공개 사이트 arXiv에 올라온 논문(arXiv:2610.01762)에 따르면, 연구진은 40억(4B) 파라미터 모델로 평가한 스트리밍 영상 이해 벤치마크 8개 모두에서 비교 대상 가운데 가장 좋은 결과를 냈다. 이 논문은 연구자 커뮤니티 허깅페이스의 일일 논문 목록에서 추천 37회를 받았다.


논문 제목은 「OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction」이다. Xiangyu Zeng 등 24명이 저자로 이름을 올렸다. 동료평가를 거치지 않은 사전공개 논문이며, 이 기사는 저자들이 공개한 초록을 바탕으로 정리했다.


스트리밍 비디오 대형언어모델(LLM)은 완성된 영상 파일을 한 번에 분석하는 기존 모델과 다르다. 영상이 들어오는 동안 계속 판단해야 하고, 지금 본 장면이 나중에 어떤 질문에 쓰일지 모르는 채로 정보를 남겨 둬야 한다. 또 질문에 답할 근거가 충분히 모였을 때 먼저 응답하는 '선제적(proactive)' 반응 능력도 필요하다. 연구진은 이 분야의 핵심 과제를 "실시간 인식을 해치지 않으면서 재사용 가능한 사실 기억을 만드는 것"으로 정리했다. 과거 장면을 모두 시각 정보 그대로 쌓아 두면 연산 부담이 커지고, 기억을 줄이면 지나간 장면에 대한 질문에 답하기 어려워지는 문제가 있다.


OneStreamer는 특정 질문과 상관없이 근거를 기록하는 일과 질문에 응답하는 일을 하나의 선제적 생성 과정 안에서 함께 학습한다. 핵심 구성 요소는 두 가지다. 첫째는 '선제적 계층형 캡션 메모리(PHCM)'다. 영상을 보면서 시점이 표시된 세부 묘사 캡션을 만들고, 끝난 사건은 요약문으로 정리한다. 추론 단계에서는 모델이 직접 쓴 이 기록이 최근 구간의 시각 정보와 함께 쓰인다. 과거 시각 특징을 다시 불러오지 않고도 이전 맥락을 활용할 수 있다는 것이 연구진의 설명이다. 사람으로 치면 영상을 처음부터 다시 돌려 보는 대신 메모를 남겨 두고 그 메모를 참고하는 방식이다.


둘째는 '선제적 상태 전이 학습(PSTL)'이다. 스트리밍 모델은 학습 데이터 대부분이 '아직 답하지 않고 기다린다'는 상태로 채워지기 쉬워, 이 대기 상태에 학습이 쏠리는 문제가 있다. PSTL은 모든 출력 지점의 지도 신호를 유지하되, 상태가 바뀌는 지점과 유지되는 지점 가운데 대표적인 토큰만 골라 학습한다. 논문에 따르면 PSTL은 주석된 상태 토큰의 27.5%만 학습에 쓰고도 전체 토큰을 쓰는 방식보다 성능이 좋았다.


연구진은 출력 내용과 응답 시점을 실제로 확보된 근거에 맞추는 스트리밍 데이터 합성 파이프라인도 만들었다. 여기서 생성한 스트리밍 캡션·질의응답 데이터에 정제한 오픈소스 데이터를 더해, 다양한 과제를 아우르는 100만 건 이상 규모의 데이터셋 'OneStreamer-1M'을 구축했다. 구성 요소별 효과를 따로 확인한 실험(어블레이션)에서는 생성한 캡션을 기억으로 남겨 두면 실시간 인식 성능은 떨어지지 않고 과거 장면에 대한 질의응답 성능이 좋아졌다.


4B는 수백억 파라미터급 모델보다 훨씬 작은 규모여서, 실시간 처리가 필요한 환경에서 활용할 여지가 있다는 점이 눈에 띈다. 다만 초록에는 8개 벤치마크의 이름이나 비교한 모델 목록, 구체적인 점수가 나와 있지 않다. 모델과 데이터셋을 공개할지도 초록만으로는 확인되지 않았다. 연구진은 이번 결과가 선제적 생성이 스트리밍 영상 상호작용에서 인식, 기억 형성, 적시 응답을 잇는 공통 학습 방식이 될 수 있음을 보여준다고 밝혔다.