기사 검색

이슈부터 IT·AI·연예·게임까지, 메타브리프의 기사를 찾아보세요.

AI

엔비디아, 긴 영상 기억으로 로봇 성공률 높인 'Long-WAM' 공개… "기억을 쓰는 방식이 관건"

엔비디아 연구진이 로봇이 과거 영상을 더 길게 기억하면서도 실시간으로 움직이게 하는 '월드-액션 모델' 기술을 내놨다. 논문 사전공개 사이트 arXiv에 올라온 「Long-WAM: Scaling the Context of World-Action Models」(arXiv:2610.10528)에 따르면, 웨이 황(Wei Huang) 등 엔비디아 소속 연구자 16명은 이 모델로 여러 로봇 조작 벤치마크에서 비교 대상 가운데 가장 좋은 성적을 냈다고 밝혔다. 이 논문은 연구자 커뮤니티 플랫폼 허깅페이스의 일일 논문 목록에서 추천 57회를 받았다.


로봇이 실시간으로 움직이려면 지금까지 본 장면을 충분히 기억해야 물체의 움직임과 작업 진행 상황을 파악할 수 있다. 하지만 기억할 영상이 길어질수록 처리 시간이 늘어나 동작이 늦어진다. 연구진은 이 문제를 풀기 위해 모델 설계와 실행 시스템을 함께 다루는 틀로 Long-WAM을 제시했다. 월드-액션 모델은 앞으로 펼쳐질 장면을 예측하는 동시에 로봇이 할 동작을 만들어내는 모델을 말한다.


연구진이 꼽은 핵심 발견은 "과거 기록을 볼 수 있다는 것과 실제로 그것을 활용하는 것은 다르다"는 점이다. 바탕이 되는 영상 모델을 과거에서 미래 순서로 차례차례 예측하는 '자기회귀(AR)' 방식으로 사전학습했을 때, 긴 기록이 훨씬 큰 효과를 냈다는 것이다. 연구진은 먼저 동작 정보(레이블)가 없는 로봇 영상과 1인칭 시점 영상으로 인과적 예측을 학습시켰다. 이어 로봇 동작을 학습하는 단계에서도 '과거에서 미래로'라는 구조를 그대로 유지했다.


효과는 수치로 나타났다. RoboCasa GR-1 벤치마크에서 모델이 참고하는 영상 길이를 0초에서 19.2초로 늘리자 성공률이 63.3%에서 78.7%로 올랐다. 반면 앞뒤 방향을 모두 보는 양방향 방식으로 사전학습한 모델은 기록을 늘려도 순이득이 없었다. 로봇 영상으로 AR 사전학습을 추가하자 GR-1과 LIBERO-Long에서 최고 성공률이 더 올랐다. 연구진은 Long-WAM이 LIBERO-Long, RoboTwin 2.0, DOMINO 벤치마크에서도 비교 대상 방법 가운데 가장 좋은 결과를 냈다고 밝혔다.


속도 문제는 시스템 쪽에서 풀었다. 들어오는 영상을 흘러가는 대로 처리하는 스트리밍 인코딩, 비동기 실행, 하드웨어별 가속을 적용해 미래 예측 기능을 빼지 않고도 RTX 5090, DGX Spark, 젯슨 AGX 토르(Jetson AGX Thor)에서 모델을 돌릴 수 있게 했다. RTX 5090에서는 미래 영상 예측을 포함해 동작 묶음(액션 청크) 하나를 만드는 데 107.4밀리초가 걸렸다.


실제 로봇 실험도 진행했다. 유니트리 G1과 YAM 로봇에서 실시간으로 움직이며 동적인 작업과 긴 작업을 수행했다. 움직이는 상황에서 컵을 쌓는 과제에서는 성공률 95%를 기록했는데, 같은 과제에서 비교 모델인 Pi0.5와 Fast-WAM은 20번 시도에서 한 번도 성공하지 못했다. 연구진은 Long-WAM이 기억을 바탕으로 동작을 실행하는 역할을 맡아, 여러 단계가 섞인 작업에서 상위 계획 모델을 보완할 수 있다고도 설명했다.


이번 연구는 로봇 AI에서 '얼마나 길게 기억하느냐'보다 '기억을 활용할 수 있게 어떻게 학습시키느냐'가 더 중요할 수 있다는 점을 보여준다. 또 데이터센터용 GPU가 아닌 소비자용 그래픽카드와 로봇 탑재용 컴퓨터에서도 실시간으로 동작함을 보였다는 점도 눈에 띈다. 다만 이 내용은 저자들이 공개한 초록을 바탕으로 정리한 것이다. 논문은 동료평가를 거치지 않은 사전공개 논문이며, 성능 수치는 아직 외부에서 검증되지 않았다.