기사 검색

이슈부터 IT·AI·연예·게임까지, 메타브리프의 기사를 찾아보세요.

AI

저장대 연구진 'PanoVLN' 공개… 360도 파노라마로 로봇 길찾기 성공률 최고 기록 경신 주장

중국 저장대학교(Zhejiang University) 연구진이 360도 파노라마 영상을 활용해 로봇이 자연어 지시를 따라 길을 찾도록 하는 인공지능 모델 'PanoVLN'을 내놓았다. 사전공개 논문 저장소 arXiv에 올라온 논문 「PanoVLN: Towards Effective Panoramic Vision-and-Language Navigation」(arXiv:2609.34759)에 따르면, 이 모델은 대표적인 평가 벤치마크 두 곳에서 기존 최고 성능(SOTA)보다 성공률을 각각 11.9%, 8.7% 높였다. 저자는 Zhen Wang 등 8명이다. 이 논문은 연구자 커뮤니티 플랫폼 허깅페이스의 일일 논문 목록에서 추천을 46회 받았다.


연구 대상인 '시각-언어 내비게이션(VLN)'은 로봇이 카메라로 본 장면과 "복도 끝에서 왼쪽으로 돌아 부엌으로 가라" 같은 언어 지시를 함께 받아, 다음에 어떻게 움직일지 스스로 판단하는 기술이다. 최근 시각-언어 모델(VLM)이 발전하면서 이 분야도 빠르게 성장했다. 다만 기존 연구는 대부분 사람 눈처럼 앞쪽 일정 범위만 보는 일반 카메라(원근 카메라) 영상을 썼다. 연구진이 파노라마에 주목한 이유는 단순하다. 더 넓게 보면 더 나은 결정을 내릴 수 있다는 것이다. 예를 들어 일반 카메라 시야 밖에 있는 통로가 파노라마에서는 보이기 때문에, 로봇이 두리번거리며 추가로 탐색하지 않아도 가야 할 경로를 알아챌 수 있다.


그런데 연구진이 실제로 해 보니, 입력 영상을 파노라마로 바꾸기만 해서는 성능이 조금밖에 오르지 않았다. 넓은 시야를 제대로 활용하려면 행동 예측, 학습 방식, 시각 표현을 모두 손봐야 한다는 것이 연구진의 진단이다.


첫째는 행동 예측이다. 넓게 볼 수 있으면 더 먼 앞까지 계획할 수 있다. 그래서 모델이 한 장의 파노라마만 보고 크게 방향을 틀고 이어서 이동하는 긴 행동 순서를 한꺼번에 예측하게 했다. 여기에 '신뢰도 기반 실행(CGE)' 전략을 더했다. 모델이 예측한 행동 가운데 몇 개를 실제로 실행한 뒤 다시 계획할지를 확신 정도에 따라 그때그때 정하는 방식이다.


둘째는 학습 데이터다. 시야가 넓어지면 고를 수 있는 경로도 많아지고 선택이 복잡해진다. 연구진은 갈림길이 자주 나오고 지시문이 분명한 학습용 경로를 따로 만들어, 모델이 경로를 고르는 능력을 집중적으로 배우게 했다.


셋째는 시각 표현이다. 파노라마로 길을 찾으려면 개별 랜드마크를 알아보는 것만으로는 부족하고, 여러 방향에 걸친 공간 관계까지 이해해야 한다. 연구진은 일반 컬러(RGB) 파노라마에서 뽑은 의미 정보와 기하 정보를 결합해, 장면에 무엇이 있는지와 공간이 어떻게 배치됐는지를 함께 담았다. 이 과정에서 모델에 들어가는 시각 토큰 수는 늘리지 않았다고 설명했다.


성능 수치는 연구 환경을 감안해 읽을 필요가 있다. PanoVLN은 40억(4B) 파라미터 규모의 백본 모델을 쓰고, 깊이 센서 없이 RGB 영상만 입력으로 받는다. 이 조건에서 연속 환경 벤치마크인 R2R-CE와 RxR-CE의 'Val-Unseen'(학습 때 보지 않은 환경에서 평가) 세트에서 성공률이 기존 최고 성능보다 각각 11.9%, 8.7% 높았다고 연구진은 밝혔다. 초록에는 이 수치가 퍼센트포인트 차이인지 상대 증가율인지 적혀 있지 않다. 비교 대상이 된 구체적인 기존 모델도 초록만으로는 확인되지 않는다. 상대적으로 작은 모델과 값싼 센서 구성으로 거둔 결과라는 점에서, 실제 로봇에 적용할 때 비용 부담이 줄어들 가능성이 있다.


연구진은 시뮬레이션뿐 아니라 사족보행 로봇으로 실제 환경 실험도 했다. 그 결과 기존 VLN 방법보다 멈추는 횟수가 적고 목적지까지 더 빨리 이동했다고 설명했다. 한 번에 여러 동작을 계획하고 실행하는 방식이 실제 주행을 매끄럽게 만든 것으로 보인다. 다만 실험 규모나 구체적인 환경 조건은 초록에 나와 있지 않다.


이 논문은 동료평가를 거치지 않은 사전공개 논문이며, 이 기사는 저자들이 공개한 초록을 바탕으로 정리했다. 제시된 성능 수치는 외부 검증 전인 연구진 자체 결과다.