"AI, 망치질은 보지만 이해는 못 한다"… 1인칭 영상 도구 사용 벤치마크 'EgoTools' 공개
사람이 손에 쥔 도구로 무엇을 하고 있는지를 멀티모달 AI가 아직 제대로 이해하지 못한다는 연구 결과가 나왔다. 사전공개 논문 저장소 arXiv에 올라온 논문 「EgoTools: Towards Tool-Centric Reasoning in Real-World Egocentric Videos」의 초록에 따르면, Gemini-3.1-Pro는 이 연구진이 만든 평가에서 전체 정확도 66.9%를 기록했다. 하지만 영상 속 도구와 대상을 알아보고 위치를 짚어내는 '인지·근거 파악(Perception & Grounding)' 영역에서는 51.7%에 그쳤다. 논문은 Ropedia 소속 Shulin Tian 등 연구자 20명이 공동 저자로 이름을 올렸다(arXiv:2609.39378).
연구진이 이 문제에 주목한 이유는 실제 세계의 과제가 대부분 도구를 거쳐 이뤄지기 때문이다. 요리나 청소 같은 일상 활동부터 전문 작업 절차까지, 사람은 도구를 써서 대상의 상태를 바꾼다. 연구진은 이런 장면을 이해하려면 도구를 어떻게 쓸 수 있는지(어포던스), 손·도구·대상이 공간에서 어떻게 놓여 있는지, 작업이 어디까지 진행됐는지, 그 행동이 대상에 어떤 결과를 낳는지를 함께 추론해야 한다고 설명했다. 지금의 영상 AI 모델은 영상 설명문 생성이나 일반 영상 질의응답 같은 '인지' 중심 과제에서는 좋은 성적을 내지만, 도구 중심의 체화(embodied) 추론에서는 여전히 한계가 있다는 것이 연구진의 진단이다. 실제 1인칭 시점 데이터와 이를 진단할 벤치마크가 부족했던 점이 이 분야의 걸림돌로 꼽혔다.
EgoTools는 두 부분으로 이뤄졌다. 첫째 'EgoTools-Data'는 도구 사용 장면을 1인칭 시점으로 찍은 100시간 분량의 영상 자료다. 동기화된 음성, 촘촘한 장면 설명문, 추론 과정을 담은 내레이션, 보조 3차원 정보가 함께 들어 있다. 둘째 'EgoTools-Bench'는 질의응답 1,000쌍으로 구성된 진단용 벤치마크다. 인지, 기하, 절차, 인과 추론까지 네 갈래 트랙으로 나눠 도구 사용 이해도를 평가한다. 연구진은 EgoTools가 1인칭 도구 사용 이해를 다루는 '최초의 종합 도구 세트'라고 밝혔다. 다만 이는 저자들의 주장이며, 외부에서 검증된 내용은 아니다.
평가 결과는 AI가 도구 사용을 시각적 근거에 연결하는 데 아직 어려움을 겪는다는 점을 보여준다. 전체 점수보다 인지·근거 파악 점수가 15%포인트 넘게 낮다는 것은, 모델이 그럴듯한 답을 내더라도 영상 속 실제 증거에 기대지 않고 있을 수 있다는 뜻으로 읽힌다. 초록에는 다른 모델들의 세부 점수가 실리지 않았다.
연구진은 이 데이터를 학습용으로도 쓸 수 있는지 검증했다. 알리바바 계열 오픈 모델 Qwen3-VL-8B-Instruct를 EgoTools-Data로 전체 지도 미세조정(full SFT)한 결과, 1,000문항 벤치마크 정확도가 50.0%에서 60.9%로 10.9%포인트 올랐다. 연구진은 학습 데이터와 평가 데이터가 같은 원본 영상에서 나오지 않도록 엄격히 분리한 조건이었다고 설명했다. 80억 파라미터 규모의 중형 모델이 학습 뒤 최상위 상용 모델과의 격차를 상당 부분 줄였다는 점에서, 도구 중심 1인칭 데이터의 쓸모를 보여주는 결과로 볼 수 있다.
이 논문은 연구자 커뮤니티 플랫폼 허깅페이스의 일일 논문 목록에서 추천 37회를 받았다. 이번 내용은 저자가 공개한 초록을 바탕으로 정리한 것이다. 이 논문은 동료평가를 거치지 않은 사전공개 논문이며, 데이터셋과 벤치마크를 외부에 공개하는 시점이나 이용 조건은 초록만으로는 확인되지 않았다.