2026년 9월 22일 화요일
METABRIEF — Insights. Connection. Innovation.
AI

Qwen 연구진 '리크리에이션월드' 공개… 5개 OS 넘나드는 컴퓨터 사용 에이전트 시험대

논문 사전공개 사이트 arXiv에 공개된 초록에 따르면, 슈아이 바이(Shuai Bai) 등 32명의 Qwen 소속 연구진이 그래픽 조작과 코딩을 함께 수행하는 이른바 '하이브리드 컴퓨터 사용 에이전트(CUA)'를 훈련·평가하기 위한 환경 프레임워크 '리크리에이션월드(RecreationWorld)'를 내놨다. 해당 논문은 연구자 커뮤니티 플랫폼 허깅페이스의 일일 논문 목록에서 추천 60회를 받았다.


연구진이 문제로 지목한 것은 컴퓨터 사용 에이전트 연구가 지금까지 두 갈래로 갈라져 발전해 왔다는 점이다. 한쪽은 화면 속 버튼을 누르고 창을 옮기는 그래픽 인터페이스 조작이고, 다른 한쪽은 코드와 명령줄을 통한 소프트웨어 개발이다. 그러나 실제 디지털 업무는 두 가지를 순서대로 쌓아 올리는 것이 아니라 번갈아 오가며 이뤄진다는 것이 연구진의 설명이다. 이에 연구진은 에이전트가 언제 인터페이스를 탐색하고, 언제 소프트웨어를 구현하며, 언제 결과물을 실행해 눈으로 검증할지 스스로 판단하도록 하는 구도를 택했다.


리크리에이션월드의 과제 설계는 '재현(recreation)'이다. 실제로 돌아가고 있는 참조 애플리케이션을 하나 주고, 에이전트가 그 동작을 직접 알아낸 뒤 충실하게 구현해 내도록 한다. 정해진 작업 절차는 주어지지 않는다. 환경은 우분투·맥OS·윈도우·안드로이드·웹 등 5개 플랫폼에서 재현 가능한 형태로 제공되며, 네이티브 GUI 제어 기능과 코딩 도구를 함께 묶은 통합 하네스가 붙는다. 돌아가는 참조 프로그램 자체가 정답 역할을 하기 때문에, 겉으로 드러나지 않는 동작까지 시험하는 숨은 행동 테스트와 실행에 근거한 보상 신호를 만들 수 있다는 것이 연구진의 주장이다.


연구진은 품질이 확보된 오픈소스 애플리케이션을 활용해 학습용 궤적 데이터를 대량으로 생성했다고 밝혔다. 이 데이터로 훈련한 모델은 학습 분포 바깥에 있는 코딩·하이브리드 컴퓨터 사용 벤치마크 5종에서 성능이 개선됐고, 자신이 만들어 화면에 띄운 결과물을 스스로 검증하는 빈도도 늘었다. 재현 과제를 넘어선 전이 효과의 근거라는 설명이다.


평가용으로는 별도 벤치마크 '리크리에이션벤치(RecreationBench)'가 함께 공개됐다. 여러 분야와 플랫폼에 걸친 250개 과제로 구성되며, 참조 프로그램에 근거한 프로그램적 검증과 시각적 검증을 통해 상호작용 깊이별 결과를 확인한다. 각 검증 항목은 참조 프로그램과 사람 검토자를 거쳐 확정된 뒤 자동 채점용으로 고정됐다.


결과는 현재 기술 수준의 한계를 드러냈다. 전체 1위인 GPT-6 Astra가 58.1%를 기록했지만, 한 과제의 프로그램적 테스트를 모두 통과한 비율은 2.8%에 그쳤다. 에이전트들은 정적인 화면 구조는 비교적 안정적으로 따라 했으나 상호작용과 계산 결과를 재현하는 데는 약했고, 생성된 애플리케이션은 원본보다 규모가 작고 구조적으로 뭉뚱그려진 형태에 머물렀다. 연구진은 벤치마크와 환경, 테스트 스위트를 모두 공개한다고 밝혔다.


논문 번호는 arXiv:2609.22000이다. 이 기사는 저자가 공개한 초록을 정리한 것으로, 동료평가를 거치지 않은 사전공개 논문이다. 학습에 사용된 기반 모델의 종류와 규모, 공개 자료의 배포 시점과 이용 조건 등 초록에 담기지 않은 사항은 확인되지 않았다.