무슨 일인가요
컴퓨터 사용 에이전트(CUA)는 대부분 화면을 보고 클릭하는 GUI 방식에 의존해 단계가 길고 토큰을 많이 씁니다. 실제 사람의 작업은 시각 확인과 명령줄 조작이 섞여 있는데, 둘을 함께 지원하는 환경은 만들기 어려워 드물었다는 것이 논문의 출발점입니다. 논문 상하이교통대와 저장대 연구진이 9월 4일 arXiv에 올린 CUA-Universe는 이를 세 부분으로 풉니다. 논문

App-Forge
앱을 재현 가능한 VM으로 만들고 CLI 도구를 발견·래핑·생성
Task-Weave
GUI+CLI 혼합 과제를 난이도별로 합성
Path-Steer
효율적 경로로 롤아웃, 검증된 궤적 수집
학습
Qwen3.5-9B LoRA 3 에폭
앱은 OSWorld의 Chrome, GIMP, LibreOffice Calc·Impress·Writer, Thunderbird, VLC, VS Code 8종에 Audacity, Blender, Draw.io, Godot, Kdenlive, OBS Studio, QGIS, Zotero 8종을 더한 16종입니다. 논문 학습은 Qwen3.5-9B에 단계 단위 궤적으로 LoRA를 3 에폭 적용했고, 8×A100을 썼습니다. 논문
결과: 성공률은 오르고 비용은 줄었습니다
- Qwen3.5-9B 기본
- CUA-Universe 학습
| 항목 | Qwen3.5-9B 기본 | CUA-Universe 학습 |
|---|---|---|
| CUA-Verse 점수 | 18.9% | 58.2% |
| OSWorld SR | 23.4% | 40.2% |
| OSWorld-MCP SR | 20.9% | 28.7% |
출처: arXiv:2609.05374 Table 1·2 (CUA-Verse 점수는 비율을 %로 환산)
자체 벤치마크 CUA-Verse(8개 앱 × 20개 과제)에서 점수는 0.189에서 0.582로 39.3점 올랐고 단계는 37%, 토큰은 60% 줄었습니다. 논문 OSWorld 244개 과제의 GUI+CLI 설정에서는 성공률이 23.4%에서 40.2%로 16.8%p 올랐고 단계 57%, 토큰 44%가 줄었습니다. 논문 OSWorld-MCP에서는 성공률 20.90%에서 28.69%로, 도구 호출률(TIR)은 10.66%에서 23.36%로 올랐습니다. 논문
비교 대상과의 거리도 논문에 있습니다. 같은 OSWorld 설정에서 GPT-5.5는 68.0%, Seed2.1 Pro는 59.0%, Kimi K2.5는 54.5%였고, 오픈 모델 EvoCUA-8B는 43.3%로 학습한 9B(40.2%)보다 조금 앞섰습니다. 논문 앱별로는 Blender(0.398)와 Godot(0.460) 같은 3D·공간 앱이 가장 약해 "3D 데이터 커버리지에 여지가 있다"고 적었습니다. 논문
무엇을 보면 되나요
- 에이전트 개발자: 성공률만큼 눈여겨볼 것은 단계·토큰 감소폭입니다. 같은 과제를 CLI로 우회하면 비용이 절반 가까이 줄 수 있다는 실측입니다.
- 환경 설계자: 앱을 VM으로 고정하고 CLI를 붙이는 App-Forge 방식은 다른 앱에도 적용할 수 있는 틀입니다. 다만 코드·데이터는 확인 시점에 아직 공개 전이었습니다. 추정
- 지켜볼 것: 244개 통제 프로토콜이 아닌 OSWorld 전체 점수, 그리고 공개 후 다른 기반 모델에서의 재현 여부입니다.



