본문으로 건너뛰기

CUA-Universe — CLI 섞은 9B, OSWorld 40.2%

상하이교통대·저장대 연구진이 데스크톱 앱 16종을 GUI+명령줄 혼합 환경으로 만들고 9B 모델을 학습해 OSWorld 성공률을 23.4%에서 40.2%로 올렸습니다. 방법과 수치를 정리했습니다.

AI피셜 편집부· 2분 읽기원문 보기 ↗
사무실 책상 위에 모니터·키보드·마우스와 함께 놓인 데스크톱 워크스테이션 본체
사진: Mnicolois · CC BY 4.0

핵심 답변

9월 4일 arXiv에 오른 CUA-Universe는 데스크톱 앱을 재현 가능한 VM으로 만들고 명령줄 도구를 붙이는 App-Forge, GUI와 CLI를 섞은 과제를 합성하는 Task-Weave, 효율적인 경로로 롤아웃해 검증된 궤적을 모으는 Path-Steer 세 부분으로 구성됩니다. 이 궤적으로 학습한 Qwen3.5-9B는 OSWorld 244개 과제에서 성공률이 23.4%에서 40.2%로 16.8%p 올랐고, 단계는 57%, 토큰은 44% 줄었습니다.

TL;DR세 줄 요약

  • 컴퓨터 사용 에이전트가 GUI 클릭에만 의존해 느리고 비싸다는 문제를, 시각 확인과 명령줄을 섞는 '하이브리드' 환경으로 풉니다.
  • OSWorld 앱 8종에 Audacity·Blender·Draw.io·Godot·Kdenlive·OBS Studio·QGIS·Zotero 8종을 더해 16개 앱을 VM으로 만들었습니다.
  • 학습한 9B는 자체 벤치마크 CUA-Verse에서 점수 0.189→0.582(+39.3점), OSWorld 성공률 23.4%→40.2%, OSWorld-MCP 20.90%→28.69%를 기록했습니다.
  • 같은 OSWorld 설정에서 GPT-5.5는 68.0%, 오픈 모델 EvoCUA-8B는 43.3%로 아직 격차가 있고, 코드·데이터는 공개 예정입니다.

핵심 사실

arXiv 등록
2026-09-04arXiv:2609.05374
소속
상하이교통대·저장대
기반 모델
Qwen3.5-9BLoRA 3 에폭, 8×A100
앱 수
16종OSWorld 8종 + 신규 8종
OSWorld 성공률
23.4% → 40.2%244개 과제, GUI+CLI 설정
CUA-Verse 점수
0.189 → 0.5828개 앱 × 20개 과제

무슨 일인가요

컴퓨터 사용 에이전트(CUA)는 대부분 화면을 보고 클릭하는 GUI 방식에 의존해 단계가 길고 토큰을 많이 씁니다. 실제 사람의 작업은 시각 확인과 명령줄 조작이 섞여 있는데, 둘을 함께 지원하는 환경은 만들기 어려워 드물었다는 것이 논문의 출발점입니다. 논문 상하이교통대와 저장대 연구진이 9월 4일 arXiv에 올린 CUA-Universe는 이를 세 부분으로 풉니다. 논문

영상 편집용 컬러 키보드와 오디오 워크스테이션이 놓인 작업 책상
논문이 환경으로 만든 앱에는 Audacity·Kdenlive·OBS Studio 같은 음향·영상 도구가 들어 있습니다. 사진은 영상·음향 편집 작업대입니다.· 사진: Ben2742 · CC0
CUA-Universe 구성
  1. App-Forge

    앱을 재현 가능한 VM으로 만들고 CLI 도구를 발견·래핑·생성

  2. Task-Weave

    GUI+CLI 혼합 과제를 난이도별로 합성

  3. Path-Steer

    효율적 경로로 롤아웃, 검증된 궤적 수집

  4. 학습

    Qwen3.5-9B LoRA 3 에폭

앱은 OSWorld의 Chrome, GIMP, LibreOffice Calc·Impress·Writer, Thunderbird, VLC, VS Code 8종에 Audacity, Blender, Draw.io, Godot, Kdenlive, OBS Studio, QGIS, Zotero 8종을 더한 16종입니다. 논문 학습은 Qwen3.5-9B에 단계 단위 궤적으로 LoRA를 3 에폭 적용했고, 8×A100을 썼습니다. 논문

결과: 성공률은 오르고 비용은 줄었습니다

학습 전후 성공률·점수 (%)
0.0%25.0%50.0%75.0%100.0%CUA-Verse 점수OSWorld SROSWorld-MCP SR18.9%23.4%20.9%58.2%40.2%28.7%
  • Qwen3.5-9B 기본
  • CUA-Universe 학습
학습 전후 성공률·점수 (%)
항목Qwen3.5-9B 기본CUA-Universe 학습
CUA-Verse 점수18.9%58.2%
OSWorld SR23.4%40.2%
OSWorld-MCP SR20.9%28.7%

출처: arXiv:2609.05374 Table 1·2 (CUA-Verse 점수는 비율을 %로 환산)

자체 벤치마크 CUA-Verse(8개 앱 × 20개 과제)에서 점수는 0.189에서 0.582로 39.3점 올랐고 단계는 37%, 토큰은 60% 줄었습니다. 논문 OSWorld 244개 과제의 GUI+CLI 설정에서는 성공률이 23.4%에서 40.2%로 16.8%p 올랐고 단계 57%, 토큰 44%가 줄었습니다. 논문 OSWorld-MCP에서는 성공률 20.90%에서 28.69%로, 도구 호출률(TIR)은 10.66%에서 23.36%로 올랐습니다. 논문

비교 대상과의 거리도 논문에 있습니다. 같은 OSWorld 설정에서 GPT-5.5는 68.0%, Seed2.1 Pro는 59.0%, Kimi K2.5는 54.5%였고, 오픈 모델 EvoCUA-8B는 43.3%로 학습한 9B(40.2%)보다 조금 앞섰습니다. 논문 앱별로는 Blender(0.398)와 Godot(0.460) 같은 3D·공간 앱이 가장 약해 "3D 데이터 커버리지에 여지가 있다"고 적었습니다. 논문

무엇을 보면 되나요

  • 에이전트 개발자: 성공률만큼 눈여겨볼 것은 단계·토큰 감소폭입니다. 같은 과제를 CLI로 우회하면 비용이 절반 가까이 줄 수 있다는 실측입니다.
  • 환경 설계자: 앱을 VM으로 고정하고 CLI를 붙이는 App-Forge 방식은 다른 앱에도 적용할 수 있는 틀입니다. 다만 코드·데이터는 확인 시점에 아직 공개 전이었습니다. 추정
  • 지켜볼 것: 244개 통제 프로토콜이 아닌 OSWorld 전체 점수, 그리고 공개 후 다른 기반 모델에서의 재현 여부입니다.

자주 묻는 질문

GUI 전용 에이전트와 무엇이 다른가요?
실제 업무는 화면을 보며 확인하는 일과 명령줄로 처리하는 일이 섞여 있습니다. 파일 변환이나 일괄 처리는 CLI가 빠르고, 결과 확인은 GUI가 맞습니다. 이 논문은 두 모달리티를 한 환경에서 쓸 수 있게 하고, 어느 쪽을 언제 쓸지 학습시켰습니다.
OSWorld 전체 점수인가요?
아닙니다. os와 multi-app 분할을 뺀 244개 과제의 통제 프로토콜입니다. 같은 과제에서 GUI 전용과 GUI+CLI 인터페이스를 짝지어 비교하기 위한 설정이라고 논문은 밝혔습니다.
지금 써 볼 수 있나요?
논문은 코드와 데이터를 공개하겠다고 적었지만 확인 시점에는 저장소 링크가 없었습니다. 환경 구성 요소인 App-Forge, Task-Weave, Path-Steer의 설계는 논문에 상세히 나와 있습니다.

출처 · 2

  1. 1CUA-Universe: A Scalable and Dynamic Environment for Hybrid GUI+CLI Agents (arXiv:2609.05374)논문arxiv.org/abs/2609.05374
  2. 2논문 전문 HTML (arXiv)논문arxiv.org/html/2609.05374

이 글의 마크다운 원문: /posts/cua-universe-hybrid-gui-cli-agents/md/ · 인용 시 출처를 “AI피셜”으로 표기해 주세요.

이 글이 도움이 됐다면 동료에게 보내 주세요.

AI피셜 새 글 알림

새 글이 올라오면 메일로 알려드려요

매일 5편, 5분 브리프. 스팸 없이 새 글 소식만. 언제든 한 번에 해지.

같은 태그·카테고리의 글을 골랐습니다.

논문 한입· 2

KOPA-Bench — 한국 공공 API 2,318개로 에이전트 시험

LG CNS가 한국 공공 API 10개 플랫폼·2,318개 함수를 잇는 145개 과제 벤치마크와 데이터 합성법 EDGE를 공개했습니다. 9B 모델이 27B에 근접한 수치와 한계를 정리했습니다.

  • #논문
  • #에이전트
  • #벤치마크
논문 한입· 2

프런티어 모델 22종, 화학 벤치마크 답을 '외워서' 냈다

독일 연구진이 LLM 22종을 분자 물성 회귀 벤치마크 12개에서 자릿수 단위로 검사해, 5개 데이터셋에서 모델 절반 이상이 공개된 값을 그대로 꺼내 쓴다는 것을 보였습니다. 방법과 한계를 정리했습니다.

  • #논문
  • #벤치마크
  • #평가
논문 한입· 2

모델을 바꾸면 에이전트 메모리가 깨진다 — 최대 13%p

LinkedIn 연구진이 에이전트 메모리 4가지 구조가 모델 교체를 얼마나 견디는지 통제 실험했습니다. 요약 노트는 최대 13.28%p 흔들렸고 고정 스키마 그래프는 거의 변하지 않았습니다.

  • #논문
  • #에이전트
  • #메모리