본문으로 건너뛰기

KOPA-Bench — 한국 공공 API 2,318개로 에이전트 시험

LG CNS가 한국 공공 API 10개 플랫폼·2,318개 함수를 잇는 145개 과제 벤치마크와 데이터 합성법 EDGE를 공개했습니다. 9B 모델이 27B에 근접한 수치와 한계를 정리했습니다.

AI피셜 편집부· 2분 읽기원문 보기 ↗
정부세종청사 북측 청사 건물군을 멀리서 바라본 전경
사진: Minseong Kim · CC BY-SA 4.0

핵심 답변

LG CNS 연구진이 9월 4일 arXiv에 올린 KOPA-Bench는 한국 공공 API 10개 플랫폼의 2,318개 함수를 여러 단계로 이어 호출해야 하는 145개 과제로 구성되며, 실제 API를 실행해 의존 관계를 검증하는 데이터 합성법 EDGE로 1,781개 학습 궤적을 만들었습니다. 이 데이터로 GRPO 학습한 Qwen3.5-9B는 pass@1이 0.3275에서 0.4310으로 올라 미학습 27B(0.4482)에 근접했고, Claude Sonnet 4.6은 0.4655였습니다.

TL;DR세 줄 요약

  • 145개 과제는 교통·금융·교육·법률·정치·지자체 행정 6개 도메인, 10개 공공 플랫폼, 2,318개 함수를 다루며 과제당 평균 5회(최대 14회) 도구 호출이 필요합니다.
  • EDGE는 제안된 도구 연결을 실제 API에 실행해 보고 불안정한 간선을 쳐낸 의존 그래프에서 1,781개 학습 궤적을 만듭니다.
  • GRPO 학습 후 Qwen3.5-9B는 pass@1 0.4310으로 미학습 27B(0.4482)에 근접했고, 4B는 0.1758에서 0.3094로 올랐습니다.
  • Claude Sonnet 4.6은 pass@1 0.4655, pass@4 0.8207로 가장 높았고 GPT-5.1은 0.3706이었습니다.

핵심 사실

arXiv 등록
2026-09-04arXiv:2609.05395
저자 소속
LG CNSDain Kim, Eungi Cho, Kyumin Kim, Shinyeong Noh, Kyuseong Lim
과제 수
145개6개 도메인, 10개 플랫폼, 2,318개 함수
학습 데이터
1,781개 궤적EDGE로 합성
9B pass@1
0.3275 → 0.4310미학습 27B는 0.4482
코드·데이터
공개 예정GitHub 저장소는 아직 자리만 있음

무슨 일인가요

LG CNS 연구진 5명이 9월 4일 arXiv에 올린 논문은 "오픈 모델이 정부 API를 여러 번 이어 호출하는 일에 약하다"는 문제에서 출발합니다. 논문 벤치마크 KOPA-Bench는 교통·금융·교육·법률·정치·지자체 행정 6개 도메인, 한국 공공 API 10개 플랫폼, 2,318개 함수 위에 만든 145개 과제로, 앞 호출의 출력을 다음 호출에 넣어야 풀립니다. 과제당 평균 5회, 최대 14회 호출이 필요하고 59%는 병렬 실행을 포함합니다. 논문

서울 여의도의 국회의사당 건물
벤치마크가 묶은 10개 플랫폼에는 국회 의안 정보를 여는 열린국회정보도 들어 있습니다. 사진은 여의도 국회의사당입니다.· 사진: Alain Seguin at Flickr, from Ottawa, Canada · CC BY-SA 3.0

채점은 세 축입니다. 최종 답이 정답과 맞는지(RESPONSE), 호출 뒤 시스템 상태가 해시로 일치하는지(ENVIRONMENT), 중복 호출 비율과 최소 경로 충족도로 잰 호출의 정확성·효율(ACTION)입니다. 논문

데이터 합성법 EDGE와 결과

EDGE: 실행으로 검증한 의존 그래프에서 궤적 만들기
  1. 도구 연결 제안

    출력이 다음 입력이 될 후보 간선

  2. 실제 API 실행

    성립하지 않는 간선은 제거

  3. 분기 분류

    응답 개수에 따라 팬아웃 제한 또는 축약

  4. 궤적 1,781개

    순차·병렬·조건 패턴

  5. GRPO 학습

    Qwen3.5-4B·9B, 8×H100

EDGE는 제안된 도구 연결을 실제 API에 실행해 불안정한 간선을 쳐낸 그래프를 만든 뒤, 응답이 많은 분기를 팬아웃 제한이나 결정적 축약으로 처리해 궤적을 뽑습니다. 이렇게 만든 1,781개 궤적으로 Qwen3.5-4B와 9B를 GRPO로 학습했습니다. 논문

KOPA-Bench pass@1 (%)
0.0%12.5%25.0%37.5%50.0%4B 기본4B 학습9B 기본9B 학습27B 기본GPT-5.1Sonnet 4.617.6%30.9%32.8%43.1%44.8%37.1%46.5%
KOPA-Bench pass@1 (%)
항목pass@1
4B 기본17.6%
4B 학습30.9%
9B 기본32.8%
9B 학습43.1%
27B 기본44.8%
GPT-5.137.1%
Sonnet 4.646.5%

출처: arXiv:2609.05395 주 결과표 (비율을 %로 환산). 4B·9B·27B는 Qwen3.5

학습한 9B는 pass@1 0.4310으로 미학습 27B의 0.4482에 근접했고, 4B는 0.1758에서 0.3094로 올랐습니다. 논문 비교 대상 중 가장 높은 것은 Claude Sonnet 4.6(pass@1 0.4655, pass@4 0.8207)이었고 GPT-5.1은 pass@1 0.3706, 다만 ACTION 점수는 0.5881로 가장 높았습니다. 논문 분포 밖 검증인 BFCL 멀티턴에서도 9B는 +5.87%p, 4B는 +4.04%p 올랐습니다. 논문

무엇을 보면 되나요

  • 공공 데이터 활용 팀: 한국어 공공 API를 실제로 이어 호출하는 벤치마크는 처음에 가깝습니다. 데이터가 공개되면 자체 에이전트 평가에 바로 쓸 수 있습니다. 추정
  • 소형 모델 운영: 실행으로 검증한 궤적 1,781개로 9B가 27B에 근접했다는 점은, 도메인별 도구 호출은 데이터 품질이 모델 크기를 상당 부분 대체한다는 신호입니다. 추정
  • 지켜볼 것: GitHub 저장소는 아직 자리만 있고 코드(MIT)·데이터(KOGL)·체크포인트를 준비 중이라고 적었습니다. 공식

자주 묻는 질문

어떤 공공 API가 들어 있나요?
논문 표기 기준으로 Korea Expressway Corporation, Seoul Open Data Plaza(교통), DART, KRX, Korea Deposit Insurance Corporation(금융), Educational Data Platform, HRD Korea(교육), Korean Law Info Center(법률), Open Assembly(정치), Gyeonggi Data Dream(지자체 행정)의 10개 플랫폼입니다. 과제의 59%는 병렬 호출을 포함합니다.
EDGE는 무엇이 다른가요?
도구 사이의 연결을 모델이 상상해서 만드는 대신 실제 API에 실행해 보고 성립하는 간선만 남깁니다. 그다음 응답 개수가 많은 분기는 팬아웃을 제한하거나 결정적으로 축약하는 규칙으로 궤적을 만듭니다. 그래서 학습 데이터가 실제로 동작하는 호출 순서만 담습니다.
지금 벤치마크를 받을 수 있나요?
GitHub 저장소는 '아직 공개 전'이라고 적혀 있고 코드(MIT), 데이터(공공누리 KOGL), 체크포인트를 준비 중이라고 밝혔습니다. 저장소는 이 논문이 EMNLP 2026 Industry Track에 채택됐다고도 적었습니다.

출처 · 3

  1. 1Multi-Step Tool-Calling over Korean Open Public APIs: A Benchmark and a Data-Synthesis Recipe (arXiv:2609.05395)논문arxiv.org/abs/2609.05395
  2. 2논문 전문 HTML (arXiv)논문arxiv.org/html/2609.05395
  3. 3EDGE-KOPA 저장소 (GitHub)참고github.com/dneirfi/EDGE-KOPA

이 글의 마크다운 원문: /posts/kopa-bench-korean-public-api-agents/md/ · 인용 시 출처를 “AI피셜”으로 표기해 주세요.

이 글이 도움이 됐다면 동료에게 보내 주세요.

AI피셜 새 글 알림

새 글이 올라오면 메일로 알려드려요

매일 5편, 5분 브리프. 스팸 없이 새 글 소식만. 언제든 한 번에 해지.

같은 태그·카테고리의 글을 골랐습니다.

논문 한입· 2

CUA-Universe — CLI 섞은 9B, OSWorld 40.2%

상하이교통대·저장대 연구진이 데스크톱 앱 16종을 GUI+명령줄 혼합 환경으로 만들고 9B 모델을 학습해 OSWorld 성공률을 23.4%에서 40.2%로 올렸습니다. 방법과 수치를 정리했습니다.

  • #논문
  • #에이전트
  • #컴퓨터 사용
논문 한입· 2

프런티어 모델 22종, 화학 벤치마크 답을 '외워서' 냈다

독일 연구진이 LLM 22종을 분자 물성 회귀 벤치마크 12개에서 자릿수 단위로 검사해, 5개 데이터셋에서 모델 절반 이상이 공개된 값을 그대로 꺼내 쓴다는 것을 보였습니다. 방법과 한계를 정리했습니다.

  • #논문
  • #벤치마크
  • #평가
논문 한입· 2

모델을 바꾸면 에이전트 메모리가 깨진다 — 최대 13%p

LinkedIn 연구진이 에이전트 메모리 4가지 구조가 모델 교체를 얼마나 견디는지 통제 실험했습니다. 요약 노트는 최대 13.28%p 흔들렸고 고정 스키마 그래프는 거의 변하지 않았습니다.

  • #논문
  • #에이전트
  • #메모리