# KOPA-Bench — 한국 공공 API 2,318개로 에이전트 시험

> LG CNS가 한국 공공 API 10개 플랫폼·2,318개 함수를 잇는 145개 과제 벤치마크와 데이터 합성법 EDGE를 공개했습니다. 9B 모델이 27B에 근접한 수치와 한계를 정리했습니다.

- 출처 사이트: AI피셜 (https://aifficial.net/posts/kopa-bench-korean-public-api-agents/)
- 발행: 2026-09-07
- 카테고리: 논문 한입 · 태그: 논문, 에이전트, 벤치마크, 한국, 도구 호출

## 핵심 답변

LG CNS 연구진이 9월 4일 arXiv에 올린 KOPA-Bench는 한국 공공 API 10개 플랫폼의 2,318개 함수를 여러 단계로 이어 호출해야 하는 145개 과제로 구성되며, 실제 API를 실행해 의존 관계를 검증하는 데이터 합성법 EDGE로 1,781개 학습 궤적을 만들었습니다. 이 데이터로 GRPO 학습한 Qwen3.5-9B는 pass@1이 0.3275에서 0.4310으로 올라 미학습 27B(0.4482)에 근접했고, Claude Sonnet 4.6은 0.4655였습니다.

## 요약

- 145개 과제는 교통·금융·교육·법률·정치·지자체 행정 6개 도메인, 10개 공공 플랫폼, 2,318개 함수를 다루며 과제당 평균 5회(최대 14회) 도구 호출이 필요합니다.
- EDGE는 제안된 도구 연결을 실제 API에 실행해 보고 불안정한 간선을 쳐낸 의존 그래프에서 1,781개 학습 궤적을 만듭니다.
- GRPO 학습 후 Qwen3.5-9B는 pass@1 0.4310으로 미학습 27B(0.4482)에 근접했고, 4B는 0.1758에서 0.3094로 올랐습니다.
- Claude Sonnet 4.6은 pass@1 0.4655, pass@4 0.8207로 가장 높았고 GPT-5.1은 0.3706이었습니다.

## 핵심 사실

| 항목 | 값 |
|---|---|
| arXiv 등록 | 2026-09-04 (arXiv:2609.05395) |
| 저자 소속 | LG CNS (Dain Kim, Eungi Cho, Kyumin Kim, Shinyeong Noh, Kyuseong Lim) |
| 과제 수 | 145개 (6개 도메인, 10개 플랫폼, 2,318개 함수) |
| 학습 데이터 | 1,781개 궤적 (EDGE로 합성) |
| 9B pass@1 | 0.3275 → 0.4310 (미학습 27B는 0.4482) |
| 코드·데이터 | 공개 예정 (GitHub 저장소는 아직 자리만 있음) |


## 무슨 일인가요

LG CNS 연구진 5명이 9월 4일 arXiv에 올린 논문은 "오픈 모델이 정부 API를 여러 번 이어 호출하는 일에 약하다"는 문제에서 출발합니다.  벤치마크 KOPA-Bench는 교통·금융·교육·법률·정치·지자체 행정 6개 도메인, 한국 공공 API 10개 플랫폼, 2,318개 함수 위에 만든 145개 과제로, 앞 호출의 출력을 다음 호출에 넣어야 풀립니다. 과제당 평균 5회, 최대 14회 호출이 필요하고 59%는 병렬 실행을 포함합니다. 



채점은 세 축입니다. 최종 답이 정답과 맞는지(RESPONSE), 호출 뒤 시스템 상태가 해시로 일치하는지(ENVIRONMENT), 중복 호출 비율과 최소 경로 충족도로 잰 호출의 정확성·효율(ACTION)입니다. 

## 데이터 합성법 EDGE와 결과



EDGE는 제안된 도구 연결을 실제 API에 실행해 불안정한 간선을 쳐낸 그래프를 만든 뒤, 응답이 많은 분기를 팬아웃 제한이나 결정적 축약으로 처리해 궤적을 뽑습니다. 이렇게 만든 1,781개 궤적으로 Qwen3.5-4B와 9B를 GRPO로 학습했습니다. 



학습한 9B는 pass@1 0.4310으로 미학습 27B의 0.4482에 근접했고, 4B는 0.1758에서 0.3094로 올랐습니다.  비교 대상 중 가장 높은 것은 Claude Sonnet 4.6(pass@1 0.4655, pass@4 0.8207)이었고 GPT-5.1은 pass@1 0.3706, 다만 ACTION 점수는 0.5881로 가장 높았습니다.  분포 밖 검증인 BFCL 멀티턴에서도 9B는 +5.87%p, 4B는 +4.04%p 올랐습니다. 

## 무엇을 보면 되나요

- **공공 데이터 활용 팀**: 한국어 공공 API를 실제로 이어 호출하는 벤치마크는 처음에 가깝습니다. 데이터가 공개되면 자체 에이전트 평가에 바로 쓸 수 있습니다. 
- **소형 모델 운영**: 실행으로 검증한 궤적 1,781개로 9B가 27B에 근접했다는 점은, 도메인별 도구 호출은 데이터 품질이 모델 크기를 상당 부분 대체한다는 신호입니다. 
- **지켜볼 것**: GitHub 저장소는 아직 자리만 있고 코드(MIT)·데이터(KOGL)·체크포인트를 준비 중이라고 적었습니다. 


저자들은 벤치마크가 살아 있는 공공 API에 의존해 스키마와 가용성이 바뀔 수 있다는 점, 한국 공공 부문 API에 한정돼 다른 언어·국가·상용 시스템으로의 전이는 확인되지 않았다는 점, 비교가 EDGE 변형 간 절제 실험에 그쳐 기존 합성 파이프라인과의 엔드투엔드 비교는 하지 않았다는 점을 밝혔습니다. 



가장 눈에 띄는 숫자는 Claude Sonnet 4.6의 pass@1 0.4655와 pass@4 0.8207의 차이입니다. 네 번 시도하면 열에 여덟은 풀지만 한 번에는 절반도 안 된다는 뜻이고, 이는 공공 API 에이전트의 병목이 모델 지능보다 API 응답의 불안정성과 호출 순서의 탐색에 있다는 방증입니다. 국내 기업이 자기 API로 이런 벤치마크를 만들어 공개했다는 사실 자체가 한국어 에이전트 생태계에 의미 있는 출발점이라고 봅니다. 



## 자주 묻는 질문

**Q. 어떤 공공 API가 들어 있나요?**

논문 표기 기준으로 Korea Expressway Corporation, Seoul Open Data Plaza(교통), DART, KRX, Korea Deposit Insurance Corporation(금융), Educational Data Platform, HRD Korea(교육), Korean Law Info Center(법률), Open Assembly(정치), Gyeonggi Data Dream(지자체 행정)의 10개 플랫폼입니다. 과제의 59%는 병렬 호출을 포함합니다.

**Q. EDGE는 무엇이 다른가요?**

도구 사이의 연결을 모델이 상상해서 만드는 대신 실제 API에 실행해 보고 성립하는 간선만 남깁니다. 그다음 응답 개수가 많은 분기는 팬아웃을 제한하거나 결정적으로 축약하는 규칙으로 궤적을 만듭니다. 그래서 학습 데이터가 실제로 동작하는 호출 순서만 담습니다.

**Q. 지금 벤치마크를 받을 수 있나요?**

GitHub 저장소는 '아직 공개 전'이라고 적혀 있고 코드(MIT), 데이터(공공누리 KOGL), 체크포인트를 준비 중이라고 밝혔습니다. 저장소는 이 논문이 EMNLP 2026 Industry Track에 채택됐다고도 적었습니다.

## 출처

1. [Multi-Step Tool-Calling over Korean Open Public APIs: A Benchmark and a Data-Synthesis Recipe (arXiv:2609.05395)](https://arxiv.org/abs/2609.05395) (paper)
2. [논문 전문 HTML (arXiv)](https://arxiv.org/html/2609.05395) (paper)
3. [EDGE-KOPA 저장소 (GitHub)](https://github.com/dneirfi/EDGE-KOPA) (other)

_이 문서는 AI피셜 편집부가 작성했습니다. 인용 시 출처를 표기해 주세요._