무슨 일인가요
LG CNS 연구진 5명이 9월 4일 arXiv에 올린 논문은 "오픈 모델이 정부 API를 여러 번 이어 호출하는 일에 약하다"는 문제에서 출발합니다. 논문 벤치마크 KOPA-Bench는 교통·금융·교육·법률·정치·지자체 행정 6개 도메인, 한국 공공 API 10개 플랫폼, 2,318개 함수 위에 만든 145개 과제로, 앞 호출의 출력을 다음 호출에 넣어야 풀립니다. 과제당 평균 5회, 최대 14회 호출이 필요하고 59%는 병렬 실행을 포함합니다. 논문

채점은 세 축입니다. 최종 답이 정답과 맞는지(RESPONSE), 호출 뒤 시스템 상태가 해시로 일치하는지(ENVIRONMENT), 중복 호출 비율과 최소 경로 충족도로 잰 호출의 정확성·효율(ACTION)입니다. 논문
데이터 합성법 EDGE와 결과
도구 연결 제안
출력이 다음 입력이 될 후보 간선
실제 API 실행
성립하지 않는 간선은 제거
분기 분류
응답 개수에 따라 팬아웃 제한 또는 축약
궤적 1,781개
순차·병렬·조건 패턴
GRPO 학습
Qwen3.5-4B·9B, 8×H100
EDGE는 제안된 도구 연결을 실제 API에 실행해 불안정한 간선을 쳐낸 그래프를 만든 뒤, 응답이 많은 분기를 팬아웃 제한이나 결정적 축약으로 처리해 궤적을 뽑습니다. 이렇게 만든 1,781개 궤적으로 Qwen3.5-4B와 9B를 GRPO로 학습했습니다. 논문
| 항목 | pass@1 |
|---|---|
| 4B 기본 | 17.6% |
| 4B 학습 | 30.9% |
| 9B 기본 | 32.8% |
| 9B 학습 | 43.1% |
| 27B 기본 | 44.8% |
| GPT-5.1 | 37.1% |
| Sonnet 4.6 | 46.5% |
출처: arXiv:2609.05395 주 결과표 (비율을 %로 환산). 4B·9B·27B는 Qwen3.5
학습한 9B는 pass@1 0.4310으로 미학습 27B의 0.4482에 근접했고, 4B는 0.1758에서 0.3094로 올랐습니다. 논문 비교 대상 중 가장 높은 것은 Claude Sonnet 4.6(pass@1 0.4655, pass@4 0.8207)이었고 GPT-5.1은 pass@1 0.3706, 다만 ACTION 점수는 0.5881로 가장 높았습니다. 논문 분포 밖 검증인 BFCL 멀티턴에서도 9B는 +5.87%p, 4B는 +4.04%p 올랐습니다. 논문
무엇을 보면 되나요
- 공공 데이터 활용 팀: 한국어 공공 API를 실제로 이어 호출하는 벤치마크는 처음에 가깝습니다. 데이터가 공개되면 자체 에이전트 평가에 바로 쓸 수 있습니다. 추정
- 소형 모델 운영: 실행으로 검증한 궤적 1,781개로 9B가 27B에 근접했다는 점은, 도메인별 도구 호출은 데이터 품질이 모델 크기를 상당 부분 대체한다는 신호입니다. 추정
- 지켜볼 것: GitHub 저장소는 아직 자리만 있고 코드(MIT)·데이터(KOGL)·체크포인트를 준비 중이라고 적었습니다. 공식



