# AI가 IOI 2026 최고 인간 점수를 넘었다 — 535.4점

> NVIDIA 연구진의 Nemotron-3-Ultra-CC가 IOI 2026 문제를 인간과 같은 제한 아래 풀어 535.4/600점을 받았습니다. 최고 인간 점수 498.27을 넘겼다는 주장과 한계를 정리했습니다.

- 출처 사이트: AI피셜 (https://aifficial.net/posts/nemotron-ultra-cc-ioi-2026/)
- 발행: 2026-09-04
- 카테고리: 논문 한입 · 태그: 논문, 코딩 에이전트, 벤치마크, NVIDIA, 경진대회

## 핵심 답변

NVIDIA 연구진은 2026년 9월 4일 갱신한 arXiv 논문에서 Nemotron-3-Ultra-CC 시스템이 IOI 2026 문제 6개를 인간 참가자와 같은 시간·제출 제한 아래 풀어 600점 만점에 535.4점을 받았다고 밝혔습니다. 금메달 기준 361.12점과 최고 인간 점수 498.27점을 모두 넘긴 것으로, 다만 최대 760장의 GB300 GPU를 쓴 시스템 단위 비교라는 점을 저자들도 한계로 적었습니다.

## 요약

- Nemotron-3-Ultra-CC(550B-A55B)가 IOI 2026 실전 조건에서 535.4/600점을 받아 금메달 기준(361.12)과 최고 인간 점수(498.27)를 넘었습니다.
- 핵심은 GenCorrect라는 테스트 시점 전략입니다. 후보 최대 200개를 만들고 다양성 기준으로 10개를 골라 채점한 뒤 피드백으로 다시 고치는 과정을 5라운드 반복합니다.
- 훈련은 경진대회 문제 22,000개를 모아 SFT(대형 모델)와 SFT+RL(소형 모델)로 진행했고, IOI 2025·ICPC 2025 문제는 훈련에서 제외했습니다.
- 저자들은 최대 760장의 GB300 GPU를 쓴 '시스템 단위' 비교이며 인간과 같은 자원 조건이 아니라고 명시했습니다.

## 핵심 사실

| 항목 | 값 |
|---|---|
| 논문 | arXiv 2609.02849 (v1 2026-09-02, v2 2026-09-04) |
| IOI 2026 점수 | 535.4 / 600 (Nemotron-3-Ultra-CC 대회 특화 시스템) |
| 최고 인간 점수 | 498.27 (논문 기재, 금메달 기준 361.12) |
| 모델 | 550B-A55B (Ultra) · 30B-A3B (Nano) (Nemotron-3 계열에서 초기화) |
| 훈련 문제 수 | 22,000개 (16개 대회 계열, 약 20년치) |
| 실전 GPU | 최대 760장 GB300 (IOI 2026 라이브 실행 기준) |


## 무슨 일인가요

2026년 9월 4일 두 번째 판이 올라온 arXiv 논문 "Post-Training Language Models for Gold-Medal Performance in Coding Competitions"은 경진대회 코딩에 특화한 두 모델, **Nemotron-3-Nano-CC**(30B-A3B)와 **Nemotron-3-Ultra-CC**(550B-A55B)를 소개합니다.  저자는 Aleksander Ficek, Sean Narenthiran, Mehrzad Samadi, Somshubra Majumdar, Boris Ginsburg 5명이며, AI Weekly는 이를 NVIDIA 연구진의 결과로 보도했습니다. 



가장 눈에 띄는 숫자는 IOI 2026입니다. 대회 특화 Ultra-CC 시스템이 인간 참가자와 같은 시간·인터넷·제출 제한 아래 600점 만점에 **535.4점**을 받아, 금메달 기준 361.12점과 최고 인간 점수 498.27점을 모두 넘겼습니다.  저자들은 "IOI 문제 세트에서 최고 득점 인간 참가자를 앞선 첫 AI 시스템"이라고 썼습니다. 

IOI 공식 통계 사이트에 따르면 IOI 2026은 2026년 8월 9일부터 16일까지 우즈베키스탄 타슈켄트에서 열렸고, 참가자 375명에 금메달 기준은 361.12점 이상이었습니다.  논문이 인용한 금메달 기준과 일치합니다.



## 어떻게 만들었나요

훈련 데이터는 최근 20년간 16개 지역·국제 대회 계열에서 모은 문제 22,000개입니다.  이 문제로 합성 추론 흔적을 만들어 Nano-CC에는 SFT와 RL(GRPO)을, Ultra-CC에는 계산 자원 제약 때문에 SFT만 적용했습니다.  교사 모델은 DeepSeek-V4-Flash였고, IOI 2026용 시스템에는 더 짧은 출력으로 더 높은 점수를 내는 GLM-5.2 데이터를 썼습니다.  IOI 2025, ICPC 2025, LiveCodeBench Pro 문제는 훈련에서 명시적으로 제외했습니다. 

점수를 끌어올린 다른 축은 **GenCorrect**라는 테스트 시점 전략입니다. IOI 2025 기준으로 Nano-CC는 후처리 전 130점에서 후처리 후 291점, GenCorrect 적용 후 468점으로 올라 금메달 기준 438.3점을 넘겼고, Ultra-CC는 502점에 이르렀습니다. 



IOI 2026 실전에서는 마지막 라운드 후보를 200개에서 1,000개로 늘리고, 모델이 만든 테스트 입력 생성기와 검증기로 제출안을 골랐습니다.  NVFP4 양자화로 처리량을 3.7배 높이는 대신 Score@1이 59.4%에서 52.8%로 6.6%p 낮아지는 절충도 있었습니다. 

## 다른 벤치마크에서는

| 벤치마크 | Nano-CC | Ultra-CC |
| --- | --- | --- |
| IOI 2025 Score@1 | 48.5% (291/600) | 50.7% (304/600) |
| ICPC 2025 Pass@1 | 51.0% | 57.4% |
| LiveCodeBench Pro Pass@1 | 71.6% | 74.5% |

위 수치는 모두 논문 기재값입니다.  ICPC 2025에서 Ultra-CC는 평균 약 6.9문제를 풀어 금메달 기준(약 9문제)에는 미치지 못했습니다.  IOI 실전 결과와 달리 정적 벤치마크에서는 아직 절대 우위라고 보기 어렵다는 뜻입니다. 


저자들은 이 접근이 "상당한 훈련·테스트 시점 계산"을 요구하며, IOI 2026 라이브 실행에 최대 760장의 GB300 GPU를 썼다고 밝혔습니다. 따라서 결과는 "같은 시간·제출 제한 아래의 시스템 단위 비교"이지 인간과 같은 자원 조건의 비교가 아니라고 명시했습니다. 또 계산 제약으로 Ultra-CC에는 RL을 적용하지 못했고, 결과가 경진대회 코딩 밖으로 일반화되지 않을 수 있으며, 제3자 재배포 제한 때문에 훈련 데이터 전체를 공개할 수 없다고 적었습니다. 


## 무엇을 보면 되나요

AI Weekly는 이 결과가 독립 검증이 아닌 저자 보고이며, 문제별 점수와 계산 예산이 공개되지 않았고 IOI 주최 측의 확인도 아직 없다고 짚었습니다.  arXiv 페이지에도 코드나 가중치 링크는 없습니다.  따라서 지금 확인할 수 있는 것은 논문의 방법론과 저자가 제시한 수치까지입니다.


이 논문에서 모델 크기보다 흥미로운 대목은 GenCorrect입니다. 같은 모델이라도 "많이 만들고, 다르게 골라, 채점 결과로 다시 고치는" 절차만으로 IOI 2025 점수가 291점에서 468점으로 뛰었습니다. 코딩 에이전트를 운영하는 팀이라면 모델 교체보다 채점기와 피드백 루프를 먼저 설계하는 편이 비용 대비 효과가 클 수 있습니다. 다만 760장의 GPU가 뒷받침한 결과이므로, 이 수치를 일반 업무 환경의 기대치로 옮기는 것은 무리라고 봅니다. 



이 글은 2026년 9월 4일 갱신된 arXiv 논문(2609.02849)과 IOI 공식 통계, AI Weekly 보도를 바탕으로 정리한 비공식 요약입니다. 모델 공개 여부와 독립 검증 결과는 이후 바뀔 수 있습니다.



## 자주 묻는 질문

**Q. 정말 인간 참가자와 같은 조건이었나요?**

논문은 5시간짜리 세션 2회, 세션당 문제 3개, 문제당 최대 50회 제출, 분당 1회 제출, 인터넷 차단이라는 IOI 2026의 시간·제출·접속 제한을 그대로 적용했다고 밝혔습니다. 다만 최대 760장의 GB300 GPU를 쓴 시스템이므로 계산 자원까지 같은 조건은 아니었다고 저자들이 한계 절에 적었습니다.

**Q. GenCorrect는 무엇인가요?**

생성·평가·수정을 반복하는 테스트 시점 전략입니다. 한 라운드에 후보 풀이를 최대 200개 만들고, 토큰 유사도로 묶어 서로 다른 대표 10개를 고른 뒤 채점기에 제출하고, 부분 문제별 최고 점수를 누적해 다음 라운드 프롬프트에 반영합니다. IOI 2026 실전에서는 마지막 라운드 후보를 1,000개로 늘렸습니다.

**Q. 모델을 내려받을 수 있나요?**

arXiv 페이지에는 코드나 모델 가중치 링크가 없고, 저자들은 제3자 재배포 제한 때문에 훈련 데이터 전체는 공개할 수 없다고 밝혔습니다. 공개 여부는 이 글 작성 시점에 확인되지 않았습니다.

## 출처

1. [Post-Training Language Models for Gold-Medal Performance in Coding Competitions (arXiv 2609.02849)](https://arxiv.org/abs/2609.02849) (paper)
2. [같은 논문 HTML 전문 (arXiv)](https://arxiv.org/html/2609.02849) (paper)
3. [IOI 2026 대회 통계 (IOI 공식 통계 사이트)](https://stats.ioinformatics.org/olympiads/2026) (data)
4. [Nvidia's 550B Nemotron beats top human coder at IOI 2026 (AI Weekly)](https://aiweekly.co/alerts/nvidias-550b-nemotron-beats-top-human-coder-at-ioi-2026) (report)

_이 문서는 AI피셜 편집부가 작성했습니다. 인용 시 출처를 표기해 주세요._