본문으로 건너뛰기

AI가 IOI 2026 최고 인간 점수를 넘었다 — 535.4점

NVIDIA 연구진의 Nemotron-3-Ultra-CC가 IOI 2026 문제를 인간과 같은 제한 아래 풀어 535.4/600점을 받았습니다. 최고 인간 점수 498.27을 넘겼다는 주장과 한계를 정리했습니다.

AI피셜 편집부· 3분 읽기원문 보기 ↗
NASA 에임스 연구센터의 플레이아데스 슈퍼컴퓨터 연산 캐비닛 두 줄
사진: NASA Ames Research Center · Public domain

핵심 답변

NVIDIA 연구진은 2026년 9월 4일 갱신한 arXiv 논문에서 Nemotron-3-Ultra-CC 시스템이 IOI 2026 문제 6개를 인간 참가자와 같은 시간·제출 제한 아래 풀어 600점 만점에 535.4점을 받았다고 밝혔습니다. 금메달 기준 361.12점과 최고 인간 점수 498.27점을 모두 넘긴 것으로, 다만 최대 760장의 GB300 GPU를 쓴 시스템 단위 비교라는 점을 저자들도 한계로 적었습니다.

TL;DR세 줄 요약

  • Nemotron-3-Ultra-CC(550B-A55B)가 IOI 2026 실전 조건에서 535.4/600점을 받아 금메달 기준(361.12)과 최고 인간 점수(498.27)를 넘었습니다.
  • 핵심은 GenCorrect라는 테스트 시점 전략입니다. 후보 최대 200개를 만들고 다양성 기준으로 10개를 골라 채점한 뒤 피드백으로 다시 고치는 과정을 5라운드 반복합니다.
  • 훈련은 경진대회 문제 22,000개를 모아 SFT(대형 모델)와 SFT+RL(소형 모델)로 진행했고, IOI 2025·ICPC 2025 문제는 훈련에서 제외했습니다.
  • 저자들은 최대 760장의 GB300 GPU를 쓴 '시스템 단위' 비교이며 인간과 같은 자원 조건이 아니라고 명시했습니다.

핵심 사실

논문
arXiv 2609.02849v1 2026-09-02, v2 2026-09-04
IOI 2026 점수
535.4 / 600Nemotron-3-Ultra-CC 대회 특화 시스템
최고 인간 점수
498.27논문 기재, 금메달 기준 361.12
모델
550B-A55B (Ultra) · 30B-A3B (Nano)Nemotron-3 계열에서 초기화
훈련 문제 수
22,000개16개 대회 계열, 약 20년치
실전 GPU
최대 760장 GB300IOI 2026 라이브 실행 기준

무슨 일인가요

2026년 9월 4일 두 번째 판이 올라온 arXiv 논문 "Post-Training Language Models for Gold-Medal Performance in Coding Competitions"은 경진대회 코딩에 특화한 두 모델, Nemotron-3-Nano-CC(30B-A3B)와 Nemotron-3-Ultra-CC(550B-A55B)를 소개합니다. 논문 저자는 Aleksander Ficek, Sean Narenthiran, Mehrzad Samadi, Somshubra Majumdar, Boris Ginsburg 5명이며, AI Weekly는 이를 NVIDIA 연구진의 결과로 보도했습니다. 보도

워싱턴대학교 컴퓨터과학공학부 대학원생 연구실에서 한 사람이 모니터 앞에 앉아 있는 모습
인간 참가자는 이런 책상 앞에서 5시간짜리 세션 두 번을 치릅니다. 사진은 워싱턴대학교 컴퓨터과학공학부의 대학원생 연구실입니다.· 사진: Joe Mabel · CC BY-SA 4.0

가장 눈에 띄는 숫자는 IOI 2026입니다. 대회 특화 Ultra-CC 시스템이 인간 참가자와 같은 시간·인터넷·제출 제한 아래 600점 만점에 535.4점을 받아, 금메달 기준 361.12점과 최고 인간 점수 498.27점을 모두 넘겼습니다. 논문 저자들은 "IOI 문제 세트에서 최고 득점 인간 참가자를 앞선 첫 AI 시스템"이라고 썼습니다. 논문

IOI 공식 통계 사이트에 따르면 IOI 2026은 2026년 8월 9일부터 16일까지 우즈베키스탄 타슈켄트에서 열렸고, 참가자 375명에 금메달 기준은 361.12점 이상이었습니다. 데이터 논문이 인용한 금메달 기준과 일치합니다.

IOI 2026 점수 비교 (600점 만점)
0.0250.0500.0750.01,000금메달 기준최고 인간 점수Nemotron-3-Ultra-CC361.1498.3535.4
IOI 2026 점수 비교 (600점 만점)
항목점수
금메달 기준361.1
최고 인간 점수498.3
Nemotron-3-Ultra-CC535.4

출처: arXiv 2609.02849, stats.ioinformatics.org

어떻게 만들었나요

훈련 데이터는 최근 20년간 16개 지역·국제 대회 계열에서 모은 문제 22,000개입니다. 논문 이 문제로 합성 추론 흔적을 만들어 Nano-CC에는 SFT와 RL(GRPO)을, Ultra-CC에는 계산 자원 제약 때문에 SFT만 적용했습니다. 논문 교사 모델은 DeepSeek-V4-Flash였고, IOI 2026용 시스템에는 더 짧은 출력으로 더 높은 점수를 내는 GLM-5.2 데이터를 썼습니다. 논문 IOI 2025, ICPC 2025, LiveCodeBench Pro 문제는 훈련에서 명시적으로 제외했습니다. 논문

점수를 끌어올린 다른 축은 GenCorrect라는 테스트 시점 전략입니다. IOI 2025 기준으로 Nano-CC는 후처리 전 130점에서 후처리 후 291점, GenCorrect 적용 후 468점으로 올라 금메달 기준 438.3점을 넘겼고, Ultra-CC는 502점에 이르렀습니다. 논문

GenCorrect 한 라운드 (총 5라운드 반복)
  1. 생성

    후보 풀이 최대 200개 병렬 생성

  2. 다양성 선별

    토큰 유사도로 묶어 서로 다른 10개 선택

  3. 실행·채점

    10개를 채점기에 제출

  4. 피드백 반영

    부분 문제별 최고 점수를 다음 프롬프트에

IOI 2026 실전에서는 마지막 라운드 후보를 200개에서 1,000개로 늘리고, 모델이 만든 테스트 입력 생성기와 검증기로 제출안을 골랐습니다. 논문 NVFP4 양자화로 처리량을 3.7배 높이는 대신 Score@1이 59.4%에서 52.8%로 6.6%p 낮아지는 절충도 있었습니다. 논문

다른 벤치마크에서는

벤치마크Nano-CCUltra-CC
IOI 2025 Score@148.5% (291/600)50.7% (304/600)
ICPC 2025 Pass@151.0%57.4%
LiveCodeBench Pro Pass@171.6%74.5%

위 수치는 모두 논문 기재값입니다. 논문 ICPC 2025에서 Ultra-CC는 평균 약 6.9문제를 풀어 금메달 기준(약 9문제)에는 미치지 못했습니다. 논문 IOI 실전 결과와 달리 정적 벤치마크에서는 아직 절대 우위라고 보기 어렵다는 뜻입니다. 추정

무엇을 보면 되나요

AI Weekly는 이 결과가 독립 검증이 아닌 저자 보고이며, 문제별 점수와 계산 예산이 공개되지 않았고 IOI 주최 측의 확인도 아직 없다고 짚었습니다. 보도 arXiv 페이지에도 코드나 가중치 링크는 없습니다. 데이터 따라서 지금 확인할 수 있는 것은 논문의 방법론과 저자가 제시한 수치까지입니다.

자주 묻는 질문

정말 인간 참가자와 같은 조건이었나요?
논문은 5시간짜리 세션 2회, 세션당 문제 3개, 문제당 최대 50회 제출, 분당 1회 제출, 인터넷 차단이라는 IOI 2026의 시간·제출·접속 제한을 그대로 적용했다고 밝혔습니다. 다만 최대 760장의 GB300 GPU를 쓴 시스템이므로 계산 자원까지 같은 조건은 아니었다고 저자들이 한계 절에 적었습니다.
GenCorrect는 무엇인가요?
생성·평가·수정을 반복하는 테스트 시점 전략입니다. 한 라운드에 후보 풀이를 최대 200개 만들고, 토큰 유사도로 묶어 서로 다른 대표 10개를 고른 뒤 채점기에 제출하고, 부분 문제별 최고 점수를 누적해 다음 라운드 프롬프트에 반영합니다. IOI 2026 실전에서는 마지막 라운드 후보를 1,000개로 늘렸습니다.
모델을 내려받을 수 있나요?
arXiv 페이지에는 코드나 모델 가중치 링크가 없고, 저자들은 제3자 재배포 제한 때문에 훈련 데이터 전체는 공개할 수 없다고 밝혔습니다. 공개 여부는 이 글 작성 시점에 확인되지 않았습니다.

출처 · 4

  1. 1Post-Training Language Models for Gold-Medal Performance in Coding Competitions (arXiv 2609.02849)논문arxiv.org/abs/2609.02849
  2. 2같은 논문 HTML 전문 (arXiv)논문arxiv.org/html/2609.02849
  3. 3IOI 2026 대회 통계 (IOI 공식 통계 사이트)데이터stats.ioinformatics.org/olympiads/2026
  4. 4Nvidia's 550B Nemotron beats top human coder at IOI 2026 (AI Weekly)보도aiweekly.co/alerts/nvidias-550b-nemotron-beats-top-human-coder-at-ioi-2026

이 글의 마크다운 원문: /posts/nemotron-ultra-cc-ioi-2026/md/ · 인용 시 출처를 “AI피셜”으로 표기해 주세요.

이 글이 도움이 됐다면 동료에게 보내 주세요.

AI피셜 새 글 알림

새 글이 올라오면 메일로 알려드려요

매일 5편, 5분 브리프. 스팸 없이 새 글 소식만. 언제든 한 번에 해지.

같은 태그·카테고리의 글을 골랐습니다.

논문 한입· 2

τ^τ-Bench — 에이전트가 만든 상담봇, 합격률 23.9%

Sierra·Princeton 연구진이 코딩 에이전트에게 실제 업무 기록·API·예산을 주고 고객 상담 에이전트를 처음부터 만들게 한 벤치마크입니다. 최고 조합도 23.9%에 그친 이유를 정리했습니다.

  • #논문
  • #코딩 에이전트
  • #벤치마크
논문 한입· 2

프런티어 모델 22종, 화학 벤치마크 답을 '외워서' 냈다

독일 연구진이 LLM 22종을 분자 물성 회귀 벤치마크 12개에서 자릿수 단위로 검사해, 5개 데이터셋에서 모델 절반 이상이 공개된 값을 그대로 꺼내 쓴다는 것을 보였습니다. 방법과 한계를 정리했습니다.

  • #논문
  • #벤치마크
  • #평가
논문 한입· 2

CUA-Universe — CLI 섞은 9B, OSWorld 40.2%

상하이교통대·저장대 연구진이 데스크톱 앱 16종을 GUI+명령줄 혼합 환경으로 만들고 9B 모델을 학습해 OSWorld 성공률을 23.4%에서 40.2%로 올렸습니다. 방법과 수치를 정리했습니다.

  • #논문
  • #에이전트
  • #컴퓨터 사용