본문으로 건너뛰기

온폴리시 증류는 정말 '증류'일까 — 교사 없이 오른 점수

Purdue 연구진이 온폴리시 증류(OPD)의 교사 신호에 큰 노이즈가 섞여 있고, 교사 없이 낮은 확률 토큰만 눌러도 비슷하게 오른다는 것을 보였습니다. Qwen3-1.7B의 AIME24가 13.4점에서 48.9점이 됐습니다.

AI피셜 편집부· 2분 읽기원문 보기 ↗
논문 저자들이 속한 퍼듀 대학교의 호브디 홀 건물 정면
사진: Julian Herzog (Website) · CC BY 4.0

핵심 답변

8월 31일 arXiv에 올라온 Purdue 대학 논문은 온폴리시 증류(OPD)에서 교사가 주는 토큰별 신호의 상당 부분이 노이즈이며, 그럼에도 학생 성능이 안정적으로 오르는 이유는 지식 전달이 아니라 낮은 확률 토큰의 억제 때문이라고 주장합니다. 교사 없이 엔트로피에 따라 음수 어드밴티지를 주는 OPSA는 Qwen3-1.7B의 AIME24 Avg@32를 13.44에서 48.85로 올려 OPD를 16.77점 앞섰습니다.

TL;DR세 줄 요약

  • 교사 신호 분석: 정답 궤적의 20.4%가 답 토큰에 음수 어드밴티지를, 오답 궤적의 40.8%가 양수 어드밴티지를 받았고, 235B 교사에서는 노이즈가 50.6%까지 올라갔습니다.
  • 노이즈 궤적만으로 학습해도 표준 OPD와 비슷한 성능이 나왔고, 교사 없이 확률 하위 20% 토큰에 -0.5를 주는 것만으로도 꾸준히 올랐습니다.
  • 제안한 OPSA는 엔트로피가 높은 위치에 더 강한 음수 신호를 주어 꼬리 토큰을 누르고 확률 질량을 자주 나오는 토큰으로 옮깁니다.
  • 저자가 밝힌 한계: 큰 모델로의 확장 검증 부족, 이미 분포가 뾰족한 후훈련 모델에는 이득이 줄 수 있음, 사고 모드 Pass@k 개선은 완만함.

핵심 사실

arXiv
2608.310462026-08-31 제출
저자
Yi Ding, Ruqi ZhangPurdue University 컴퓨터과학과
학생 모델
Qwen3-1.7B · Qwen3-4B · Qwen3.5-9B
교사 모델
Qwen3-4B / 30B-A3B / 235B-A22B Instruct
AIME24 Avg@32
13.44 → 48.85Qwen3-1.7B, OPSA 적용
교사 노이즈
최대 50.6%235B 교사 기준

무슨 일인가요

Purdue 대학의 Yi Ding과 Ruqi Zhang은 8월 31일 arXiv에 "온폴리시 증류는 정말 증류하는가"라는 제목의 논문을 올렸습니다. 공식 Hugging Face Daily Papers에서는 9월 1일자 1위(추천 143)에 올랐습니다. 보도 온폴리시 증류(OPD)는 학생 모델이 만든 답을 교사 모델이 토큰 단위로 채점해 학생을 갱신하는 방법으로, 최근 소형 추론 모델을 만들 때 널리 쓰입니다. 추정

논문은 교사 신호를 뜯어봤습니다. 정답 궤적의 20.4%는 답 토큰에 음수 어드밴티지를 받았고, 오답 궤적의 40.8%는 양수 어드밴티지를 받았습니다. 공식 이 노이즈는 교사가 클수록 늘어, 235B 교사에서는 50.6%에 이르렀습니다. 공식 그런데도 학생 성능은 안정적으로 올랐고, 노이즈가 섞인 궤적만으로 학습해도 표준 OPD와 비슷한 결과가 나왔습니다. 공식

논문의 논증 순서
  1. OPD 교사 신호 측정

    정답에 음수, 오답에 양수가 섞임

  2. 노이즈 궤적만 학습

    표준 OPD와 비슷한 성능

  3. 교사 없이 고정 음수 신호

    하위 20% 토큰에 -0.5

  4. OPSA 제안

    엔트로피 적응형 음수 어드밴티지

오르는 이유는 '억제'였습니다

저자들은 개선이 지식 전달이 아니라 로그 확률이 낮은 토큰을 누르는 데 집중돼 있다고 분석합니다. 공식 실제로 교사 없이 확률 하위 20% 토큰에 고정 음수 어드밴티지 -0.5만 주어도 학생의 avg@4 성능이 꾸준히 올라 OPD 이득의 대부분을 재현했습니다. 공식

이를 바탕으로 제안한 것이 온폴리시 자기 적응(OPSA)입니다. 엔트로피가 높은 위치에 더 강한 음수 신호를 주어 꼬리 토큰을 억제하고, 확률 질량을 자주 나오는 토큰으로 재분배합니다. 공식 실험은 학생 Qwen3-1.7B·4B·Qwen3.5-9B, 교사 Qwen3-4B·30B-A3B·235B-A22B Instruct, 학습 데이터 DAPO-17k로 진행했고, AIME24·AIME25·HMMT25(수학), MBPP+(코드), GPQA-Diamond(일반 지식)로 평가했습니다. 공식

연구용 슈퍼컴퓨터 'Kraken'의 랙이 줄지어 선 전산실
교사 모델을 돌리는 비용은 학습 예산의 큰 몫입니다. 사진은 오크리지 국립연구소의 크레이 XT5 슈퍼컴퓨터입니다.· 사진: Daderot · Public domain
Qwen3-1.7B Avg@32 (Base vs OPSA)
0.0012.5025.0037.5050.00AIME24AIME25HMMT2513.449.695.7348.8535.3123.33
  • Base
  • OPSA
Qwen3-1.7B Avg@32 (Base vs OPSA)
항목BaseOPSA
AIME2413.4448.85
AIME259.6935.31
HMMT255.7323.33

출처: 논문 Table 2 (arXiv 2608.31046)

Qwen3-1.7B에서 OPSA는 AIME24 Avg@32를 13.44에서 48.85로 35.41점 올렸고 Pass@32는 40.00에서 80.00으로 두 배가 됐습니다. 공식 초록은 AIME24 Avg@32에서 OPD를 16.77점 앞섰다고 밝힙니다. 공식

무엇을 보면 되나요

  • 소형 추론 모델을 만드는 팀: 교사 추론 비용이 학습 비용의 큰 몫이라면, OPSA나 고정 음수 어드밴티지를 베이스라인으로 돌려 교사가 실제로 무엇을 더해 주는지 측정해 볼 만합니다.
  • OPD를 쓰는 팀: 교사 채점의 노이즈율(정답에 음수, 오답에 양수)을 로그로 남겨 두면, 교사 크기를 키우는 결정이 정말 도움이 되는지 판단할 수 있습니다. 추정
  • 지켜볼 것: 더 큰 학생 모델과 다른 모델 계열에서의 재현, 이미 강하게 후훈련된 모델에서의 효과.

자주 묻는 질문

온폴리시 증류(OPD)가 무엇인가요?
학생 모델이 스스로 생성한 답을 교사 모델이 토큰 단위로 평가해, 교사가 보기에 좋은 토큰은 올리고 나쁜 토큰은 내리는 방식의 학습입니다. 교사의 지식이 학생에게 옮겨진다고 여겨져 왔는데, 이 논문은 그 전제를 실험으로 검증했습니다.
OPSA는 교사가 전혀 필요 없나요?
그렇습니다. 학생 자신의 토큰 확률과 엔트로피만으로 음수 어드밴티지를 만들어 낮은 확률의 꼬리 토큰을 억제합니다. 다만 저자들은 이 방식이 기존 확률 질량을 재분배하는 것이라 이미 분포가 뾰족한 모델에는 효과가 줄 수 있다고 밝혔습니다.
실무에서 무엇을 바꿔야 하나요?
OPD로 작은 모델을 학습하고 있다면 교사 신호의 노이즈율을 먼저 재 보고, 교사 없는 OPSA나 고정 음수 어드밴티지를 베이스라인으로 비교해 볼 만합니다. 교사 추론 비용을 아낄 수 있는지 판단하는 근거가 됩니다.

출처 · 3

  1. 1Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement (arXiv 초록)논문arxiv.org/abs/2608.31046
  2. 2논문 전문 HTML (arXiv)논문arxiv.org/html/2608.31046v1
  3. 3Daily Papers 2026-09-01 (Hugging Face)참고huggingface.co/papers/date/2026-09-01

이 글의 마크다운 원문: /posts/on-policy-distillation-noisy-teacher/md/ · 인용 시 출처를 “AI피셜”으로 표기해 주세요.

이 글이 도움이 됐다면 동료에게 보내 주세요.

AI피셜 새 글 알림

새 글이 올라오면 메일로 알려드려요

매일 5편, 5분 브리프. 스팸 없이 새 글 소식만. 언제든 한 번에 해지.

같은 태그·카테고리의 글을 골랐습니다.

논문 한입· 4

암호화된 '생각'이 새어 나왔다 — 추론 흔적 탈취 논문

Anthropic·OpenAI·Google이 API로 돌려주는 암호화 추론 블록이 세션·사용자·모델을 가리지 않고 재생됐습니다. 약한 모델에 넣어 평문으로 받아 적게 한 논문의 주장·방법·한계를 정리합니다.

  • #AI 보안
  • #추론 모델
  • #프라이버시
논문 한입· 2

프런티어 모델 22종, 화학 벤치마크 답을 '외워서' 냈다

독일 연구진이 LLM 22종을 분자 물성 회귀 벤치마크 12개에서 자릿수 단위로 검사해, 5개 데이터셋에서 모델 절반 이상이 공개된 값을 그대로 꺼내 쓴다는 것을 보였습니다. 방법과 한계를 정리했습니다.

  • #논문
  • #벤치마크
  • #평가