무슨 일인가요
Purdue 대학의 Yi Ding과 Ruqi Zhang은 8월 31일 arXiv에 "온폴리시 증류는 정말 증류하는가"라는 제목의 논문을 올렸습니다. 공식 Hugging Face Daily Papers에서는 9월 1일자 1위(추천 143)에 올랐습니다. 보도 온폴리시 증류(OPD)는 학생 모델이 만든 답을 교사 모델이 토큰 단위로 채점해 학생을 갱신하는 방법으로, 최근 소형 추론 모델을 만들 때 널리 쓰입니다. 추정
논문은 교사 신호를 뜯어봤습니다. 정답 궤적의 20.4%는 답 토큰에 음수 어드밴티지를 받았고, 오답 궤적의 40.8%는 양수 어드밴티지를 받았습니다. 공식 이 노이즈는 교사가 클수록 늘어, 235B 교사에서는 50.6%에 이르렀습니다. 공식 그런데도 학생 성능은 안정적으로 올랐고, 노이즈가 섞인 궤적만으로 학습해도 표준 OPD와 비슷한 결과가 나왔습니다. 공식
OPD 교사 신호 측정
정답에 음수, 오답에 양수가 섞임
노이즈 궤적만 학습
표준 OPD와 비슷한 성능
교사 없이 고정 음수 신호
하위 20% 토큰에 -0.5
OPSA 제안
엔트로피 적응형 음수 어드밴티지
오르는 이유는 '억제'였습니다
저자들은 개선이 지식 전달이 아니라 로그 확률이 낮은 토큰을 누르는 데 집중돼 있다고 분석합니다. 공식 실제로 교사 없이 확률 하위 20% 토큰에 고정 음수 어드밴티지 -0.5만 주어도 학생의 avg@4 성능이 꾸준히 올라 OPD 이득의 대부분을 재현했습니다. 공식
이를 바탕으로 제안한 것이 온폴리시 자기 적응(OPSA)입니다. 엔트로피가 높은 위치에 더 강한 음수 신호를 주어 꼬리 토큰을 억제하고, 확률 질량을 자주 나오는 토큰으로 재분배합니다. 공식 실험은 학생 Qwen3-1.7B·4B·Qwen3.5-9B, 교사 Qwen3-4B·30B-A3B·235B-A22B Instruct, 학습 데이터 DAPO-17k로 진행했고, AIME24·AIME25·HMMT25(수학), MBPP+(코드), GPQA-Diamond(일반 지식)로 평가했습니다. 공식

- Base
- OPSA
| 항목 | Base | OPSA |
|---|---|---|
| AIME24 | 13.44 | 48.85 |
| AIME25 | 9.69 | 35.31 |
| HMMT25 | 5.73 | 23.33 |
출처: 논문 Table 2 (arXiv 2608.31046)
Qwen3-1.7B에서 OPSA는 AIME24 Avg@32를 13.44에서 48.85로 35.41점 올렸고 Pass@32는 40.00에서 80.00으로 두 배가 됐습니다. 공식 초록은 AIME24 Avg@32에서 OPD를 16.77점 앞섰다고 밝힙니다. 공식
무엇을 보면 되나요
- 소형 추론 모델을 만드는 팀: 교사 추론 비용이 학습 비용의 큰 몫이라면, OPSA나 고정 음수 어드밴티지를 베이스라인으로 돌려 교사가 실제로 무엇을 더해 주는지 측정해 볼 만합니다.
- OPD를 쓰는 팀: 교사 채점의 노이즈율(정답에 음수, 오답에 양수)을 로그로 남겨 두면, 교사 크기를 키우는 결정이 정말 도움이 되는지 판단할 수 있습니다. 추정
- 지켜볼 것: 더 큰 학생 모델과 다른 모델 계열에서의 재현, 이미 강하게 후훈련된 모델에서의 효과.



