본문으로 건너뛰기

레이어 드롭아웃 재조명 — 훈련 FLOPs 25% 절감, 추론 1.5배

Cerebras 연구진이 ICML 2026 논문 확장판에서 2,400회 넘는 훈련 실험으로 레이어 드롭아웃의 최적 배치·스케줄을 정리했습니다. 같은 손실에 FLOPs 25% 절감, 추론 최대 1.5배의 조건을 봅니다.

AI피셜 편집부· 2분 읽기원문 보기 ↗
네덜란드 국립 슈퍼컴퓨터 하위헌스(IBM pSeries 575)의 서버 랙이 줄지어 선 전산실
사진: Dennis van Zuijlekom · CC BY-SA 2.0

핵심 답변

Cerebras Systems 연구진은 2026년 9월 4일 arXiv에 올린 ICML 2026 논문 확장판에서 최근 LLM 훈련 레시피에서 사라진 레이어 드롭아웃(확률적 깊이)이 여전히 유효하다고 주장했습니다. 271M~8.2B 파라미터, 최대 160B 토큰 규모의 훈련 실행 2,400회 이상에서 뒤쪽 레이어일수록 높게, 훈련이 진행될수록 낮게 드롭아웃을 주면 같은 계산량에서 더 낮은 손실을 얻고, 같은 손실 기준으로 훈련 FLOPs를 최대 25% 아끼며, 조기 종료·레이어 건너뛰기·자기 추측 디코딩으로 추론을 최대 1.5배 빠르게 할 수 있었습니다.

TL;DR세 줄 요약

  • 실험 규모는 훈련 실행 2,400회 이상, 모델 271M~8.2B, 최대 160B 토큰이며 모두 Cerebras CS-3 시스템에서 돌렸습니다.
  • 핵심 처방은 레이어가 깊어질수록 드롭아웃을 높이고(ILD) 훈련이 진행될수록 낮추는(DTS) 것, 그리고 배치가 아니라 시퀀스 단위로 트랜스포머 레이어 전체를 끄는 것입니다.
  • 같은 훈련 FLOPs에서 기준선보다 낮은 손실을 냈고, FLOPs를 5% 아낀 설정에서도 밀집 기준선보다 낮은 검증 손실을 기록했습니다.
  • 훈련 때 레이어가 빠지는 데 익숙해진 모델은 조기 종료·중간 레이어 건너뛰기·자기 추측 디코딩이 잘 먹혀, 3.9B 모델에서 자기 추측 디코딩 1.54배 속도 향상을 냈습니다.

핵심 사실

논문
arXiv 2609.052752026-09-04, ICML 2026 확장판
소속
Cerebras SystemsMBZUAI 소속 공저자 포함
실험 규모
훈련 실행 2,400회 이상271M~8.2B, 최대 160B 토큰, CS-3
훈련 FLOPs 절감
최대 25%동등한 검증 손실 기준
추론 속도
최대 1.5배3.9B 자기 추측 디코딩 1.54배
최대 드롭아웃 비율
0.1~0.99큰 모델일수록 0.8~0.99의 공격적 설정

무슨 일인가요

Cerebras Systems 연구진(Mostafa Elhoushi, Alex Pretko, Nolan Dey 등 9명)이 9월 4일 arXiv에 올린 "Don't Drop Dropout"은 ICML 2026에 실린 논문의 확장판입니다. 논문 주장은 제목 그대로입니다. 훈련 중 트랜스포머 레이어를 통째로 건너뛰는 레이어 드롭아웃(확률적 깊이)이 최근 LLM 훈련 레시피에서 사라졌지만, 제대로 쓰면 현대 LLM 훈련에도 상당한 이득을 준다는 것입니다. 논문

근거는 실험 규모에서 나옵니다. 주 실험은 271M~3.9B 파라미터에 최대 116B 토큰, 여기에 8.2B까지 키운 대형 실행을 더해 훈련 실행 2,400회 이상을 돌렸고 초록 기준 데이터는 최대 160B 토큰이며, 모든 사전 훈련은 Cerebras CS-3 시스템에서 진행됐습니다. 논문

금선으로 배선된 프로세서 다이를 확대해 찍은 사진
레이어 드롭아웃의 이득은 결국 훈련 FLOPs와 추론 지연으로 환산됩니다. 사진은 Amdahl 5860 메인프레임의 공랭 로직 프로세서 다이입니다.· 사진: Mister rf · CC BY-SA 4.0

핵심 처방

어디를, 언제, 어떤 단위로 끌 것인가

  1. 레이어가 깊어질수록 드롭아웃 비율을 높인다 (증가형 레이어 분포, ILD)

  2. 훈련이 진행될수록 비율을 낮춘다 (감소형 시간 스케줄, DTS)

  3. 배치가 아니라 시퀀스 단위로, 서브 레이어가 아니라 트랜스포머 레이어 전체를 끈다

훈련 시 남는 레이어 출력은 레이어 밀도의 역수로 키우고, 평가 시에는 1로 둡니다.

무엇을 찾았나요

같은 훈련 계산량에서 레이어 드롭아웃을 쓴 모델이 기준선보다 낮은 손실에 도달했고, 비슷한 검증 손실을 목표로 하면 훈련 FLOPs를 최대 25% 아낄 수 있었습니다. 논문 FLOPs를 5%만 아낀 최적 설정에서는 밀집 기준선보다 오히려 낮은 검증 손실을 기록했습니다. 논문 시험한 최대 드롭아웃 비율은 모델 크기에 따라 0.10.99였고, 큰 모델에는 0.80.99의 공격적인 비율이 적용됐습니다. 논문

항목논문 기재값
훈련 실행 수2,400회 이상
모델 크기271M ~ 8.2B
훈련 FLOPs 절감최대 25% (동등 손실 기준)
추론 속도 향상최대 1.5배
3.9B 자기 추측 디코딩1.54배 (Table 5)

추론 쪽 이득은 훈련 방식의 부산물입니다. 레이어가 빠지는 상황에 익숙해진 모델은 조기 종료, 중간 레이어 건너뛰기, 자기 추측 디코딩 같은 사후 최적화를 정확도 손실 거의 없이 받아들여 최대 1.5배 속도 향상을 냈고, 3.9B 모델의 자기 추측 디코딩은 1.54배였습니다. 논문 하이퍼파라미터는 작거나 중간 수준의 드롭아웃에서는 최적 학습률과 가중치 감쇠가 거의 그대로였지만, 공격적으로 높은 드롭아웃에서는 둘 다 낮아졌습니다. 논문

무엇을 보면 되나요

이 논문은 새 아키텍처가 아니라 "버려진 정규화 기법을 어떻게 다시 쓸 것인가"에 대한 실험 보고서입니다. 하드웨어가 Cerebras CS-3 하나라는 점, 그리고 8.2B 이하 밀집 트랜스포머에서만 확인됐다는 점을 감안하고 읽으셔야 합니다. 논문

자주 묻는 질문

레이어 드롭아웃이 무엇인가요?
훈련 중 트랜스포머 레이어 전체를 확률적으로 건너뛰는 정규화 기법으로 '확률적 깊이'라고도 부릅니다. 논문은 이 기법이 최근 LLM 훈련 레시피에서 사라졌지만, 배치가 아니라 시퀀스 단위로 레이어 수준에서 적용하고 분포와 스케줄을 잘 잡으면 현대 LLM에도 이득이 크다고 주장합니다.
어떤 설정이 가장 좋았나요?
뒤쪽 레이어일수록 드롭아웃 비율을 높이는 증가형 레이어 분포(ILD)와 훈련이 진행될수록 비율을 낮추는 감소형 시간 스케줄(DTS)의 조합입니다. 훈련 시에는 남는 레이어 출력을 레이어 밀도의 역수로 키우고 평가 시에는 1로 두는 스케일링을 씁니다.
추론이 빨라지는 이유는 무엇인가요?
훈련 중 레이어가 빠지는 상황을 겪은 모델은 추론 때 일부 레이어를 건너뛰어도 정확도 손실이 작습니다. 논문은 조기 종료, 중간 레이어 건너뛰기, 자기 추측 디코딩 세 방법으로 정확도 손실을 거의 없이 최대 1.5배 속도 향상을 보고했습니다.

출처 · 2

  1. 1Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference (arXiv 2609.05275)논문arxiv.org/abs/2609.05275
  2. 2같은 논문 HTML 전문 (arXiv)논문arxiv.org/html/2609.05275

이 글의 마크다운 원문: /posts/dont-drop-dropout-layer-sparsity/md/ · 인용 시 출처를 “AI피셜”으로 표기해 주세요.

이 글이 도움이 됐다면 동료에게 보내 주세요.

AI피셜 새 글 알림

새 글이 올라오면 메일로 알려드려요

매일 5편, 5분 브리프. 스팸 없이 새 글 소식만. 언제든 한 번에 해지.

같은 태그·카테고리의 글을 골랐습니다.

논문 한입· 2

프런티어 모델 22종, 화학 벤치마크 답을 '외워서' 냈다

독일 연구진이 LLM 22종을 분자 물성 회귀 벤치마크 12개에서 자릿수 단위로 검사해, 5개 데이터셋에서 모델 절반 이상이 공개된 값을 그대로 꺼내 쓴다는 것을 보였습니다. 방법과 한계를 정리했습니다.

  • #논문
  • #벤치마크
  • #평가
논문 한입· 2

모델을 바꾸면 에이전트 메모리가 깨진다 — 최대 13%p

LinkedIn 연구진이 에이전트 메모리 4가지 구조가 모델 교체를 얼마나 견디는지 통제 실험했습니다. 요약 노트는 최대 13.28%p 흔들렸고 고정 스키마 그래프는 거의 변하지 않았습니다.

  • #논문
  • #에이전트
  • #메모리
논문 한입· 2

CUA-Universe — CLI 섞은 9B, OSWorld 40.2%

상하이교통대·저장대 연구진이 데스크톱 앱 16종을 GUI+명령줄 혼합 환경으로 만들고 9B 모델을 학습해 OSWorld 성공률을 23.4%에서 40.2%로 올렸습니다. 방법과 수치를 정리했습니다.

  • #논문
  • #에이전트
  • #컴퓨터 사용