에이전트 일을 겨냥한 600B 희소 모델
StepFun(阶跃星辰)이 2026년 9월 20일 Step 5 Preview를 공개했습니다. 회사는 이 모델을 실제 에이전트 작업을 위한 기반 모델이라고 소개했고, AI 코딩, 소프트웨어 엔지니어링, 전문 지식 노동에서 최고 수준(frontier)의 성능을 겨냥한다고 밝혔습니다. 공식
구조가 먼저 눈에 띕니다. 희소 전문가 혼합(mixture of experts, MoE)은 여러 전문가 네트워크 중 입력마다 일부만 골라 쓰는 기법으로, Step 5 Preview는 총 6,000억 매개변수 가운데 토큰마다 270억 매개변수만 활성화합니다. 문맥 창은 100만 토큰이고 시각 입력도 받습니다. 큰 모델의 지능과 작은 모델의 연산 비용을 함께 노리는 설계입니다. 공식
소프트웨어 벤치마크에서 최상위와 격차를 좁히다
소프트웨어 엔지니어링 벤치마크 DeepSWE v1.1에서 Step 5 Preview는 67.7점을 기록했습니다. Kimi K3(67.5점), GLM-5.3(66.9점)과 사실상 나란히 갔고, GPT-6 Astra(74.1점), Claude Opus 5(74.0점)와의 격차는 과거 세대보다 좁혀졌습니다. 공식
| 벤치마크 | Step 5 Preview | Kimi K3 | GLM-5.3 | GPT-6 Astra | Claude Opus 5 |
|---|---|---|---|---|---|
| DeepSWE v1.1 | 67.7 | 67.5 | 66.9 | 74.1 | 74.0 |
| StepCodeBench | 49.0 | 43.9 | 40.2 | 61.0 | 63.9 |
| Terminal-Bench v4 | 33.3 | 12.6 | 41.9 | 57.9 | 52.3 |
약점도 분명합니다. 터미널 작업을 평가하는 Terminal-Bench v4에서는 33.3점에 그쳐 GLM-5.3(41.9점), GPT-6 Astra(57.9점)보다 낮았습니다. 긴 명령줄 세션을 다루는 능력은 아직 최상위권에 못 미칩니다. 공식

회사는 실무형 코딩 평가를 위해 StepCodeBench를 새로 만들었다고 밝혔습니다. 독립 코드 저장소 553곳, 과제 유형 9종, 응용 분야 20개, 프로그래밍 언어 33개를 다루며 산업 수요와 실제 사용자 요청, 전문가 작업 기록을 반영했다는 설명입니다. 이 벤치마크에서 Step 5 Preview는 49.0점으로 Kimi K3(43.9점)와 GLM-5.3(40.2점)을 앞섰지만 Claude Opus 5(63.9점)와는 거리가 있습니다. 공식
금융에서 두드러진 점수
Step 5 Preview의 가장 뚜렷한 우위는 금융입니다. 금융 전문 과제를 다루는 FrontierFinance에서 66.4점을 기록해 GPT-6 Astra(55.0점), Kimi K3(62.6점), GLM-5.3(64.1점)을 앞섰습니다. Claude Opus 5(69.7점)에는 못 미칩니다. 규제 문서 판독 평가 DRACO에서도 83.3점으로 GLM-5.3(82.3점), GPT-6 Astra(76.8점)보다 높았습니다. 공식
발표문은 인공지능 분석 업체 Artificial Analysis의 지수에서 Step 5 Preview가 44점을 받았고, 비슷한 지능 수준의 경쟁 모델보다 과제당 비용이 낮다고 강조합니다. GDPval-AA v2 점수는 같은 날짜 기준 GLM-5.3(1634점), Claude Opus 5(1735점)에 이은 1571점입니다. 공식
평가자 70%가 본 자율 코딩과 남은 과제
사내외 전문가 평가에서 응답자의 약 70%가 Step 5 Preview가 중간 난도 이상의 코딩 과제를 자율적으로 끝낼 수 있다고 답했다고 합니다. 발표문에는 사진 한 장에서 출발해 가구를 옮겨 볼 수 있는 3D 방 배치 도구, 3D로 다시 만든 Flappy Bird 게임 같은 사례가 예시로 실렸습니다. 공식
벤치마크 수치를 읽을 때 조건도 함께 봐야 합니다. DeepSWE v1.1 평가는 SWE-agent 하네스에서 온도 1.0, top_p 0.95 설정으로 이뤄졌고, StepCodeBench는 회사가 직접 설계한 평가입니다. GDPval-AA 점수는 Artificial Analysis가 2026년 9월 19일까지 공개한 결과를 인용했습니다. 독립적인 검증이 쌓이기 전까지는 회사 발표 수치로 읽는 것이 정확합니다. 공식





