# StepFun Step 5, 600B 희소 MoE로 비용 경계 밀기

> StepFun이 에이전트 작업용 Step 5 Preview를 공개했습니다. 600B 희소 MoE 구조와 벤치마크 점수, 금융 영역 우위를 정리합니다.

- 출처 사이트: AI피셜 (https://aifficial.net/posts/stepfun-step-5-preview/)
- 발행: 2026-09-20
- 카테고리: 모델 · 태그: StepFun, MoE, 에이전트, 벤치마크, 중국 AI

## 핵심 답변

중국의 StepFun(阶跃星辰)이 2026년 9월 20일 실제 에이전트 작업을 겨냥한 기반 모델 Step 5 Preview를 공개했습니다. 총 6,000억 매개변수의 희소 전문가 혼합(mixture of experts, MoE) 구조로 토큰마다 270억 매개변수를 활성화하고 100만 토큰 문맥과 시각 입력을 지원합니다. 소프트웨어 엔지니어링 벤치마크에서 중국 경쟁 모델과 나란히 갔고, 금융 벤치마크 FrontierFinance에서는 66.4점으로 GPT-6 Astra의 55.0점을 앞섰습니다.

## 한 장 요약(만화)

![AI피셜 마스코트가 Step 5 Preview의 600B 구조, 소프트웨어 벤치마크 순위, 금융 점수 우위, 낮은 과제 비용을 네 컷으로 설명합니다.](https://aifficial.net/images/posts/stepfun-step-5-preview/comic-v1.0.0.webp)

## 요약

- Step 5 Preview는 총 600B·활성 27B 매개변수의 희소 MoE 모델로 100만 토큰 문맥과 시각 입력을 지원합니다.
- DeepSWE v1.1에서 67.7점으로 Kimi K3(67.5), GLM-5.3(66.9)과 나란히 갔고 GPT-6 Astra(74.1)와의 격차를 좁혔습니다.
- 금융 벤치마크 FrontierFinance에서 66.4점으로 GPT-6 Astra 55.0점을 앞세웠고 인공지능 지수 44점 수준에서 과제당 비용은 더 낮다고 밝혔습니다.
- 터미널 작업 Terminal-Bench v4에서는 33.3점에 그쳐 GPT-6 Astra(57.9), GLM-5.3(41.9)보다 낮았습니다.

## 핵심 사실

| 항목 | 값 |
|---|---|
| 모델 구조 | 600B 총·27B 활성 (희소 전문가 혼합(MoE) 구조이며 토큰당 활성화되는 매개변수 기준입니다.) |
| 입력 지원 | 100만 토큰·시각 (긴 문맥 창과 이미지 입력을 함께 지원합니다.) |
| FrontierFinance | 66.4점 (GPT-6 Astra 55.0점, Kimi K3 62.6점과의 비교이고 Claude Opus 5는 69.7점입니다.) |
| 코딩 자율 평가 | 약 70% (사내외 전문가 평가에서 중간 난도 이상 코딩 과제를 자율 완수할 수 있다고 응답한 비율입니다.) |


## 에이전트 일을 겨냥한 600B 희소 모델

StepFun(阶跃星辰)이 2026년 9월 20일 Step 5 Preview를 공개했습니다. 회사는 이 모델을 실제 에이전트 작업을 위한 기반 모델이라고 소개했고, AI 코딩, 소프트웨어 엔지니어링, 전문 지식 노동에서 최고 수준(frontier)의 성능을 겨냥한다고 밝혔습니다. 

구조가 먼저 눈에 띕니다. 희소 전문가 혼합(mixture of experts, MoE)은 여러 전문가 네트워크 중 입력마다 일부만 골라 쓰는 기법으로, Step 5 Preview는 총 6,000억 매개변수 가운데 토큰마다 270억 매개변수만 활성화합니다. 문맥 창은 100만 토큰이고 시각 입력도 받습니다. 큰 모델의 지능과 작은 모델의 연산 비용을 함께 노리는 설계입니다. 

## 소프트웨어 벤치마크에서 최상위와 격차를 좁히다

소프트웨어 엔지니어링 벤치마크 DeepSWE v1.1에서 Step 5 Preview는 67.7점을 기록했습니다. Kimi K3(67.5점), GLM-5.3(66.9점)과 사실상 나란히 갔고, GPT-6 Astra(74.1점), Claude Opus 5(74.0점)와의 격차는 과거 세대보다 좁혀졌습니다. 

| 벤치마크 | Step 5 Preview | Kimi K3 | GLM-5.3 | GPT-6 Astra | Claude Opus 5 |
| --- | --- | --- | --- | --- | --- |
| DeepSWE v1.1 | 67.7 | 67.5 | 66.9 | 74.1 | 74.0 |
| StepCodeBench | 49.0 | 43.9 | 40.2 | 61.0 | 63.9 |
| Terminal-Bench v4 | 33.3 | 12.6 | 41.9 | 57.9 | 52.3 |

약점도 분명합니다. 터미널 작업을 평가하는 Terminal-Bench v4에서는 33.3점에 그쳐 GLM-5.3(41.9점), GPT-6 Astra(57.9점)보다 낮았습니다. 긴 명령줄 세션을 다루는 능력은 아직 최상위권에 못 미칩니다. 



회사는 실무형 코딩 평가를 위해 StepCodeBench를 새로 만들었다고 밝혔습니다. 독립 코드 저장소 553곳, 과제 유형 9종, 응용 분야 20개, 프로그래밍 언어 33개를 다루며 산업 수요와 실제 사용자 요청, 전문가 작업 기록을 반영했다는 설명입니다. 이 벤치마크에서 Step 5 Preview는 49.0점으로 Kimi K3(43.9점)와 GLM-5.3(40.2점)을 앞섰지만 Claude Opus 5(63.9점)와는 거리가 있습니다. 

## 금융에서 두드러진 점수

Step 5 Preview의 가장 뚜렷한 우위는 금융입니다. 금융 전문 과제를 다루는 FrontierFinance에서 66.4점을 기록해 GPT-6 Astra(55.0점), Kimi K3(62.6점), GLM-5.3(64.1점)을 앞섰습니다. Claude Opus 5(69.7점)에는 못 미칩니다. 규제 문서 판독 평가 DRACO에서도 83.3점으로 GLM-5.3(82.3점), GPT-6 Astra(76.8점)보다 높았습니다. 

발표문은 인공지능 분석 업체 Artificial Analysis의 지수에서 Step 5 Preview가 44점을 받았고, 비슷한 지능 수준의 경쟁 모델보다 과제당 비용이 낮다고 강조합니다. GDPval-AA v2 점수는 같은 날짜 기준 GLM-5.3(1634점), Claude Opus 5(1735점)에 이은 1571점입니다. 

## 평가자 70%가 본 자율 코딩과 남은 과제

사내외 전문가 평가에서 응답자의 약 70%가 Step 5 Preview가 중간 난도 이상의 코딩 과제를 자율적으로 끝낼 수 있다고 답했다고 합니다. 발표문에는 사진 한 장에서 출발해 가구를 옮겨 볼 수 있는 3D 방 배치 도구, 3D로 다시 만든 Flappy Bird 게임 같은 사례가 예시로 실렸습니다. 

벤치마크 수치를 읽을 때 조건도 함께 봐야 합니다. DeepSWE v1.1 평가는 SWE-agent 하네스에서 온도 1.0, top_p 0.95 설정으로 이뤄졌고, StepCodeBench는 회사가 직접 설계한 평가입니다. GDPval-AA 점수는 Artificial Analysis가 2026년 9월 19일까지 공개한 결과를 인용했습니다. 독립적인 검증이 쌓이기 전까지는 회사 발표 수치로 읽는 것이 정확합니다. 


저는 이번 발표에서 총 매개변수보다 활성 매개변수 이야기가 더 중요하다고 봅니다. 600B짜리 모델이라는 표지 아래 토큰마다 27B만 움직인다는 것은, 같은 답을 내는 데 드는 전기와 시간이 모델 크기만큼 늘지 않는다는 뜻이니까요. 벤치마크 순위는 몇 주 안에 또 바뀌겠지만, 비슷한 지능을 더 싸게 내는 방향의 경쟁은 이미 시작된 것 같습니다. 금융 점수가 유독 높다는 점도 눈여겨볼 만합니다. 도메인 특화 성능을 앞세운 모델이 늘어나면, 독자님은 다음 모델을 고를 때 총점이 아니라 내 일에 맞는 항목을 먼저 보시게 될 것 같습니다. 



## 자주 묻는 질문

**Q. Step 5 Preview는 공개 가중치 모델입니까?**

발표문에 가중치 공개 여부와 가격이 적혀 있지 않습니다. 이름에 Preview가 붙은 만큼 사전 공개 성격으로 읽는 편이 맞습니다.

**Q. 최상위 모델보다 성능이 높습니까?**

모든 영역에서 앞서지는 않습니다. 소프트웨어와 금융의 일부 지표에서 경쟁력을 보였지만 터미널 작업 Terminal-Bench v4에서는 33.3점으로 GPT-6 Astra(57.9)보다 낮습니다.

**Q. 파레토 경계라는 표현은 무슨 뜻입니까?**

지능과 비용을 동시에 개선해 같은 지능을 더 낮은 비용으로 얻는 경계선을 가리킵니다. 회사는 비슷한 인공지능 지수에서 과제당 비용이 더 낮다고 설명합니다.

## 출처

1. [StepFun Step 5 Preview 발표문](https://www.stepfun.com/step-5-preview) (official)
2. [해커뉴스 토론 스레드](https://news.ycombinator.com/item?id=49772532) (other)

_이 문서는 AI피셜 편집부가 작성했습니다. 인용 시 출처를 표기해 주세요._