# 샤오미가 모델 학습을 생중계합니다

> 샤오미 MiMo 팀이 다음 모델 mimo-v2.6의 강화학습 사후 학습 과정을 대시보드로 실시간 공개했습니다. 비용, 단계, 장애 공지, 중간 점수에서 무엇을 읽을 수 있는지 정리합니다.

- 출처 사이트: AI피셜 (https://aifficial.net/posts/xiaomi-mimo-live-rl-dashboard/)
- 발행: 2026-09-17
- 카테고리: AI 모델 · 태그: 샤오미, MiMo, 강화학습, 오픈소스 AI, AI 모델

## 핵심 답변

샤오미 MiMo 팀은 다음 모델인 mimo-v2.6의 사후 학습(post-training) 가운데 강화학습(reinforcement learning, RL) 실행 과정을 mimo.xiaomi.com/rl 대시보드로 실시간 공개하고 있습니다. 2026년 9월 17일 10시 21분(UTC) 기준 대시보드는 pro와 flash 두 모델의 누적 비용을 합쳐 142만 5,574달러로 표시했고, 학습 단계와 사용 토큰, 장비 문제로 인한 재시작 공지, DeepSWE 벤치마크 중간 점수도 함께 보여 주었습니다. 비용의 산정 기준과 최종 모델의 성능은 아직 공개되지 않았습니다.

## 한 장 요약(만화)

![AI피셜 마스코트 AI가 사후 학습과 강화학습의 뜻, 실시간 대시보드가 보여 주는 단계·비용·토큰, 재시작 공지, DeepSWE 중간 점수, 아직 공개되지 않은 비용 기준과 최종 성능을 차례로 설명하는 학습만화](https://aifficial.net/images/posts/xiaomi-mimo-live-rl-dashboard/learning-comic_v1.0.0.webp)

## 요약

- 샤오미 MiMo 팀은 대시보드에서 “RL 대형 실행을 스트리밍하고 있다”며 mimo-v2.6 시리즈를 곧 공개한다고 밝혔습니다. 스트리밍은 2026년 9월 16일 04:00 UTC에 시작됐습니다.
- 9월 17일 10시 21분(UTC) 관측 기준 mimo-v2.6-pro는 14단계·누적 비용 98만 2,834달러·토큰 302억 개, mimo-v2.6-flash는 18단계·44만 2,740달러·토큰 431억 개를 기록했습니다.
- 대시보드는 한 노드의 그래픽 메모리 문제로 pro 실행을 다시 시작했고, 데이터셋 장애를 약 3시간 놓쳐 flash 실행을 15단계부터 다시 돌렸다고 공지했습니다.
- 코딩 에이전트 벤치마크 DeepSWE v1.1의 중간 점수는 pro 65.78, flash 60.77이었습니다. 학습 중간 점수이며 최종 모델의 성능은 아닙니다.

## 핵심 사실

| 항목 | 값 |
|---|---|
| 공개 시작 | 2026-09-16 04:00 UTC (대시보드 about 탭의 스트리밍 시작 시각입니다.) |
| 누적 비용 | $1,425,574 (2026-09-17 10:21:05 UTC 관측값입니다. 산정 기준은 공개되지 않았습니다.) |
| mimo-v2.6-pro | 14단계 · 302억 토큰 (같은 관측 시각의 누적 비용 $982,834, 학습 샘플 35만 1천 개입니다.) |
| mimo-v2.6-flash | 18단계 · 431억 토큰 (같은 관측 시각의 누적 비용 $442,740, 학습 샘플 45만 2천 개입니다.) |
| DeepSWE v1.1 중간 점수 | pro 65.78 · flash 60.77 (mini-swe-agent, 3회 평균(avg@3)으로 표시된 학습 중 점수입니다.) |


AI 모델이 만들어지는 과정은 보통 결과 발표로만 알려집니다. 얼마나 오래 학습했는지, 도중에 무엇이 고장 났는지는 논문이나 기술 보고서에 나중에 짧게 적히는 경우가 많습니다. 샤오미 MiMo 팀은 이 과정을 거꾸로 공개했습니다. 다음 모델 mimo-v2.6을 다듬는 강화학습 실행을 대시보드로 실시간 보여 주고 있습니다. 

## 무엇을 학습하고 있습니까

대형 언어 모델은 대량의 글로 기본 능력을 익힌 뒤, 원하는 행동을 더 잘하도록 추가로 다듬는 사후 학습(post-training)을 거칩니다. 강화학습(reinforcement learning, RL)은 그 방법 중 하나로, 모델이 여러 답을 내면 점수를 매겨 좋은 답 쪽으로 가중치를 조금씩 옮깁니다.

대시보드의 about 탭은 “RL 대형 실행을 스트리밍하고 있다”며 mimo-v2.6 시리즈가 곧 나온다고 밝힙니다. 스트리밍 시작 시각은 2026년 9월 16일 04:00 UTC로 적혀 있습니다. 화면에는 mimo-v2.6-pro와 mimo-v2.6-flash 두 실행이 나란히 표시됩니다. 대시보드는 두 모델의 크기나 규격을 밝히지 않습니다. 



## 숫자로 본 두 실행

9월 17일 10시 21분(UTC) 관측 기준 전체 누적 비용은 142만 5,574달러였습니다. 9월 15일 10시 32분에 시작한 pro 모델은 14단계까지 진행했고 누적 비용 98만 2,834달러, 토큰 302억 개, 학습 샘플 35만 1천 개를 기록했습니다. 같은 날 15시 16분에 시작한 flash 모델은 18단계, 44만 2,740달러, 토큰 431억 개, 학습 샘플 45만 2천 개였습니다. 두 모델 모두 학습 배치 크기를 “1,568 × 16 seqs”로 표시합니다. 한 단계에서 1,568개 입력마다 16개 응답을 만든다는 뜻으로 읽힙니다. 

다만 대시보드는 비용이 무엇을 합친 금액인지 설명하지 않습니다. GPU 사용료인지 내부 원가를 달러로 환산한 값인지 알 수 없으므로, 이 숫자는 샤오미가 공개한 표시값으로 읽어야 합니다.

## 고장도 그대로 보입니다

이 대시보드에서 가장 드문 정보는 장애 공지입니다. 관측 시각 기준 약 14시간 전 공지는 한 노드의 그래픽 메모리(video RAM, VRAM) 문제로 pro 실행을 다시 시작한다고 알렸습니다. 약 8시간 전 공지는 데이터셋 하나의 인프라 오류를 약 3시간 동안 제대로 감지하지 못해 flash 실행을 15단계부터 다시 돌렸다고 밝혔습니다. 

대형 학습에서 장비와 데이터 문제가 생기는 일은 드물지 않지만, 그 사실과 대처가 실시간으로 공개되는 경우는 드뭅니다. 독자는 모델 성능 뒤에 이런 재시작과 확인 작업이 쌓인다는 점을 직접 볼 수 있습니다.



## 중간 점수와 아직 모르는 것

코딩 에이전트가 실제 소프트웨어 문제를 푸는 능력을 재는 DeepSWE v1.1 벤치마크에서, 대시보드는 pro 65.78, flash 60.77을 표시했습니다. 평가 방식은 mini-swe-agent로 세 번 실행한 평균(avg@3)이라고 적혀 있습니다. 이는 학습 도중 특정 단계에서 잰 중간 점수이며, 완성 모델의 공식 성능은 아닙니다. 

이 대시보드는 9월 16일 20시 9분(UTC) Hacker News에 소개돼 17일 10시 14분 기준 436점과 댓글 114개를 받았습니다. 같은 날 20시 42분(UTC)에 달린 댓글은 더 많은 연구소가 이런 공개를 따라 하기를 바란다고 적었고, 20시 52분 댓글은 학습 도중 벤치마크를 돌리는 것이 평가 오염(contamination)에 해당하지 않느냐고 물었습니다. 


모델 발표가 늘 완성된 점수표로만 오다 보니, 그 뒤에 재시작과 장애 확인이 얼마나 쌓이는지는 잘 보이지 않았습니다. 샤오미의 대시보드는 그 과정을 숫자와 공지로 보여 준다는 점에서 신선한 공개 방식 같습니다. 다만 비용의 기준과 최종 성능은 아직 비어 있으니, 투명성의 크기는 모델이 공개될 때 함께 판단해야 하지 않을까 싶습니다. 여러분은 AI 모델을 고를 때 이런 학습 과정 공개가 신뢰에 도움이 된다고 보십니까? 



## 자주 묻는 질문

**Q. 대시보드의 비용은 실제로 쓴 돈입니까?**

대시보드는 전체 비용과 모델별 누적 비용을 달러로 표시하지만, GPU 임대료인지 내부 원가 환산인지 같은 산정 기준은 밝히지 않았습니다. 그래서 이 수치는 샤오미가 공개한 표시값으로 읽는 편이 정확합니다.

**Q. 학습 중 점수가 높으면 완성 모델도 그만큼 좋습니까?**

그렇게 단정할 수 없습니다. DeepSWE 점수는 학습 도중 특정 단계에서 잰 중간 결과입니다. Hacker News의 한 댓글(2026-09-16 20:52 UTC)은 학습 도중 벤치마크를 돌리는 것이 평가 오염(contamination)에 해당하지 않느냐고 물었습니다.

**Q. mimo-v2.6 모델은 공개됩니까?**

대시보드는 mimo-v2.6 시리즈가 곧 나온다고만 밝혔습니다. 공개 시점과 가중치 공개 여부는 확인되지 않았습니다. 샤오미는 이전 세대인 MiMo-V2.5 계열 모델을 Hugging Face에 올려 두었습니다.

**Q. 숫자가 기사와 다르게 보이는 이유는 무엇입니까?**

대시보드 수치는 학습이 진행되는 동안 계속 바뀝니다. 이 기사의 수치는 2026년 9월 17일 10시 21분(UTC)에 저장한 화면 기준입니다.

## 출처

1. [Xiaomi MiMo: mimo-v2.6 RL overview · metrics · about](https://mimo.xiaomi.com/rl/) (official)
2. [Hugging Face: XiaomiMiMo 모델 목록](https://huggingface.co/XiaomiMiMo) (official)
3. [Hacker News 토론: Xiaomi Mimo 2.6 live post-training dashboard](https://news.ycombinator.com/item?id=49732270) (report)
4. [Hacker News 댓글: 더 많은 연구소의 공개를 바라는 반응 (2026-09-16 20:42 UTC)](https://news.ycombinator.com/item?id=49732726) (report)
5. [Hacker News 댓글: 학습 중 벤치마크와 평가 오염 질문 (2026-09-16 20:52 UTC)](https://news.ycombinator.com/item?id=49732837) (report)

_이 문서는 AI피셜 편집부가 작성했습니다. 인용 시 출처를 표기해 주세요._