본문으로 건너뛰기

샤오미가 모델 학습을 생중계합니다

샤오미 MiMo 팀이 다음 모델 mimo-v2.6의 강화학습 사후 학습 과정을 대시보드로 실시간 공개했습니다. 비용, 단계, 장애 공지, 중간 점수에서 무엇을 읽을 수 있는지 정리합니다.

AI피셜 편집부· 7분 읽기원문 보기 ↗
AI피셜 마스코트 AI가 라이브 표시가 켜진 학습 대시보드 앞에서 누적 비용 카드와 재시작 알림을 가리키는 가로형 썸네일
모델 학습의 비용과 장애 공지가 실시간 대시보드에 그대로 공개되는 장면을 설명합니다.· 사진: AI 생성 이미지 (ChatGPT Images 6 Pro)

TL;DR요약

  • 샤오미 MiMo 팀은 대시보드에서 “RL 대형 실행을 스트리밍하고 있다”며 mimo-v2.6 시리즈를 곧 공개한다고 밝혔습니다. 스트리밍은 2026년 9월 16일 04:00 UTC에 시작됐습니다.
  • 9월 17일 10시 21분(UTC) 관측 기준 mimo-v2.6-pro는 14단계·누적 비용 98만 2,834달러·토큰 302억 개, mimo-v2.6-flash는 18단계·44만 2,740달러·토큰 431억 개를 기록했습니다.
  • 대시보드는 한 노드의 그래픽 메모리 문제로 pro 실행을 다시 시작했고, 데이터셋 장애를 약 3시간 놓쳐 flash 실행을 15단계부터 다시 돌렸다고 공지했습니다.
  • 코딩 에이전트 벤치마크 DeepSWE v1.1의 중간 점수는 pro 65.78, flash 60.77이었습니다. 학습 중간 점수이며 최종 모델의 성능은 아닙니다.
AI피셜 마스코트 AI가 사후 학습과 강화학습의 뜻, 실시간 대시보드가 보여 주는 단계·비용·토큰, 재시작 공지, DeepSWE 중간 점수, 아직 공개되지 않은 비용 기준과 최종 성능을 차례로 설명하는 학습만화
샤오미 MiMo 실시간 학습 대시보드에서 읽을 수 있는 것과 아직 알 수 없는 것을 만화로 설명합니다.· 그림: AI 생성 이미지 (ChatGPT Images 6 Pro)

핵심 사실

공개 시작
2026-09-16 04:00 UTC대시보드 about 탭의 스트리밍 시작 시각입니다.
누적 비용
$1,425,5742026-09-17 10:21:05 UTC 관측값입니다. 산정 기준은 공개되지 않았습니다.
mimo-v2.6-pro
14단계 · 302억 토큰같은 관측 시각의 누적 비용 $982,834, 학습 샘플 35만 1천 개입니다.
mimo-v2.6-flash
18단계 · 431억 토큰같은 관측 시각의 누적 비용 $442,740, 학습 샘플 45만 2천 개입니다.
DeepSWE v1.1 중간 점수
pro 65.78 · flash 60.77mini-swe-agent, 3회 평균(avg@3)으로 표시된 학습 중 점수입니다.

AI 모델이 만들어지는 과정은 보통 결과 발표로만 알려집니다. 얼마나 오래 학습했는지, 도중에 무엇이 고장 났는지는 논문이나 기술 보고서에 나중에 짧게 적히는 경우가 많습니다. 샤오미 MiMo 팀은 이 과정을 거꾸로 공개했습니다. 다음 모델 mimo-v2.6을 다듬는 강화학습 실행을 대시보드로 실시간 보여 주고 있습니다. 공식

무엇을 학습하고 있습니까

대형 언어 모델은 대량의 글로 기본 능력을 익힌 뒤, 원하는 행동을 더 잘하도록 추가로 다듬는 사후 학습(post-training)을 거칩니다. 강화학습(reinforcement learning, RL)은 그 방법 중 하나로, 모델이 여러 답을 내면 점수를 매겨 좋은 답 쪽으로 가중치를 조금씩 옮깁니다.

대시보드의 about 탭은 “RL 대형 실행을 스트리밍하고 있다”며 mimo-v2.6 시리즈가 곧 나온다고 밝힙니다. 스트리밍 시작 시각은 2026년 9월 16일 04:00 UTC로 적혀 있습니다. 화면에는 mimo-v2.6-pro와 mimo-v2.6-flash 두 실행이 나란히 표시됩니다. 대시보드는 두 모델의 크기나 규격을 밝히지 않습니다. 공식

오른쪽 위 TOTAL COST $1,425,574와 베이징·로스앤젤레스·뉴욕·런던 시각, 가운데 notices 세 줄, 아래 mimo-v2.6-pro step 14와 mimo-v2.6-flash step 18 카드에 비용·토큰·학습 샘플 수가 표시된 대시보드 화면
2026년 9월 17일 10시 21분(UTC)에 저장한 대시보드 첫 화면입니다. 위쪽 공지에는 재시작 사유가, 아래 두 카드에는 모델별 학습 단계와 누적 비용·토큰 수가 표시됩니다. 수치는 학습이 진행되며 계속 바뀝니다.· 사진: Xiaomi MiMo 공식 대시보드 화면 · 편집 인용 (2026-09-17 10:21 UTC 저장)

숫자로 본 두 실행

9월 17일 10시 21분(UTC) 관측 기준 전체 누적 비용은 142만 5,574달러였습니다. 9월 15일 10시 32분에 시작한 pro 모델은 14단계까지 진행했고 누적 비용 98만 2,834달러, 토큰 302억 개, 학습 샘플 35만 1천 개를 기록했습니다. 같은 날 15시 16분에 시작한 flash 모델은 18단계, 44만 2,740달러, 토큰 431억 개, 학습 샘플 45만 2천 개였습니다. 두 모델 모두 학습 배치 크기를 “1,568 × 16 seqs”로 표시합니다. 한 단계에서 1,568개 입력마다 16개 응답을 만든다는 뜻으로 읽힙니다. 데이터

다만 대시보드는 비용이 무엇을 합친 금액인지 설명하지 않습니다. GPU 사용료인지 내부 원가를 달러로 환산한 값인지 알 수 없으므로, 이 숫자는 샤오미가 공개한 표시값으로 읽어야 합니다.

고장도 그대로 보입니다

이 대시보드에서 가장 드문 정보는 장애 공지입니다. 관측 시각 기준 약 14시간 전 공지는 한 노드의 그래픽 메모리(video RAM, VRAM) 문제로 pro 실행을 다시 시작한다고 알렸습니다. 약 8시간 전 공지는 데이터셋 하나의 인프라 오류를 약 3시간 동안 제대로 감지하지 못해 flash 실행을 15단계부터 다시 돌렸다고 밝혔습니다. 공식

대형 학습에서 장비와 데이터 문제가 생기는 일은 드물지 않지만, 그 사실과 대처가 실시간으로 공개되는 경우는 드뭅니다. 독자는 모델 성능 뒤에 이런 재시작과 확인 작업이 쌓인다는 점을 직접 볼 수 있습니다.

DeepSWE v1.1 mini-swe-agent avg@3 그래프에서 주황선 mimo-v2.6-pro가 65.78, 파란선 mimo-v2.6-flash가 60.77로 끝나고, 아래에 dynsam/avg@n, critic/rewards/mean, actor/entropy_loss 등 학습 지표 그래프 여섯 개가 배치된 대시보드 화면
같은 대시보드를 아래로 내린 화면입니다(10시 21분 UTC 저장). 맨 위 그래프는 학습 단계별 DeepSWE v1.1 중간 점수이고, 아래 작은 그래프들은 보상 평균·손실 같은 내부 학습 지표입니다. metrics 탭은 이런 지표 태그 2,069개를 제공합니다.· 사진: Xiaomi MiMo 공식 대시보드 화면 · 편집 인용 (2026-09-17 10:21 UTC 저장)

중간 점수와 아직 모르는 것

코딩 에이전트가 실제 소프트웨어 문제를 푸는 능력을 재는 DeepSWE v1.1 벤치마크에서, 대시보드는 pro 65.78, flash 60.77을 표시했습니다. 평가 방식은 mini-swe-agent로 세 번 실행한 평균(avg@3)이라고 적혀 있습니다. 이는 학습 도중 특정 단계에서 잰 중간 점수이며, 완성 모델의 공식 성능은 아닙니다. 데이터

이 대시보드는 9월 16일 20시 9분(UTC) Hacker News에 소개돼 17일 10시 14분 기준 436점과 댓글 114개를 받았습니다. 같은 날 20시 42분(UTC)에 달린 댓글은 더 많은 연구소가 이런 공개를 따라 하기를 바란다고 적었고, 20시 52분 댓글은 학습 도중 벤치마크를 돌리는 것이 평가 오염(contamination)에 해당하지 않느냐고 물었습니다. 보도

자주 묻는 질문

대시보드의 비용은 실제로 쓴 돈입니까?
대시보드는 전체 비용과 모델별 누적 비용을 달러로 표시하지만, GPU 임대료인지 내부 원가 환산인지 같은 산정 기준은 밝히지 않았습니다. 그래서 이 수치는 샤오미가 공개한 표시값으로 읽는 편이 정확합니다.
학습 중 점수가 높으면 완성 모델도 그만큼 좋습니까?
그렇게 단정할 수 없습니다. DeepSWE 점수는 학습 도중 특정 단계에서 잰 중간 결과입니다. Hacker News의 한 댓글(2026-09-16 20:52 UTC)은 학습 도중 벤치마크를 돌리는 것이 평가 오염(contamination)에 해당하지 않느냐고 물었습니다.
mimo-v2.6 모델은 공개됩니까?
대시보드는 mimo-v2.6 시리즈가 곧 나온다고만 밝혔습니다. 공개 시점과 가중치 공개 여부는 확인되지 않았습니다. 샤오미는 이전 세대인 MiMo-V2.5 계열 모델을 Hugging Face에 올려 두었습니다.
숫자가 기사와 다르게 보이는 이유는 무엇입니까?
대시보드 수치는 학습이 진행되는 동안 계속 바뀝니다. 이 기사의 수치는 2026년 9월 17일 10시 21분(UTC)에 저장한 화면 기준입니다.

출처 · 5

  1. 1Xiaomi MiMo: mimo-v2.6 RL overview · metrics · about공식 발표mimo.xiaomi.com/rl/
  2. 2Hugging Face: XiaomiMiMo 모델 목록공식 발표huggingface.co/XiaomiMiMo
  3. 3Hacker News 토론: Xiaomi Mimo 2.6 live post-training dashboard보도news.ycombinator.com/item?id=49732270
  4. 4Hacker News 댓글: 더 많은 연구소의 공개를 바라는 반응 (2026-09-16 20:42 UTC)보도news.ycombinator.com/item?id=49732726
  5. 5Hacker News 댓글: 학습 중 벤치마크와 평가 오염 질문 (2026-09-16 20:52 UTC)보도news.ycombinator.com/item?id=49732837

이 글의 마크다운 원문: /posts/xiaomi-mimo-live-rl-dashboard/md/ · 인용 시 출처를 “AI피셜”으로 표기해 주세요.

편집장의 새 책《의료 바이오 연구자를 위한 AI 신약개발 실전 가이드》 책 표지

의료 바이오 연구자를 위한
AI 신약개발 실전 가이드

Python 기초부터 QSAR·ChemBERTa·GNN,
분자 도킹까지 548쪽 실습서입니다.

책 소개 보기

이 글이 도움이 됐다면 추천해 주세요.

동료에게도 보내 주세요.

댓글

댓글 관련 문의: hello@aifficial.net

0 / 1000

댓글을 불러오는 중입니다…

AI피셜 주간 하이라이트

한 주 동안 AI 소식에서 중요한 것만 골라 월요일 아침에 보내드릴게요

같은 태그·카테고리의 글을 골랐습니다.

AI피셜 마스코트 AI가 새소리 파형, BirdNET-Go 분류 카드, 13.3인치 전자종이 액자를 순서대로 살피는 가로형 썸네일
오픈소스 AI· 7

새소리를 실제 옛 도판으로 바꾸는 액자

Fugleramme은 BirdNET-Go의 감지 결과를 공개 조류 도판과 연결해 13.3인치 전자종이 액자에 배치하는 초기 오픈소스 프로젝트입니다.

  • #오픈소스 AI
  • #전자종이
  • #Fugleramme
논문 저자들이 속한 퍼듀 대학교의 호브디 홀 건물 정면
논문 한입· 6

온폴리시 증류는 정말 '증류'일까 — 교사 없이 오른 점수

Purdue 연구진이 온폴리시 증류(OPD)의 교사 신호에 큰 노이즈가 섞여 있고, 교사 없이 낮은 확률 토큰만 눌러도 비슷하게 오른다는 것을 보였습니다. Qwen3-1.7B의 AIME24가 13.4점에서 48.9점이 됐습니다.

  • #논문
  • #지식 증류
  • #강화학습