무슨 일인가요
MBZUAI가 2025년 5월 세운 연구소 IFM(Institute of Foundation Models)이 K2 Horizon 모델 패밀리를 Hugging Face에 공개했습니다. IFM은 스스로를 "프론티어급 파운데이션 모델의 개방적이고 독립적인 개발에 전념하는 글로벌 AI 연구소"로 소개하며 아부다비·실리콘밸리·파리에 거점을 두고 있습니다. 공식 기존 LLM360 조직은 IFM으로 옮겨 갔고, 이전 K2 시리즈의 후속이 이번 Horizon입니다. 공식 The Neuron은 9월 3일 자 정리에서 이를 "0.9B부터 375B까지 6개의 완전 개방 모델"로, 가중치·학습 코드·데이터·체크포인트·로그를 포함한다고 전했습니다. 보도

패밀리 구성
| 모델 | 파라미터 | 구조 | 컨텍스트 | 라이선스 |
|---|---|---|---|---|
| K2-Horizon-375B-A23B | 총 375B / 활성 23B | Sparse MoE | 512K | Apache 2.0 |
| K2-Horizon-MoVA-36B-A4B | 총 36B / 활성 4B | MoE + Mixture-of-Values attention | 512K | Apache 2.0 |
| K2-Horizon-32B | 32B | 밀집 | 512K | Apache 2.0 |
| K2-Horizon-7B | 7B 코어 (HF 표기 9B) | 밀집 | 512K | Apache 2.0 |
| K2-Horizon-0.9B | 0.9B | 밀집 | 512K | Apache 2.0 |
표의 수치는 각 모델 카드와 IFM 조직 페이지 기준입니다. 공식 모든 모델이 524,288토큰의 네이티브 컨텍스트를 갖는 점이 눈에 띄고, 뒤이어 7B-Uno·0.9B-Uno 변형도 올라왔습니다. 공식
성능 — 오픈 MoE 중 어디쯤인가
375B-A23B 카드는 "최대 2.6배 큰 오픈 웨이트 MoE 모델과 대등하거나 앞선다"고 요약하며, 터미널 사용 70.2%, 과학 코딩 42.7%, 장문 맥락 추론 76.0%를 앞세웁니다. 공식 비교표에 실린 오픈 MoE 모델들의 Terminal-Bench 2.1 점수는 아래와 같습니다. 데이터
| 항목 | Terminal-Bench 2.1 |
|---|---|
| K2-Horizon 375B | 70.2% |
| Nemotron 3 Ultra 550B | 53.9% |
| Inkling 975B | 55.1% |
| MiniMax-M3 428B | 65.2% |
| GLM 5.2 753B | 77.9% |
출처: K2-Horizon-375B-A23B 모델 카드 비교표
같은 표에서 폐쇄형 모델과 견주면 그림이 달라집니다. Terminal-Bench 2.1은 GPT 5.6 Luna 80.9%·Claude Sonnet 5 80.5%, Humanity's Last Exam은 K2 32.0% 대 Sonnet 5 41.3%, GDPVal-AA는 1,441 대 1,584 Elo입니다. 데이터 반면 저장소 수준 코드 질의응답인 SWE-Atlas-QnA(strict)는 48.4%로 표 안에서 가장 높습니다. 데이터 작은 모델도 비교 대상을 명시했습니다. 7B는 HMMT Feb 2026 73.3%(Gemma 4-12B 63.1%), SWE-bench 70.6%(Granite 4.2-8B 47.7%), HLE 18.6%(Qwen3.5-9B 14.9%)이고, MoVA-36B-A4B는 Terminal-Bench 2.1 58.6%, GPQA Diamond 80.8%입니다. 데이터
'완전 개방'의 범위
공개 범위
지금 받을 수 있는 것과 '예정'인 것
지금: 전 모델 최종 가중치(Apache 2.0, BF16 safetensors), vLLM·SGLang 실행 레시피, 양자화 버전
지금: 데이터셋 TxT360-v2·Pretrain-Behaviors·Math-Reasoning·Code-Reasoning·SFT-Reasoning
예정: 학습 레시피·학습 코드·중간 체크포인트 — 능력 발달 과정 연구용으로 공개하겠다고 명시
K2-Horizon-375B-A23B·MoVA-36B-A4B 모델 카드, IFM 조직 페이지 기준
IFM 조직 페이지에는 TxT360-v2, Math-Reasoning, Code-Reasoning 등 데이터셋이 이미 올라와 있고, 그중 Math-Reasoning은 다운로드 20억 건 이상으로 표시됩니다. 데이터



