무슨 일인가요
AllSpark Research 팀이 9월 4일 arXiv에 올린 "Iris: Climbing to the Search Frontier"는 검색 에이전트 두 개, Iris-mini와 Iris-pro를 소개합니다. 논문 Iris-mini는 Qwen3.6-35B-A3B, Iris-pro는 Qwen3.5-397B-A17B에서 초기화한 MoE 모델로 문맥 길이는 256K이며, 저자들은 모델 가중치와 데이터 구축·훈련·평가 레시피 전체를 공개하겠다고 밝혔습니다. 논문 Hugging Face 컬렉션에는 두 모델이 올라와 있고, Iris-mini 모델 카드는 Apache 2.0 라이선스에 BF16 safetensors 파일, 전문가 256개 중 8개 활성, SGLang으로 262K 문맥까지 서빙하는 방법을 적고 있습니다. 공식 이 글 작성 시점 컬렉션의 좋아요는 Iris-mini 197개, Iris-pro 589개입니다. 데이터
추론 구조는 단순합니다. 서브 에이전트나 테스트 시점 검증 없이 ReAct 에이전트 하나가 무엇을 검색할지 정하고 결과를 읽고 언제 멈출지 판단합니다. 논문

점수와 조건
| 벤치마크 | Iris-mini 끔 → 켬 | Iris-pro 끔 → 켬 |
|---|---|---|
| BrowseComp | 64.7 → 82.2 | 72.6 → 88.6 |
| BrowseComp-ZH | 72.3 → 84.8 | 76.8 → 85.1 |
| DeepSearchQA | 81.0 → 86.9 | 86.4 → 92.9 |
| HLE (텍스트) | 43.2 → 52.3 | 50.8 → 56.4 |
"끔"과 "켬"은 추론 시점 문맥 관리의 사용 여부이며, 수치는 모두 논문 표 기재값입니다. 논문 문맥 관리를 켠 조건에서 Iris-pro는 같은 397B급 오픈소스 에이전트인 XYZ-Aquila-pro(BrowseComp 84.8)와 Nex-N2-Pro(83.7)를 앞섰고, Iris-mini도 35B급 XYZ-Aquila-mini(78.8)를 넘었습니다. 논문 다만 폐쇄형과 견주면 Kimi-K3가 BrowseComp 91.2, Claude Fable 5가 88.0에 HLE 64.5로, 저자들도 프런티어 시스템에는 아직 미치지 못한다고 적었습니다. 논문
- 문맥 관리 끔
- 문맥 관리 켬
| 항목 | 문맥 관리 끔 | 문맥 관리 켬 |
|---|---|---|
| Iris-mini (35B) | 64.7 | 82.2 |
| Iris-pro (397B) | 72.6 | 88.6 |
출처: arXiv 2609.04304
어떻게 만들었나요
과제 합성
웹 하이퍼링크 구조에서 다중 홉 개체 사슬
궤적 필터링
기준 모델 검증, 다단계 선별
SFT
선별된 궤적으로 지도 학습
RL
실제 검색 상대, 그룹 상대 정책 경사
반복
SFT-RL climbing
과제는 웹 코퍼스의 하이퍼링크 구조에서 다중 홉 개체 사슬을 만들어 합성하고 기준 모델로 검증했으며, RL은 오픈소스 Relax 프레임워크 위에서 실제 검색을 상대로 그룹 상대 정책 경사를 적용하고 클러스터 안에 보상 모델과 요약 모델을 두는 방식입니다. 논문 GitHub 저장소에는 두 가지 문맥 관리 전략(discard-all, retry)을 지원하는 평가 하네스 Iris-Harness가 있고, 훈련 파이프라인은 "준비 중"으로 표시돼 있으며 이 글 작성 시점 스타는 37개입니다. 데이터



