# Iris — 오픈 웨이트 검색 에이전트, BrowseComp 88.6%

> AllSpark Research가 Qwen 기반으로 후속 학습한 오픈 웨이트 검색 에이전트 Iris-mini·Iris-pro를 공개했습니다. 벤치마크 점수와 그 조건(문맥 관리)을 함께 정리했습니다.

- 출처 사이트: AI피셜 (https://aifficial.net/posts/iris-open-search-agents/)
- 발행: 2026-09-08
- 카테고리: 오픈소스 · 태그: 오픈소스, 검색 에이전트, Qwen, 벤치마크, 모델 출시

## 핵심 답변

AllSpark Research는 2026년 9월 4일 공개한 arXiv 논문과 Hugging Face 컬렉션에서 Qwen3.6-35B-A3B로 만든 Iris-mini와 Qwen3.5-397B-A17B로 만든 Iris-pro를 오픈 웨이트 검색 에이전트로 내놓았습니다. 추론 시 문맥 관리를 켠 조건에서 BrowseComp 82.2%·88.6%, HLE 52.3%·56.4%를 기록했으며, 문맥 관리를 끄면 BrowseComp가 각각 64.7%·72.6%로 내려갑니다.

## 요약

- Iris-mini(35B, 활성 3B)와 Iris-pro(397B, 활성 17B) 두 모델이며 문맥 길이는 256K, Iris-mini 모델 카드의 라이선스는 Apache 2.0입니다.
- 문맥 관리를 켠 조건에서 Iris-pro는 BrowseComp 88.6, BrowseComp-ZH 85.1, DeepSearchQA 92.9, HLE 56.4로 같은 크기 오픈소스 에이전트 중 최고라고 논문은 밝혔습니다.
- 문맥 관리를 끄면 Iris-mini의 BrowseComp는 64.7로 21.2점 내려갑니다. 저자들도 이를 핵심 한계로 적었습니다.
- 서브 에이전트나 테스트 시점 검증 없이 ReAct 에이전트 하나로 추론하며, SFT와 RL을 번갈아 올리는 'SFT-RL climbing'으로 훈련했습니다.

## 핵심 사실

| 항목 | 값 |
|---|---|
| 논문 | arXiv 2609.04304 (2026-09-04, AllSpark Research) |
| Iris-mini | Qwen3.6-35B-A3B 기반 (35B, 활성 3B, 256K 문맥, Apache 2.0) |
| Iris-pro | Qwen3.5-397B-A17B 기반 (397B, 활성 17B, 256K 문맥) |
| BrowseComp (문맥 관리 켬) | 82.2 / 88.6 (mini / pro) |
| BrowseComp (문맥 관리 끔) | 64.7 / 72.6 (mini / pro) |
| 공개 위치 | Hugging Face · GitHub (AllSpark-Research/Iris, 훈련 파이프라인은 '준비 중') |


## 무슨 일인가요

AllSpark Research 팀이 9월 4일 arXiv에 올린 "Iris: Climbing to the Search Frontier"는 검색 에이전트 두 개, Iris-mini와 Iris-pro를 소개합니다.  Iris-mini는 Qwen3.6-35B-A3B, Iris-pro는 Qwen3.5-397B-A17B에서 초기화한 MoE 모델로 문맥 길이는 256K이며, 저자들은 모델 가중치와 데이터 구축·훈련·평가 레시피 전체를 공개하겠다고 밝혔습니다.  Hugging Face 컬렉션에는 두 모델이 올라와 있고, Iris-mini 모델 카드는 Apache 2.0 라이선스에 BF16 safetensors 파일, 전문가 256개 중 8개 활성, SGLang으로 262K 문맥까지 서빙하는 방법을 적고 있습니다.  이 글 작성 시점 컬렉션의 좋아요는 Iris-mini 197개, Iris-pro 589개입니다. 

추론 구조는 단순합니다. 서브 에이전트나 테스트 시점 검증 없이 ReAct 에이전트 하나가 무엇을 검색할지 정하고 결과를 읽고 언제 멈출지 판단합니다. 



## 점수와 조건

| 벤치마크 | Iris-mini 끔 → 켬 | Iris-pro 끔 → 켬 |
| --- | --- | --- |
| BrowseComp | 64.7 → 82.2 | 72.6 → 88.6 |
| BrowseComp-ZH | 72.3 → 84.8 | 76.8 → 85.1 |
| DeepSearchQA | 81.0 → 86.9 | 86.4 → 92.9 |
| HLE (텍스트) | 43.2 → 52.3 | 50.8 → 56.4 |

"끔"과 "켬"은 추론 시점 문맥 관리의 사용 여부이며, 수치는 모두 논문 표 기재값입니다.  문맥 관리를 켠 조건에서 Iris-pro는 같은 397B급 오픈소스 에이전트인 XYZ-Aquila-pro(BrowseComp 84.8)와 Nex-N2-Pro(83.7)를 앞섰고, Iris-mini도 35B급 XYZ-Aquila-mini(78.8)를 넘었습니다.  다만 폐쇄형과 견주면 Kimi-K3가 BrowseComp 91.2, Claude Fable 5가 88.0에 HLE 64.5로, 저자들도 프런티어 시스템에는 아직 미치지 못한다고 적었습니다. 



## 어떻게 만들었나요



과제는 웹 코퍼스의 하이퍼링크 구조에서 다중 홉 개체 사슬을 만들어 합성하고 기준 모델로 검증했으며, RL은 오픈소스 Relax 프레임워크 위에서 실제 검색을 상대로 그룹 상대 정책 경사를 적용하고 클러스터 안에 보상 모델과 요약 모델을 두는 방식입니다.  GitHub 저장소에는 두 가지 문맥 관리 전략(discard-all, retry)을 지원하는 평가 하네스 Iris-Harness가 있고, 훈련 파이프라인은 "준비 중"으로 표시돼 있으며 이 글 작성 시점 스타는 37개입니다. 


저자들은 문맥 관리가 벤치마크 점수를 크게 끌어올린다는 점을 명시했습니다. Iris-mini의 BrowseComp는 문맥 관리 없이 64.7, 켜면 82.2로 최대 21.2점 차이가 나며, 이는 모델 자체의 능력 격차를 추론 시점 개입으로 메우고 있다는 뜻입니다. 


## 무엇을 보면 되나요


Iris의 진짜 기여는 "BrowseComp 88.6"이 아니라 그 숫자를 끔·켬으로 나눠서 보여 줬다는 점이라고 봅니다. 검색 에이전트 점수의 상당 부분이 추론 시점 문맥 처리에서 나온다면, 다른 오픈 모델을 평가할 때도 같은 조건을 맞춰야 비교가 성립합니다. 활성 3B짜리 Iris-mini가 문맥 관리와 함께 82.2를 낸다는 사실은 자체 검색 에이전트를 돌리려는 팀에게 현실적인 선택지이지만, 훈련 레시피가 아직 공개되지 않아 재현성은 지켜봐야 합니다. 



## 자주 묻는 질문

**Q. 문맥 관리란 무엇인가요?**

긴 검색 과정에서 쌓인 도구 호출 결과를 추론 도중 어떻게 처리할지 정하는 추론 시점 전략입니다. GitHub의 Iris-Harness는 'discard-all'과 'retry' 두 전략을 지원하며, 논문의 헤드라인 수치는 이 전략을 켠 조건에서 나온 것입니다.

**Q. 폐쇄형 프런티어 모델과 비교하면 어떤가요?**

논문 표 기준 Kimi-K3는 BrowseComp 91.2, Claude Fable 5는 BrowseComp 88.0에 HLE 64.5입니다. Iris-pro는 BrowseComp에서 Claude Fable 5보다 높지만 HLE는 낮고, 저자들도 프런티어 시스템에는 아직 미치지 못한다고 적었습니다.

**Q. 어떻게 훈련했나요?**

웹 코퍼스의 하이퍼링크 구조에서 다중 홉 개체 사슬을 만들어 문제를 합성하고 기준 모델로 검증한 뒤 궤적을 여러 단계로 걸렀습니다. 그 뒤 SFT와 실제 검색을 상대로 한 RL(그룹 상대 정책 경사, 오픈소스 Relax 프레임워크)을 번갈아 반복했습니다.

## 출처

1. [Iris: Climbing to the Search Frontier (arXiv 2609.04304)](https://arxiv.org/abs/2609.04304) (paper)
2. [같은 논문 HTML 전문 (arXiv)](https://arxiv.org/html/2609.04304) (paper)
3. [Iris 컬렉션 (Hugging Face)](https://huggingface.co/collections/AllSpark-Research/iris) (official)
4. [Iris-mini 모델 카드 (Hugging Face)](https://huggingface.co/AllSpark-Research/Iris-mini) (official)
5. [AllSpark-Research/Iris 저장소 (GitHub)](https://github.com/AllSpark-Research/Iris) (official)

_이 문서는 AI피셜 편집부가 작성했습니다. 인용 시 출처를 표기해 주세요._