본문으로 건너뛰기

Iris — 오픈 웨이트 검색 에이전트, BrowseComp 88.6%

AllSpark Research가 Qwen 기반으로 후속 학습한 오픈 웨이트 검색 에이전트 Iris-mini·Iris-pro를 공개했습니다. 벤치마크 점수와 그 조건(문맥 관리)을 함께 정리했습니다.

AI피셜 편집부· 2분 읽기원문 보기 ↗
데이터센터 전산실에 줄지어 선 서버 랙과 배선반
사진: Carl Lender from Sunrise, USA · CC BY 2.0

핵심 답변

AllSpark Research는 2026년 9월 4일 공개한 arXiv 논문과 Hugging Face 컬렉션에서 Qwen3.6-35B-A3B로 만든 Iris-mini와 Qwen3.5-397B-A17B로 만든 Iris-pro를 오픈 웨이트 검색 에이전트로 내놓았습니다. 추론 시 문맥 관리를 켠 조건에서 BrowseComp 82.2%·88.6%, HLE 52.3%·56.4%를 기록했으며, 문맥 관리를 끄면 BrowseComp가 각각 64.7%·72.6%로 내려갑니다.

TL;DR세 줄 요약

  • Iris-mini(35B, 활성 3B)와 Iris-pro(397B, 활성 17B) 두 모델이며 문맥 길이는 256K, Iris-mini 모델 카드의 라이선스는 Apache 2.0입니다.
  • 문맥 관리를 켠 조건에서 Iris-pro는 BrowseComp 88.6, BrowseComp-ZH 85.1, DeepSearchQA 92.9, HLE 56.4로 같은 크기 오픈소스 에이전트 중 최고라고 논문은 밝혔습니다.
  • 문맥 관리를 끄면 Iris-mini의 BrowseComp는 64.7로 21.2점 내려갑니다. 저자들도 이를 핵심 한계로 적었습니다.
  • 서브 에이전트나 테스트 시점 검증 없이 ReAct 에이전트 하나로 추론하며, SFT와 RL을 번갈아 올리는 'SFT-RL climbing'으로 훈련했습니다.

핵심 사실

논문
arXiv 2609.043042026-09-04, AllSpark Research
Iris-mini
Qwen3.6-35B-A3B 기반35B, 활성 3B, 256K 문맥, Apache 2.0
Iris-pro
Qwen3.5-397B-A17B 기반397B, 활성 17B, 256K 문맥
BrowseComp (문맥 관리 켬)
82.2 / 88.6mini / pro
BrowseComp (문맥 관리 끔)
64.7 / 72.6mini / pro
공개 위치
Hugging Face · GitHubAllSpark-Research/Iris, 훈련 파이프라인은 '준비 중'

무슨 일인가요

AllSpark Research 팀이 9월 4일 arXiv에 올린 "Iris: Climbing to the Search Frontier"는 검색 에이전트 두 개, Iris-mini와 Iris-pro를 소개합니다. 논문 Iris-mini는 Qwen3.6-35B-A3B, Iris-pro는 Qwen3.5-397B-A17B에서 초기화한 MoE 모델로 문맥 길이는 256K이며, 저자들은 모델 가중치와 데이터 구축·훈련·평가 레시피 전체를 공개하겠다고 밝혔습니다. 논문 Hugging Face 컬렉션에는 두 모델이 올라와 있고, Iris-mini 모델 카드는 Apache 2.0 라이선스에 BF16 safetensors 파일, 전문가 256개 중 8개 활성, SGLang으로 262K 문맥까지 서빙하는 방법을 적고 있습니다. 공식 이 글 작성 시점 컬렉션의 좋아요는 Iris-mini 197개, Iris-pro 589개입니다. 데이터

추론 구조는 단순합니다. 서브 에이전트나 테스트 시점 검증 없이 ReAct 에이전트 하나가 무엇을 검색할지 정하고 결과를 읽고 언제 멈출지 판단합니다. 논문

분류 기호가 붙은 서가에 학술지가 빼곡히 꽂혀 있는 도서관 서고
Iris의 훈련 과제는 웹 코퍼스의 하이퍼링크 구조에서 다중 홉 개체 사슬을 뽑아 합성했습니다. 사진은 일리노이대 수학 도서관의 서고입니다.· 사진: University of Illinois Library · CC BY 2.0

점수와 조건

벤치마크Iris-mini 끔 → 켬Iris-pro 끔 → 켬
BrowseComp64.7 → 82.272.6 → 88.6
BrowseComp-ZH72.3 → 84.876.8 → 85.1
DeepSearchQA81.0 → 86.986.4 → 92.9
HLE (텍스트)43.2 → 52.350.8 → 56.4

"끔"과 "켬"은 추론 시점 문맥 관리의 사용 여부이며, 수치는 모두 논문 표 기재값입니다. 논문 문맥 관리를 켠 조건에서 Iris-pro는 같은 397B급 오픈소스 에이전트인 XYZ-Aquila-pro(BrowseComp 84.8)와 Nex-N2-Pro(83.7)를 앞섰고, Iris-mini도 35B급 XYZ-Aquila-mini(78.8)를 넘었습니다. 논문 다만 폐쇄형과 견주면 Kimi-K3가 BrowseComp 91.2, Claude Fable 5가 88.0에 HLE 64.5로, 저자들도 프런티어 시스템에는 아직 미치지 못한다고 적었습니다. 논문

BrowseComp 점수 — 문맥 관리 끔 vs 켬
0.025.050.075.0100.0Iris-mini (35B)Iris-pro (397B)64.772.682.288.6
  • 문맥 관리 끔
  • 문맥 관리 켬
BrowseComp 점수 — 문맥 관리 끔 vs 켬
항목문맥 관리 끔문맥 관리 켬
Iris-mini (35B)64.782.2
Iris-pro (397B)72.688.6

출처: arXiv 2609.04304

어떻게 만들었나요

Iris 훈련 파이프라인
  1. 과제 합성

    웹 하이퍼링크 구조에서 다중 홉 개체 사슬

  2. 궤적 필터링

    기준 모델 검증, 다단계 선별

  3. SFT

    선별된 궤적으로 지도 학습

  4. RL

    실제 검색 상대, 그룹 상대 정책 경사

  5. 반복

    SFT-RL climbing

과제는 웹 코퍼스의 하이퍼링크 구조에서 다중 홉 개체 사슬을 만들어 합성하고 기준 모델로 검증했으며, RL은 오픈소스 Relax 프레임워크 위에서 실제 검색을 상대로 그룹 상대 정책 경사를 적용하고 클러스터 안에 보상 모델과 요약 모델을 두는 방식입니다. 논문 GitHub 저장소에는 두 가지 문맥 관리 전략(discard-all, retry)을 지원하는 평가 하네스 Iris-Harness가 있고, 훈련 파이프라인은 "준비 중"으로 표시돼 있으며 이 글 작성 시점 스타는 37개입니다. 데이터

무엇을 보면 되나요

자주 묻는 질문

문맥 관리란 무엇인가요?
긴 검색 과정에서 쌓인 도구 호출 결과를 추론 도중 어떻게 처리할지 정하는 추론 시점 전략입니다. GitHub의 Iris-Harness는 'discard-all'과 'retry' 두 전략을 지원하며, 논문의 헤드라인 수치는 이 전략을 켠 조건에서 나온 것입니다.
폐쇄형 프런티어 모델과 비교하면 어떤가요?
논문 표 기준 Kimi-K3는 BrowseComp 91.2, Claude Fable 5는 BrowseComp 88.0에 HLE 64.5입니다. Iris-pro는 BrowseComp에서 Claude Fable 5보다 높지만 HLE는 낮고, 저자들도 프런티어 시스템에는 아직 미치지 못한다고 적었습니다.
어떻게 훈련했나요?
웹 코퍼스의 하이퍼링크 구조에서 다중 홉 개체 사슬을 만들어 문제를 합성하고 기준 모델로 검증한 뒤 궤적을 여러 단계로 걸렀습니다. 그 뒤 SFT와 실제 검색을 상대로 한 RL(그룹 상대 정책 경사, 오픈소스 Relax 프레임워크)을 번갈아 반복했습니다.

출처 · 5

  1. 1Iris: Climbing to the Search Frontier (arXiv 2609.04304)논문arxiv.org/abs/2609.04304
  2. 2같은 논문 HTML 전문 (arXiv)논문arxiv.org/html/2609.04304
  3. 3Iris 컬렉션 (Hugging Face)공식 발표huggingface.co/collections/AllSpark-Research/iris
  4. 4Iris-mini 모델 카드 (Hugging Face)공식 발표huggingface.co/AllSpark-Research/Iris-mini
  5. 5AllSpark-Research/Iris 저장소 (GitHub)공식 발표github.com/AllSpark-Research/Iris

이 글의 마크다운 원문: /posts/iris-open-search-agents/md/ · 인용 시 출처를 “AI피셜”으로 표기해 주세요.

이 글이 도움이 됐다면 동료에게 보내 주세요.

AI피셜 새 글 알림

새 글이 올라오면 메일로 알려드려요

매일 5편, 5분 브리프. 스팸 없이 새 글 소식만. 언제든 한 번에 해지.

같은 태그·카테고리의 글을 골랐습니다.

오픈소스· 2

Mitra-v2 — 77M 표 형식 모델이 1.6B TabFM과 동급

Amazon이 9월 3일 표 형식 데이터용 기반 모델 Mitra-v2의 기술 보고서를 내고 가중치를 Apache-2.0으로 공개했습니다. 77M 파라미터로 TabArena·TALENT에서 1.6B TabFM과 통계적 동급이었습니다.

  • #오픈소스
  • #Amazon
  • #표 형식 데이터
오픈소스· 3

K2 Horizon — 0.9B부터 375B까지 '완전 개방' 모델

MBZUAI 산하 IFM이 9월 3일 K2 Horizon 패밀리를 Apache 2.0으로 공개했습니다. 375B MoE 플래그십의 벤치마크와 가중치·데이터·코드·체크포인트 공개 범위를 정리했습니다.

  • #오픈소스
  • #IFM
  • #K2 Horizon
모델· 4

Claude Fable 5.1·Mythos 5.1 — 캐시 75% 인하

Anthropic이 9월 1일 공개한 Fable 5.1은 입력·출력 가격은 그대로 두고 캐시 읽기를 $1.00에서 $0.25로 내렸습니다. 벤치마크와 Mythos 접근 정책을 정리했습니다.

  • #Anthropic
  • #Claude
  • #모델 출시