
Iris — 오픈 웨이트 검색 에이전트, BrowseComp 88.6%
AllSpark Research가 Qwen 기반으로 후속 학습한 오픈 웨이트 검색 에이전트 Iris-mini·Iris-pro를 공개했습니다. 벤치마크 점수와 그 조건(문맥 관리)을 함께 정리했습니다.
- #오픈소스
- #검색 에이전트
- #Qwen
11편

AllSpark Research가 Qwen 기반으로 후속 학습한 오픈 웨이트 검색 에이전트 Iris-mini·Iris-pro를 공개했습니다. 벤치마크 점수와 그 조건(문맥 관리)을 함께 정리했습니다.

Amazon이 9월 3일 표 형식 데이터용 기반 모델 Mitra-v2의 기술 보고서를 내고 가중치를 Apache-2.0으로 공개했습니다. 77M 파라미터로 TabArena·TALENT에서 1.6B TabFM과 통계적 동급이었습니다.

Google이 9월 3일 Gemini API에 Lyria 3.5를 공개 프리뷰로 올리고 9월 4일 Gemini 앱에 넣었습니다. 길이·보컬·가격·제한을 정리했습니다.

Runway가 9월 3일 공개한 GWM Worlds 2는 텍스트·카메라 입력에 반응해 720p 24fps 영상과 48kHz 오디오를 끝없이 생성하는 인터랙티브 월드 모델입니다. 전작과의 차이, 제어 방식, 한계를 정리했습니다.

OpenAI가 9월 3일 GPT-6 Astra 롤아웃을 시작했습니다. 컨텍스트 105만 토큰, 입력 $10·출력 $50, 사이버 'Critical'에 처음 닿은 모델의 사양과 안전 평가를 정리했습니다.

MBZUAI 산하 IFM이 9월 3일 K2 Horizon 패밀리를 Apache 2.0으로 공개했습니다. 375B MoE 플래그십의 벤치마크와 가중치·데이터·코드·체크포인트 공개 범위를 정리했습니다.

Google이 9월 2일 Gemini 3.8 Flash를 3.7과 같은 가격에 내놓고, 취약점 탐지·패치용 3.8 Flash Cyber는 Fairwind 프로그램으로 제한 공개했습니다. 수치와 조건을 정리했습니다.

Meta가 9월 2일 Muse Spark 1.3을 Muse Code와 Meta Model API에 올렸습니다. 1.2 대비 툴 호출 20%·토큰 25% 절감, 되묻는 행동 변화, 가격과 max 모드 쟁점을 정리했습니다.

Anthropic이 9월 1일 공개한 Fable 5.1은 입력·출력 가격은 그대로 두고 캐시 읽기를 $1.00에서 $0.25로 내렸습니다. 벤치마크와 Mythos 접근 정책을 정리했습니다.

Google Research가 8월 31일 공개한 시계열 파운데이션 모델입니다. 공변량 포함 다변량 예측을 한 번의 순전파로 처리하고 세 벤치마크 1위를 주장하지만, 가중치는 비상업 라이선스입니다.

Google DeepMind가 7월 21일 워크호스 모델 Gemini 3.6 Flash와 3.5 Flash-Lite, 3.5 Flash Cyber를 함께 공개했습니다. 토큰 효율·코딩 정밀도·가격이 어떻게 바뀌었는지 공식 발표와 모델 카드 기준으로 정리했습니다.