본문으로 건너뛰기
TAG

#벤치마크

10

논문 한입· 2

프런티어 모델 22종, 화학 벤치마크 답을 '외워서' 냈다

독일 연구진이 LLM 22종을 분자 물성 회귀 벤치마크 12개에서 자릿수 단위로 검사해, 5개 데이터셋에서 모델 절반 이상이 공개된 값을 그대로 꺼내 쓴다는 것을 보였습니다. 방법과 한계를 정리했습니다.

  • #논문
  • #벤치마크
  • #평가
오픈소스· 2

Iris — 오픈 웨이트 검색 에이전트, BrowseComp 88.6%

AllSpark Research가 Qwen 기반으로 후속 학습한 오픈 웨이트 검색 에이전트 Iris-mini·Iris-pro를 공개했습니다. 벤치마크 점수와 그 조건(문맥 관리)을 함께 정리했습니다.

  • #오픈소스
  • #검색 에이전트
  • #Qwen
논문 한입· 2

CUA-Universe — CLI 섞은 9B, OSWorld 40.2%

상하이교통대·저장대 연구진이 데스크톱 앱 16종을 GUI+명령줄 혼합 환경으로 만들고 9B 모델을 학습해 OSWorld 성공률을 23.4%에서 40.2%로 올렸습니다. 방법과 수치를 정리했습니다.

  • #논문
  • #에이전트
  • #컴퓨터 사용
논문 한입· 2

KOPA-Bench — 한국 공공 API 2,318개로 에이전트 시험

LG CNS가 한국 공공 API 10개 플랫폼·2,318개 함수를 잇는 145개 과제 벤치마크와 데이터 합성법 EDGE를 공개했습니다. 9B 모델이 27B에 근접한 수치와 한계를 정리했습니다.

  • #논문
  • #에이전트
  • #벤치마크
논문 한입· 2

τ^τ-Bench — 에이전트가 만든 상담봇, 합격률 23.9%

Sierra·Princeton 연구진이 코딩 에이전트에게 실제 업무 기록·API·예산을 주고 고객 상담 에이전트를 처음부터 만들게 한 벤치마크입니다. 최고 조합도 23.9%에 그친 이유를 정리했습니다.

  • #논문
  • #코딩 에이전트
  • #벤치마크
논문 한입· 3

AI가 IOI 2026 최고 인간 점수를 넘었다 — 535.4점

NVIDIA 연구진의 Nemotron-3-Ultra-CC가 IOI 2026 문제를 인간과 같은 제한 아래 풀어 535.4/600점을 받았습니다. 최고 인간 점수 498.27을 넘겼다는 주장과 한계를 정리했습니다.

  • #논문
  • #코딩 에이전트
  • #벤치마크
업계 동향· 3

Vals 보고서 — 에이전트 작업 전력, 모델 따라 최대 75배

벤치마크 기관 Vals AI가 9월 3일 오픈 웨이트 모델 16종의 에이전트 작업 전력·탄소·물 사용량을 추정한 보고서를 냈습니다. 같은 벤치마크를 완주하는 데 드는 전력이 모델에 따라 수십 배 차이 났다는 내용입니다.

  • #환경
  • #추론 비용
  • #벤치마크
모델· 4

Claude Fable 5.1·Mythos 5.1 — 캐시 75% 인하

Anthropic이 9월 1일 공개한 Fable 5.1은 입력·출력 가격은 그대로 두고 캐시 읽기를 $1.00에서 $0.25로 내렸습니다. 벤치마크와 Mythos 접근 정책을 정리했습니다.

  • #Anthropic
  • #Claude
  • #모델 출시
모델· 5

Gemini 3.6 Flash 출시 — 무엇이 달라졌나

Google DeepMind가 7월 21일 워크호스 모델 Gemini 3.6 Flash와 3.5 Flash-Lite, 3.5 Flash Cyber를 함께 공개했습니다. 토큰 효율·코딩 정밀도·가격이 어떻게 바뀌었는지 공식 발표와 모델 카드 기준으로 정리했습니다.

  • #Gemini
  • #Google DeepMind
  • #모델 출시