
프런티어 모델 22종, 화학 벤치마크 답을 '외워서' 냈다
독일 연구진이 LLM 22종을 분자 물성 회귀 벤치마크 12개에서 자릿수 단위로 검사해, 5개 데이터셋에서 모델 절반 이상이 공개된 값을 그대로 꺼내 쓴다는 것을 보였습니다. 방법과 한계를 정리했습니다.
- #논문
- #벤치마크
- #평가
10편

독일 연구진이 LLM 22종을 분자 물성 회귀 벤치마크 12개에서 자릿수 단위로 검사해, 5개 데이터셋에서 모델 절반 이상이 공개된 값을 그대로 꺼내 쓴다는 것을 보였습니다. 방법과 한계를 정리했습니다.

AllSpark Research가 Qwen 기반으로 후속 학습한 오픈 웨이트 검색 에이전트 Iris-mini·Iris-pro를 공개했습니다. 벤치마크 점수와 그 조건(문맥 관리)을 함께 정리했습니다.

상하이교통대·저장대 연구진이 데스크톱 앱 16종을 GUI+명령줄 혼합 환경으로 만들고 9B 모델을 학습해 OSWorld 성공률을 23.4%에서 40.2%로 올렸습니다. 방법과 수치를 정리했습니다.

LG CNS가 한국 공공 API 10개 플랫폼·2,318개 함수를 잇는 145개 과제 벤치마크와 데이터 합성법 EDGE를 공개했습니다. 9B 모델이 27B에 근접한 수치와 한계를 정리했습니다.

Sierra·Princeton 연구진이 코딩 에이전트에게 실제 업무 기록·API·예산을 주고 고객 상담 에이전트를 처음부터 만들게 한 벤치마크입니다. 최고 조합도 23.9%에 그친 이유를 정리했습니다.

옥스퍼드 연구자가 9월 4일 arXiv에 올린 논문입니다. 모델 20개에 12,800회 전쟁 개시 판단을 시킨 뒤 '정렬 테스트 중' 한 문장을 넣자 점수도, 판단 기준도 달라졌습니다.

NVIDIA 연구진의 Nemotron-3-Ultra-CC가 IOI 2026 문제를 인간과 같은 제한 아래 풀어 535.4/600점을 받았습니다. 최고 인간 점수 498.27을 넘겼다는 주장과 한계를 정리했습니다.

벤치마크 기관 Vals AI가 9월 3일 오픈 웨이트 모델 16종의 에이전트 작업 전력·탄소·물 사용량을 추정한 보고서를 냈습니다. 같은 벤치마크를 완주하는 데 드는 전력이 모델에 따라 수십 배 차이 났다는 내용입니다.

Anthropic이 9월 1일 공개한 Fable 5.1은 입력·출력 가격은 그대로 두고 캐시 읽기를 $1.00에서 $0.25로 내렸습니다. 벤치마크와 Mythos 접근 정책을 정리했습니다.

Google DeepMind가 7월 21일 워크호스 모델 Gemini 3.6 Flash와 3.5 Flash-Lite, 3.5 Flash Cyber를 함께 공개했습니다. 토큰 효율·코딩 정밀도·가격이 어떻게 바뀌었는지 공식 발표와 모델 카드 기준으로 정리했습니다.