본문으로 건너뛰기

프런티어 모델 22종, 화학 벤치마크 답을 '외워서' 냈다

독일 연구진이 LLM 22종을 분자 물성 회귀 벤치마크 12개에서 자릿수 단위로 검사해, 5개 데이터셋에서 모델 절반 이상이 공개된 값을 그대로 꺼내 쓴다는 것을 보였습니다. 방법과 한계를 정리했습니다.

AI피셜 편집부· 2분 읽기원문 보기 ↗
분석화학 실험실 작업대에 놓인 지시약 플라스크와 색이 든 비커
사진: ElNokko · CC BY-SA 4.0

핵심 답변

함부르크공대·Helmholtz-Zentrum Hereon·DFKI·자를란트대 연구진이 9월 4일 arXiv에 올린 논문은 프런티어 LLM 22종을 FreeSolv·ESOL·Lipophilicity 등 분자 물성 회귀 벤치마크 12개에서 검사해, 모델의 예측값이 공개된 정답과 유효숫자 세 자리까지 일치하는 비율을 분자 정보 없이 맞출 확률과 비교했습니다. FreeSolv·ESOL·LD50·AqSolDB·끓는점 5개 데이터셋에서는 모델 절반 이상이 이런 '축어적 검색'을 보였고, 추론 예산을 높이면 검색이 89% 더 자주 나타났습니다.

TL;DR세 줄 요약

  • 검사 대상은 Claude Opus 5·Sonnet 5, GPT-5.6 terra·luna·sol, Gemini 3.6 Flash·3.1 Pro, Grok 4.5, Kimi K3, Qwen3-235B, Llama 4 Maverick 등 22종입니다.
  • 예측이 공개값과 유효숫자 1·2·3자리까지 맞는 비율을, 분자를 모른 채 라벨 분포만으로 맞출 '바닥'과 비교해 검색을 판정합니다.
  • 5개 데이터셋에서 모델의 50% 넘게 축어적 검색이 나타났고, 다른 데이터셋의 오염은 산발적이었습니다.
  • SMILES 문자를 바꿔 분자 정체를 가리면 대부분 셀에서 세 자리 일치가 2% 아래로 떨어졌지만, 세 셀은 변형된 SMILES와 원래 라벨의 조합을 여전히 알아봤습니다.

핵심 사실

arXiv 등록
2026-09-04arXiv:2609.05381
소속
함부르크공대, Helmholtz-Zentrum Hereon, DFKI, 자를란트대
모델 수
22종Claude·GPT·Gemini·Grok·Kimi·Qwen·Llama·Mistral·MiniMax
벤치마크
12개FreeSolv, ESOL, LD50, Lipophilicity, AqSolDB, Caco-2, BACE, PPBR, QM7, QM8 + 대조군 2개
오염 집중
5개 데이터셋모델 50% 초과가 축어적 검색
추론 효과
+89%높은 추론 수준에서 검색 판정 빈도

무슨 문제인가요

LLM이 분자의 용해도나 독성을 "예측"했을 때, 그것이 화학을 이해한 결과인지 훈련 데이터에 있던 정답을 꺼낸 것인지 구분하기 어렵습니다. 함부르크공대, Helmholtz-Zentrum Hereon, DFKI, 자를란트대 연구진 7명이 9월 4일 arXiv에 올린 논문은 이 구분을 자릿수 단위로 시도했습니다. 논문 대상은 Claude Opus 5·Sonnet 5·Haiku 4.5, GPT-5.6 terra·luna·sol, GPT-5.5, Gemini 3.6 Flash·3.1 Pro, Grok 4.5, Kimi K3, Qwen3-235B, Llama 4 Maverick, Mistral Large 2512, MiniMax M3 등 22종이고, 벤치마크는 FreeSolv, ESOL, LD50, Lipophilicity, AqSolDB, Caco-2, BACE, PPBR, QM7, QM8에 최신성 대조군(항바이러스)과 양성 대조군(끓는점)을 더한 12개입니다. 논문

원소별로 색이 다른 플라스틱 구슬과 결합 막대가 칸칸이 담긴 분자 모형 세트
논문이 다룬 값은 용해도·친유성·독성처럼 분자 구조에서 나오는 물성입니다. 사진은 유기화학 수업용 분자 모형 세트입니다.· 사진: Bin im Garten · CC BY-SA 3.0
자릿수 검사 절차
  1. 예측 수집

    22개 모델 × 12개 벤치마크

  2. 유효숫자 비교

    정답과 1·2·3자리까지 일치하는 비율

  3. 바닥선 계산

    분자를 모른 채 라벨 분포만으로 맞출 확률

  4. 검색 판정

    바닥을 크게 넘기면 기억으로 판단

  5. 교란 실험

    SMILES 문자 치환, 추론 예산 변경

결과: 오염은 넓지만 고르지 않습니다

FreeSolv, ESOL, LD50, AqSolDB, 끓는점 5개 데이터셋에서는 모델의 50% 넘게 축어적 검색이 나타났고, 나머지 데이터셋의 오염은 산발적이었습니다. 논문 같은 분자와 프롬프트로 추론 토큰 예산만 바꾸자 높은 추론 수준에서 검색 판정이 89% 더 자주 나왔습니다. 논문 분자 정체를 가리기 위해 SMILES 문자열의 문자를 치환하면 한 셀을 빼고 모두에서 검색이 줄었고 대부분 세 자리 일치가 2% 아래로 떨어졌지만, 세 셀은 변형된 SMILES와 원래 라벨의 조합을 여전히 알아봤습니다. 논문 검색을 억제하면 모델 간 비교 순위는 바뀌지만 기저 예측 능력의 차이는 남았다는 것이 저자들의 정리입니다. 논문

구분데이터셋결과
검색 집중FreeSolv, ESOL, LD50, AqSolDB, 끓는점모델 50% 초과가 축어적 검색
산발적Lipophilicity, Caco-2, BACE, PPBR, QM7, QM8 등일부 모델·셀에서만 검색
최신성 대조군항바이러스훈련 이후 데이터로 검색 여부 대조

무엇을 보면 되나요

  • 과학 AI 평가자: "검색을 통제하지 않는 평가는 예측과 회상을 구분할 수 없다"는 것이 결론입니다. 오래된 공개 벤치마크의 점수는 자릿수 검사를 거친 뒤 읽어야 합니다. 논문
  • 추론 모델 사용자: 추론 예산을 올렸을 때 오르는 점수의 일부는 회상일 수 있습니다. 새 분자에 대한 성능은 별도로 확인하시길 권합니다. 추정
  • 재현: 코드, 셀별 결과, 프롬프트, 작업 기록 전체가 GitHub에 공개돼 있습니다. 논문

자주 묻는 질문

'축어적 검색'이 정확히 무엇인가요?
논문은 '공개된 숫자를 모델의 가중치에서 복원할 수 있을 때' 검색이 일어났다고 정의합니다. 모델의 예측값이 정답과 유효숫자 한 자리, 두 자리, 세 자리까지 살아남는 비율을 재고, 이를 분자 정보 없이 라벨 분포만으로 우연히 맞출 확률과 비교합니다. 세 자리까지 우연을 크게 넘겨 맞추면 예측이 아니라 기억으로 봅니다.
추론을 많이 시키면 왜 더 외운 값을 내나요?
같은 분자와 프롬프트로 추론 토큰 예산만 바꾼 통제 실험에서, 높은 추론 수준일 때 검색 판정이 89% 더 자주 나왔습니다. 논문은 이 현상을 보고했을 뿐 원인을 단정하지는 않았습니다. 추론 모드의 벤치마크 점수 상승 일부가 회상일 수 있다는 뜻입니다.
그러면 이 벤치마크들은 못 쓰나요?
논문의 결론은 '검색을 통제하지 않는 평가는 예측과 회상을 구분할 수 없다'는 것이지, 벤치마크를 버리라는 것은 아닙니다. 검색을 억제하면 모델 순위는 바뀌지만 기저 예측 능력의 차이는 남았습니다. 코드와 셀별 결과, 프롬프트는 GitHub에 공개돼 있습니다.

출처 · 3

  1. 1Molecular Déjà Vu: Digit-Level Retrieval of Published Values in Frontier Language Models (arXiv:2609.05381)논문arxiv.org/abs/2609.05381
  2. 2논문 전문 HTML (arXiv)논문arxiv.org/html/2609.05381
  3. 3코드·결과 저장소 MolecularDejaVu (GitHub)참고github.com/MatthiasHBusch/MolecularDejaVu

이 글의 마크다운 원문: /posts/molecular-deja-vu-benchmark-retrieval/md/ · 인용 시 출처를 “AI피셜”으로 표기해 주세요.

이 글이 도움이 됐다면 동료에게 보내 주세요.

AI피셜 새 글 알림

새 글이 올라오면 메일로 알려드려요

매일 5편, 5분 브리프. 스팸 없이 새 글 소식만. 언제든 한 번에 해지.

같은 태그·카테고리의 글을 골랐습니다.

논문 한입· 2

모델을 바꾸면 에이전트 메모리가 깨진다 — 최대 13%p

LinkedIn 연구진이 에이전트 메모리 4가지 구조가 모델 교체를 얼마나 견디는지 통제 실험했습니다. 요약 노트는 최대 13.28%p 흔들렸고 고정 스키마 그래프는 거의 변하지 않았습니다.

  • #논문
  • #에이전트
  • #메모리
논문 한입· 2

CUA-Universe — CLI 섞은 9B, OSWorld 40.2%

상하이교통대·저장대 연구진이 데스크톱 앱 16종을 GUI+명령줄 혼합 환경으로 만들고 9B 모델을 학습해 OSWorld 성공률을 23.4%에서 40.2%로 올렸습니다. 방법과 수치를 정리했습니다.

  • #논문
  • #에이전트
  • #컴퓨터 사용