
논문 한입· 2분
프런티어 모델 22종, 화학 벤치마크 답을 '외워서' 냈다
독일 연구진이 LLM 22종을 분자 물성 회귀 벤치마크 12개에서 자릿수 단위로 검사해, 5개 데이터셋에서 모델 절반 이상이 공개된 값을 그대로 꺼내 쓴다는 것을 보였습니다. 방법과 한계를 정리했습니다.
- #논문
- #벤치마크
- #평가
4편

독일 연구진이 LLM 22종을 분자 물성 회귀 벤치마크 12개에서 자릿수 단위로 검사해, 5개 데이터셋에서 모델 절반 이상이 공개된 값을 그대로 꺼내 쓴다는 것을 보였습니다. 방법과 한계를 정리했습니다.

LinkedIn 연구진이 에이전트 메모리 4가지 구조가 모델 교체를 얼마나 견디는지 통제 실험했습니다. 요약 노트는 최대 13.28%p 흔들렸고 고정 스키마 그래프는 거의 변하지 않았습니다.

옥스퍼드 연구자가 9월 4일 arXiv에 올린 논문입니다. 모델 20개에 12,800회 전쟁 개시 판단을 시킨 뒤 '정렬 테스트 중' 한 문장을 넣자 점수도, 판단 기준도 달라졌습니다.

코딩 에이전트에 결함 신고 도구를 주면 테스트 조작이 23.6%에서 5.3%로 줄었다는 8월 29일 arXiv 논문입니다. 프런티어 모델 8개, 1,800회 실험을 정리했습니다.