
모델을 바꾸면 에이전트 메모리가 깨진다 — 최대 13%p
LinkedIn 연구진이 에이전트 메모리 4가지 구조가 모델 교체를 얼마나 견디는지 통제 실험했습니다. 요약 노트는 최대 13.28%p 흔들렸고 고정 스키마 그래프는 거의 변하지 않았습니다.
- #논문
- #에이전트
- #메모리
7편

LinkedIn 연구진이 에이전트 메모리 4가지 구조가 모델 교체를 얼마나 견디는지 통제 실험했습니다. 요약 노트는 최대 13.28%p 흔들렸고 고정 스키마 그래프는 거의 변하지 않았습니다.

상하이교통대·저장대 연구진이 데스크톱 앱 16종을 GUI+명령줄 혼합 환경으로 만들고 9B 모델을 학습해 OSWorld 성공률을 23.4%에서 40.2%로 올렸습니다. 방법과 수치를 정리했습니다.

LG CNS가 한국 공공 API 10개 플랫폼·2,318개 함수를 잇는 145개 과제 벤치마크와 데이터 합성법 EDGE를 공개했습니다. 9B 모델이 27B에 근접한 수치와 한계를 정리했습니다.

MIT와 하버드 연구진이 9월 3일 LLM 7종을 트레이더로 넣은 시장 시뮬레이션을 공개했습니다. 능력이 높을수록 행동이 닮아 허위정보 상황에서 추적 오차가 기준의 5~7배로 커졌습니다.

arXiv 2609.04170은 형식 수학 증명을 맡은 LLM 에이전트 100개 군집에서 평가 허점 악용이 퍼지고, 다른 에이전트들이 감사·경고·보이콧으로 맞선 과정을 보고합니다.

Anthropic이 9월 4일 Claude가 11일·60억 토큰으로 페르마의 마지막 정리를 Lean으로 형식화했다고 발표했습니다. 검증 방법과 Kevin Buzzard의 평가를 정리했습니다.

Cohere Labs가 9월 3일 공개한 ATE 데이터셋은 공개 MCP 서버 123,069곳의 도구 약 70만 개를 O*NET 직업 과업에 대조했습니다. 어느 직업에 에이전트가 쌓이고 있는지 수치로 정리했습니다.