본문으로 건너뛰기
ARCHIVE

모든 글

50편을 모았습니다. 검색하거나 카테고리로 좁혀 보세요.

16편을 찾았습니다.

2026년 09월 · 15

논문 한입· 2

프런티어 모델 22종, 화학 벤치마크 답을 '외워서' 냈다

독일 연구진이 LLM 22종을 분자 물성 회귀 벤치마크 12개에서 자릿수 단위로 검사해, 5개 데이터셋에서 모델 절반 이상이 공개된 값을 그대로 꺼내 쓴다는 것을 보였습니다. 방법과 한계를 정리했습니다.

  • #논문
  • #벤치마크
  • #평가
논문 한입· 2

모델을 바꾸면 에이전트 메모리가 깨진다 — 최대 13%p

LinkedIn 연구진이 에이전트 메모리 4가지 구조가 모델 교체를 얼마나 견디는지 통제 실험했습니다. 요약 노트는 최대 13.28%p 흔들렸고 고정 스키마 그래프는 거의 변하지 않았습니다.

  • #논문
  • #에이전트
  • #메모리
논문 한입· 2

CUA-Universe — CLI 섞은 9B, OSWorld 40.2%

상하이교통대·저장대 연구진이 데스크톱 앱 16종을 GUI+명령줄 혼합 환경으로 만들고 9B 모델을 학습해 OSWorld 성공률을 23.4%에서 40.2%로 올렸습니다. 방법과 수치를 정리했습니다.

  • #논문
  • #에이전트
  • #컴퓨터 사용
논문 한입· 2

KOPA-Bench — 한국 공공 API 2,318개로 에이전트 시험

LG CNS가 한국 공공 API 10개 플랫폼·2,318개 함수를 잇는 145개 과제 벤치마크와 데이터 합성법 EDGE를 공개했습니다. 9B 모델이 27B에 근접한 수치와 한계를 정리했습니다.

  • #논문
  • #에이전트
  • #벤치마크
논문 한입· 2

τ^τ-Bench — 에이전트가 만든 상담봇, 합격률 23.9%

Sierra·Princeton 연구진이 코딩 에이전트에게 실제 업무 기록·API·예산을 주고 고객 상담 에이전트를 처음부터 만들게 한 벤치마크입니다. 최고 조합도 23.9%에 그친 이유를 정리했습니다.

  • #논문
  • #코딩 에이전트
  • #벤치마크
논문 한입· 3

검열 해제 오픈 모델 3,471개 — 재배포자 3곳이 52%

10a Labs가 Hugging Face와 GitHub를 훑어 안전장치를 벗긴 오픈웨이트 모델 생태계를 쟀습니다. 원본 3,471개, 재배포 8,164건, 앱 1,643개 중 25%가 명백히 악성이었습니다.

  • #논문
  • #오픈소스
  • #AI 보안
논문 한입· 2

NeoMME — 2.6억 파라미터로 3.75B급 문서 검색

H Company가 9월 3일 공개한 NeoMME는 비전 타워 없이 하나의 Transformer로 텍스트와 이미지 패치를 처리합니다. ViDoRe v3 점수, 처리량, 255배 압축 결과를 정리했습니다.

  • #논문
  • #오픈 모델
  • #멀티모달
논문 한입· 3

AI가 IOI 2026 최고 인간 점수를 넘었다 — 535.4점

NVIDIA 연구진의 Nemotron-3-Ultra-CC가 IOI 2026 문제를 인간과 같은 제한 아래 풀어 535.4/600점을 받았습니다. 최고 인간 점수 498.27을 넘겼다는 주장과 한계를 정리했습니다.

  • #논문
  • #코딩 에이전트
  • #벤치마크
논문 한입· 2

WeatherNext 3 — 5km 해상도, 매시간 15일 예보

Google DeepMind가 9월 3일 공개한 WeatherNext 3는 위성 관측을 직접 입력받아 5km·매시간 예보를 냅니다. 5배 선명해진 해상도와 강수 정확도 개선 폭을 발표·논문 기준으로 정리했습니다.

  • #Google DeepMind
  • #WeatherNext
  • #기상 예보
논문 한입· 2

온폴리시 증류는 정말 '증류'일까 — 교사 없이 오른 점수

Purdue 연구진이 온폴리시 증류(OPD)의 교사 신호에 큰 노이즈가 섞여 있고, 교사 없이 낮은 확률 토큰만 눌러도 비슷하게 오른다는 것을 보였습니다. Qwen3-1.7B의 AIME24가 13.4점에서 48.9점이 됐습니다.

  • #논문
  • #지식 증류
  • #강화학습

2026년 08월 · 1

논문 한입· 4

암호화된 '생각'이 새어 나왔다 — 추론 흔적 탈취 논문

Anthropic·OpenAI·Google이 API로 돌려주는 암호화 추론 블록이 세션·사용자·모델을 가리지 않고 재생됐습니다. 약한 모델에 넣어 평문으로 받아 적게 한 논문의 주장·방법·한계를 정리합니다.

  • #AI 보안
  • #추론 모델
  • #프라이버시