본문으로 건너뛰기
ARCHIVE

모든 글

50편을 월별로 모았습니다. 카테고리로 좁혀 보세요.

2026년 09월 · 45

업계 동향· 2

네이버 AI 팩토리 1단계 200MW — 브룩필드 최대 90억 달러

네이버가 9월 4일 이해진 의장과 브룩필드 브루스 플랫 회장의 회동을 공개하며, 네이버·엔비디아 1GW급 AI 팩토리 1단계(200MW)에 브룩필드가 최대 90억 달러를 투입한다고 밝혔습니다.

  • #네이버
  • #NVIDIA
  • #AI 인프라
논문 한입· 2

프런티어 모델 22종, 화학 벤치마크 답을 '외워서' 냈다

독일 연구진이 LLM 22종을 분자 물성 회귀 벤치마크 12개에서 자릿수 단위로 검사해, 5개 데이터셋에서 모델 절반 이상이 공개된 값을 그대로 꺼내 쓴다는 것을 보였습니다. 방법과 한계를 정리했습니다.

  • #논문
  • #벤치마크
  • #평가
오픈소스· 2

Iris — 오픈 웨이트 검색 에이전트, BrowseComp 88.6%

AllSpark Research가 Qwen 기반으로 후속 학습한 오픈 웨이트 검색 에이전트 Iris-mini·Iris-pro를 공개했습니다. 벤치마크 점수와 그 조건(문맥 관리)을 함께 정리했습니다.

  • #오픈소스
  • #검색 에이전트
  • #Qwen
논문 한입· 2

모델을 바꾸면 에이전트 메모리가 깨진다 — 최대 13%p

LinkedIn 연구진이 에이전트 메모리 4가지 구조가 모델 교체를 얼마나 견디는지 통제 실험했습니다. 요약 노트는 최대 13.28%p 흔들렸고 고정 스키마 그래프는 거의 변하지 않았습니다.

  • #논문
  • #에이전트
  • #메모리
논문 한입· 2

CUA-Universe — CLI 섞은 9B, OSWorld 40.2%

상하이교통대·저장대 연구진이 데스크톱 앱 16종을 GUI+명령줄 혼합 환경으로 만들고 9B 모델을 학습해 OSWorld 성공률을 23.4%에서 40.2%로 올렸습니다. 방법과 수치를 정리했습니다.

  • #논문
  • #에이전트
  • #컴퓨터 사용
논문 한입· 2

KOPA-Bench — 한국 공공 API 2,318개로 에이전트 시험

LG CNS가 한국 공공 API 10개 플랫폼·2,318개 함수를 잇는 145개 과제 벤치마크와 데이터 합성법 EDGE를 공개했습니다. 9B 모델이 27B에 근접한 수치와 한계를 정리했습니다.

  • #논문
  • #에이전트
  • #벤치마크
활용·도구· 2

MaxKernel — 에이전트가 쓴 TPU 커널, 사람 대비 2.32배

Google이 Gemini 3.1 Pro 기반 멀티 에이전트로 TPU 커널을 자동 작성·최적화하는 MaxKernel 논문과 코드를 공개했습니다. JAXBench 50개 과제와 실제 모델 커널 결과를 정리했습니다.

  • #Google
  • #TPU
  • #코딩 에이전트
논문 한입· 2

τ^τ-Bench — 에이전트가 만든 상담봇, 합격률 23.9%

Sierra·Princeton 연구진이 코딩 에이전트에게 실제 업무 기록·API·예산을 주고 고객 상담 에이전트를 처음부터 만들게 한 벤치마크입니다. 최고 조합도 23.9%에 그친 이유를 정리했습니다.

  • #논문
  • #코딩 에이전트
  • #벤치마크
논문 한입· 3

검열 해제 오픈 모델 3,471개 — 재배포자 3곳이 52%

10a Labs가 Hugging Face와 GitHub를 훑어 안전장치를 벗긴 오픈웨이트 모델 생태계를 쟀습니다. 원본 3,471개, 재배포 8,164건, 앱 1,643개 중 25%가 명백히 악성이었습니다.

  • #논문
  • #오픈소스
  • #AI 보안
업계 동향· 3

최대 AI 데이터센터 전력, 10개월마다 2배 — 946MW

Epoch AI 9월 4일 데이터 인사이트입니다. 최대 AI 데이터센터의 IT 전력 기록은 2024년 중반 이후 10개월마다 2배가 됐고, 현재 기록은 xAI Colossus 2의 946MW입니다.

  • #데이터센터
  • #컴퓨트
  • #Epoch AI
활용·도구· 2

Copilot 모델 4종 폐기 — 논문 42%가 '은퇴 모델' 인용

GitHub이 9월 3일 Copilot에서 Gemini 3.5·3.6 Flash, Kimi K2.7 Code, Claude Opus 4.7을 10월 2일 폐기한다고 공지했습니다. 같은 주 논문은 생의학 연구 42%가 은퇴 모델을 인용했다고 짚었습니다.

  • #코딩 에이전트
  • #GitHub Copilot
  • #모델 폐기
활용·도구· 2

GPT-6 Astra, Copilot 정식 제공 — API 제어 3종

9월 4일 GitHub Copilot에 GPT-6 Astra가 정식 제공됐습니다. 대상 플랜·10개 표면·과금 조건과, 9월 3일 Responses API에 더해진 비동기 툴 호출·중간 조향·추론 강도 변경을 정리했습니다.

  • #OpenAI
  • #GPT-6
  • #GitHub Copilot
오픈소스· 2

Mitra-v2 — 77M 표 형식 모델이 1.6B TabFM과 동급

Amazon이 9월 3일 표 형식 데이터용 기반 모델 Mitra-v2의 기술 보고서를 내고 가중치를 Apache-2.0으로 공개했습니다. 77M 파라미터로 TabArena·TALENT에서 1.6B TabFM과 통계적 동급이었습니다.

  • #오픈소스
  • #Amazon
  • #표 형식 데이터
업계 동향· 3

OpenAI 내부 데이터 — 에이전트 노동이 사람의 3.1배

OpenAI가 9월 6일 공개한 내부 지표입니다. 연구자 중앙값이 하루 $600어치 추론을 쓰고, 에이전트 작업일이 사람 작업일의 3.1배에 이르렀습니다. 7월 침해 사고 뒤 GPU 재배정도 담았습니다.

  • #OpenAI
  • #코딩 에이전트
  • #AI 연구 자동화
활용·도구· 2

Funes — 코딩 에이전트 기억, 인수인계보다 8배 싸다

Hugging Face가 9월 3일 공개한 Funes는 Claude Code·Codex·pi·Hermes의 세션 기록을 로컬 데이터셋으로 색인해 에이전트가 다시 꺼내 쓰게 합니다. 구조와 벤치마크, 보안 한계를 정리했습니다.

  • #코딩 에이전트
  • #오픈소스
  • #Hugging Face
모델· 2

Lyria 3.5 공개 — 최대 3분 노래, 곡당 $0.08

Google이 9월 3일 Gemini API에 Lyria 3.5를 공개 프리뷰로 올리고 9월 4일 Gemini 앱에 넣었습니다. 길이·보컬·가격·제한을 정리했습니다.

  • #Google DeepMind
  • #Gemini
  • #모델 출시
업계 동향· 2

MCP 도구 70만 개 중 직업 과업과 맞는 건 2.6%

Cohere Labs가 9월 3일 공개한 ATE 데이터셋은 공개 MCP 서버 123,069곳의 도구 약 70만 개를 O*NET 직업 과업에 대조했습니다. 어느 직업에 에이전트가 쌓이고 있는지 수치로 정리했습니다.

  • #에이전트
  • #MCP
  • #노동시장
논문 한입· 2

NeoMME — 2.6억 파라미터로 3.75B급 문서 검색

H Company가 9월 3일 공개한 NeoMME는 비전 타워 없이 하나의 Transformer로 텍스트와 이미지 패치를 처리합니다. ViDoRe v3 점수, 처리량, 255배 압축 결과를 정리했습니다.

  • #논문
  • #오픈 모델
  • #멀티모달
논문 한입· 3

AI가 IOI 2026 최고 인간 점수를 넘었다 — 535.4점

NVIDIA 연구진의 Nemotron-3-Ultra-CC가 IOI 2026 문제를 인간과 같은 제한 아래 풀어 535.4/600점을 받았습니다. 최고 인간 점수 498.27을 넘겼다는 주장과 한계를 정리했습니다.

  • #논문
  • #코딩 에이전트
  • #벤치마크
활용·도구· 2

RTX Spark — 128GB 로컬 AI PC와 PAIR 라우터

NVIDIA가 IFA 2026에서 1페타플롭 GPU와 128GB 통합 메모리의 RTX Spark PC를 10월 출시한다고 밝혔습니다. 집 안 PC를 묶어 추론을 나누는 무료 도구 PAIR도 정리했습니다.

  • #NVIDIA
  • #로컬 AI
  • #하드웨어
모델· 2

Runway GWM Worlds 2 — 소리 나는 실시간 월드 모델

Runway가 9월 3일 공개한 GWM Worlds 2는 텍스트·카메라 입력에 반응해 720p 24fps 영상과 48kHz 오디오를 끝없이 생성하는 인터랙티브 월드 모델입니다. 전작과의 차이, 제어 방식, 한계를 정리했습니다.

  • #Runway
  • #월드 모델
  • #영상 생성
업계 동향· 3

Vals 보고서 — 에이전트 작업 전력, 모델 따라 최대 75배

벤치마크 기관 Vals AI가 9월 3일 오픈 웨이트 모델 16종의 에이전트 작업 전력·탄소·물 사용량을 추정한 보고서를 냈습니다. 같은 벤치마크를 완주하는 데 드는 전력이 모델에 따라 수십 배 차이 났다는 내용입니다.

  • #환경
  • #추론 비용
  • #벤치마크
모델· 4

GPT-6 Astra 출시 — 사이버 'Critical' 첫 공개 모델

OpenAI가 9월 3일 GPT-6 Astra 롤아웃을 시작했습니다. 컨텍스트 105만 토큰, 입력 $10·출력 $50, 사이버 'Critical'에 처음 닿은 모델의 사양과 안전 평가를 정리했습니다.

  • #OpenAI
  • #GPT-6
  • #모델 출시
활용·도구· 3

Grok Bot 엔터프라이즈 출시 — 봇마다 클라우드 컴퓨터

9월 3일 공개된 Grok Bot for Enterprise는 업무를 통째로 위임받는 'AI 팀원'입니다. 봇마다 전용 클라우드 컴퓨터, 루틴, 접근·네트워크·감사 제어를 공식 문서 기준으로 정리했습니다.

  • #Grok
  • #Cursor
  • #AI 에이전트
오픈소스· 3

K2 Horizon — 0.9B부터 375B까지 '완전 개방' 모델

MBZUAI 산하 IFM이 9월 3일 K2 Horizon 패밀리를 Apache 2.0으로 공개했습니다. 375B MoE 플래그십의 벤치마크와 가중치·데이터·코드·체크포인트 공개 범위를 정리했습니다.

  • #오픈소스
  • #IFM
  • #K2 Horizon
업계 동향· 2

NVIDIA, Hugging Face 129억 달러 인수 — 개방 유지

NVIDIA가 9월 3일 Hugging Face를 $12,930,300,000에 인수한다고 발표했습니다. 거래 배경(7월 침해 사건·거절했던 제안)과 '개방 플랫폼 유지' 약속을 정리했습니다.

  • #NVIDIA
  • #Hugging Face
  • #인수합병
논문 한입· 2

WeatherNext 3 — 5km 해상도, 매시간 15일 예보

Google DeepMind가 9월 3일 공개한 WeatherNext 3는 위성 관측을 직접 입력받아 5km·매시간 예보를 냅니다. 5배 선명해진 해상도와 강수 정확도 개선 폭을 발표·논문 기준으로 정리했습니다.

  • #Google DeepMind
  • #WeatherNext
  • #기상 예보
논문 한입· 2

온폴리시 증류는 정말 '증류'일까 — 교사 없이 오른 점수

Purdue 연구진이 온폴리시 증류(OPD)의 교사 신호에 큰 노이즈가 섞여 있고, 교사 없이 낮은 확률 토큰만 눌러도 비슷하게 오른다는 것을 보였습니다. Qwen3-1.7B의 AIME24가 13.4점에서 48.9점이 됐습니다.

  • #논문
  • #지식 증류
  • #강화학습
업계 동향· 3

G20 '캐롤라이나 원칙' 채택 — 같은 주 EU는 30여 곳 질의

9월 2일 G20 혁신장관회의가 '기존 규정 우선, 새 규제는 새로운 쟁점에만'이라는 캐롤라이나 원칙에 합의했고, EU AI Office는 30여 개 AI 기업에 첫 정보 요청을 보냈습니다. 두 흐름을 비교합니다.

  • #규제
  • #정책
  • #G20
모델· 3

Gemini 3.8 Flash 출시 — 같은 값, 추론·보안 강화

Google이 9월 2일 Gemini 3.8 Flash를 3.7과 같은 가격에 내놓고, 취약점 탐지·패치용 3.8 Flash Cyber는 Fairwind 프로그램으로 제한 공개했습니다. 수치와 조건을 정리했습니다.

  • #Gemini
  • #Google DeepMind
  • #모델 출시
활용·도구· 2

Gemini 에이전틱 비디오 이해 — 토큰 88% 절감의 조건

Google이 9월 1일 Gemini API에 '에이전틱' 비디오 처리 모드를 넣었습니다. 1초 1프레임 대신 필요한 구간만 골라 읽어 긴 영상에서 토큰 최대 88%, 비용 최대 66%를 줄인다는 주장의 조건을 정리했습니다.

  • #Gemini
  • #비디오 이해
  • #API
모델· 3

Meta Muse Spark 1.3 — 툴 호출 20% 적은 에이전트

Meta가 9월 2일 Muse Spark 1.3을 Muse Code와 Meta Model API에 올렸습니다. 1.2 대비 툴 호출 20%·토큰 25% 절감, 되묻는 행동 변화, 가격과 max 모드 쟁점을 정리했습니다.

  • #Meta
  • #Muse Spark
  • #모델 출시
모델· 4

Claude Fable 5.1·Mythos 5.1 — 캐시 75% 인하

Anthropic이 9월 1일 공개한 Fable 5.1은 입력·출력 가격은 그대로 두고 캐시 읽기를 $1.00에서 $0.25로 내렸습니다. 벤치마크와 Mythos 접근 정책을 정리했습니다.

  • #Anthropic
  • #Claude
  • #모델 출시
업계 동향· 3

EU, ChatGPT를 '초대형 검색엔진'으로 지정 — DSA 의무

유럽집행위가 8월 31일 ChatGPT를 DSA상 초대형 온라인 검색엔진(VLOSE)으로 지정했습니다. EU 월평균 1억 5,910만 명, 4개월 안의 시스템 리스크 평가 의무를 정리했습니다.

  • #규제
  • #정책
  • #유럽
모델· 3

TimesFM-3 공개 — 3.3억 파라미터 다변량 예측 모델

Google Research가 8월 31일 공개한 시계열 파운데이션 모델입니다. 공변량 포함 다변량 예측을 한 번의 순전파로 처리하고 세 벤치마크 1위를 주장하지만, 가중치는 비상업 라이선스입니다.

  • #Google
  • #시계열
  • #오픈 모델

2026년 08월 · 3

활용·도구· 5

Claude Code /design — 터미널에서 UI 시안까지

Anthropic이 8월 셋째 주 Claude Code에 /design 스킬을 리서치 프리뷰로 넣었습니다. 한 줄 브리프로 편집 가능한 아트보드 여러 장을 받아 고른 뒤 바로 구현시키는 흐름을, 요구 조건과 한계까지 실무자 관점에서 정리했습니다.

  • #Claude Code
  • #코딩 에이전트
  • #디자인 도구
논문 한입· 4

암호화된 '생각'이 새어 나왔다 — 추론 흔적 탈취 논문

Anthropic·OpenAI·Google이 API로 돌려주는 암호화 추론 블록이 세션·사용자·모델을 가리지 않고 재생됐습니다. 약한 모델에 넣어 평문으로 받아 적게 한 논문의 주장·방법·한계를 정리합니다.

  • #AI 보안
  • #추론 모델
  • #프라이버시
업계 동향· 4

EU AI Act, 8월 2일 본격 적용 — 미뤄진 것과 남은 것

2026년 8월 2일 EU AI Act 대부분의 조항이 적용되기 시작했습니다. 다만 7월 27일 발효된 AI 옴니버스가 고위험 규정을 최대 2년 미뤘습니다. 공식 문서 기준으로 무엇이 지금 적용되고 무엇이 미뤄졌는지 정리합니다.

  • #EU AI Act
  • #규제
  • #정책

2026년 07월 · 1

모델· 5

Gemini 3.6 Flash 출시 — 무엇이 달라졌나

Google DeepMind가 7월 21일 워크호스 모델 Gemini 3.6 Flash와 3.5 Flash-Lite, 3.5 Flash Cyber를 함께 공개했습니다. 토큰 효율·코딩 정밀도·가격이 어떻게 바뀌었는지 공식 발표와 모델 카드 기준으로 정리했습니다.

  • #Gemini
  • #Google DeepMind
  • #모델 출시

2026년 06월 · 1

ANTHROPIC 뉴스· 6

Claude Fable 5 & Mythos 5 — 한눈에 정리

Anthropic이 가장 강력한 차세대 모델을 공개했습니다. 같은 두뇌, 두 개의 얼굴 — 안전장치를 입힌 범용 모델 Fable 5와, 그 안전장치를 벗긴 연구 전용 Mythos 5. 무엇이 달라졌는지 빠르게 훑어보세요.

  • #모델 비교
  • #출시
  • #성능