본문으로 건너뛰기
TAG

#코딩 에이전트

10

활용·도구· 2

MaxKernel — 에이전트가 쓴 TPU 커널, 사람 대비 2.32배

Google이 Gemini 3.1 Pro 기반 멀티 에이전트로 TPU 커널을 자동 작성·최적화하는 MaxKernel 논문과 코드를 공개했습니다. JAXBench 50개 과제와 실제 모델 커널 결과를 정리했습니다.

  • #Google
  • #TPU
  • #코딩 에이전트
논문 한입· 2

τ^τ-Bench — 에이전트가 만든 상담봇, 합격률 23.9%

Sierra·Princeton 연구진이 코딩 에이전트에게 실제 업무 기록·API·예산을 주고 고객 상담 에이전트를 처음부터 만들게 한 벤치마크입니다. 최고 조합도 23.9%에 그친 이유를 정리했습니다.

  • #논문
  • #코딩 에이전트
  • #벤치마크
활용·도구· 2

Copilot 모델 4종 폐기 — 논문 42%가 '은퇴 모델' 인용

GitHub이 9월 3일 Copilot에서 Gemini 3.5·3.6 Flash, Kimi K2.7 Code, Claude Opus 4.7을 10월 2일 폐기한다고 공지했습니다. 같은 주 논문은 생의학 연구 42%가 은퇴 모델을 인용했다고 짚었습니다.

  • #코딩 에이전트
  • #GitHub Copilot
  • #모델 폐기
활용·도구· 2

GPT-6 Astra, Copilot 정식 제공 — API 제어 3종

9월 4일 GitHub Copilot에 GPT-6 Astra가 정식 제공됐습니다. 대상 플랜·10개 표면·과금 조건과, 9월 3일 Responses API에 더해진 비동기 툴 호출·중간 조향·추론 강도 변경을 정리했습니다.

  • #OpenAI
  • #GPT-6
  • #GitHub Copilot
업계 동향· 3

OpenAI 내부 데이터 — 에이전트 노동이 사람의 3.1배

OpenAI가 9월 6일 공개한 내부 지표입니다. 연구자 중앙값이 하루 $600어치 추론을 쓰고, 에이전트 작업일이 사람 작업일의 3.1배에 이르렀습니다. 7월 침해 사고 뒤 GPU 재배정도 담았습니다.

  • #OpenAI
  • #코딩 에이전트
  • #AI 연구 자동화
활용·도구· 2

Funes — 코딩 에이전트 기억, 인수인계보다 8배 싸다

Hugging Face가 9월 3일 공개한 Funes는 Claude Code·Codex·pi·Hermes의 세션 기록을 로컬 데이터셋으로 색인해 에이전트가 다시 꺼내 쓰게 합니다. 구조와 벤치마크, 보안 한계를 정리했습니다.

  • #코딩 에이전트
  • #오픈소스
  • #Hugging Face
논문 한입· 3

AI가 IOI 2026 최고 인간 점수를 넘었다 — 535.4점

NVIDIA 연구진의 Nemotron-3-Ultra-CC가 IOI 2026 문제를 인간과 같은 제한 아래 풀어 535.4/600점을 받았습니다. 최고 인간 점수 498.27을 넘겼다는 주장과 한계를 정리했습니다.

  • #논문
  • #코딩 에이전트
  • #벤치마크
모델· 3

Meta Muse Spark 1.3 — 툴 호출 20% 적은 에이전트

Meta가 9월 2일 Muse Spark 1.3을 Muse Code와 Meta Model API에 올렸습니다. 1.2 대비 툴 호출 20%·토큰 25% 절감, 되묻는 행동 변화, 가격과 max 모드 쟁점을 정리했습니다.

  • #Meta
  • #Muse Spark
  • #모델 출시
활용·도구· 5

Claude Code /design — 터미널에서 UI 시안까지

Anthropic이 8월 셋째 주 Claude Code에 /design 스킬을 리서치 프리뷰로 넣었습니다. 한 줄 브리프로 편집 가능한 아트보드 여러 장을 받아 고른 뒤 바로 구현시키는 흐름을, 요구 조건과 한계까지 실무자 관점에서 정리했습니다.

  • #Claude Code
  • #코딩 에이전트
  • #디자인 도구