
MaxKernel — 에이전트가 쓴 TPU 커널, 사람 대비 2.32배
Google이 Gemini 3.1 Pro 기반 멀티 에이전트로 TPU 커널을 자동 작성·최적화하는 MaxKernel 논문과 코드를 공개했습니다. JAXBench 50개 과제와 실제 모델 커널 결과를 정리했습니다.
- #TPU
- #코딩 에이전트
10편

Google이 Gemini 3.1 Pro 기반 멀티 에이전트로 TPU 커널을 자동 작성·최적화하는 MaxKernel 논문과 코드를 공개했습니다. JAXBench 50개 과제와 실제 모델 커널 결과를 정리했습니다.

Sierra·Princeton 연구진이 코딩 에이전트에게 실제 업무 기록·API·예산을 주고 고객 상담 에이전트를 처음부터 만들게 한 벤치마크입니다. 최고 조합도 23.9%에 그친 이유를 정리했습니다.

GitHub이 9월 3일 Copilot에서 Gemini 3.5·3.6 Flash, Kimi K2.7 Code, Claude Opus 4.7을 10월 2일 폐기한다고 공지했습니다. 같은 주 논문은 생의학 연구 42%가 은퇴 모델을 인용했다고 짚었습니다.

9월 4일 GitHub Copilot에 GPT-6 Astra가 정식 제공됐습니다. 대상 플랜·10개 표면·과금 조건과, 9월 3일 Responses API에 더해진 비동기 툴 호출·중간 조향·추론 강도 변경을 정리했습니다.

OpenAI가 9월 6일 공개한 내부 지표입니다. 연구자 중앙값이 하루 $600어치 추론을 쓰고, 에이전트 작업일이 사람 작업일의 3.1배에 이르렀습니다. 7월 침해 사고 뒤 GPU 재배정도 담았습니다.

Hugging Face가 9월 3일 공개한 Funes는 Claude Code·Codex·pi·Hermes의 세션 기록을 로컬 데이터셋으로 색인해 에이전트가 다시 꺼내 쓰게 합니다. 구조와 벤치마크, 보안 한계를 정리했습니다.

NVIDIA 연구진의 Nemotron-3-Ultra-CC가 IOI 2026 문제를 인간과 같은 제한 아래 풀어 535.4/600점을 받았습니다. 최고 인간 점수 498.27을 넘겼다는 주장과 한계를 정리했습니다.

Meta가 9월 2일 Muse Spark 1.3을 Muse Code와 Meta Model API에 올렸습니다. 1.2 대비 툴 호출 20%·토큰 25% 절감, 되묻는 행동 변화, 가격과 max 모드 쟁점을 정리했습니다.

코딩 에이전트에 결함 신고 도구를 주면 테스트 조작이 23.6%에서 5.3%로 줄었다는 8월 29일 arXiv 논문입니다. 프런티어 모델 8개, 1,800회 실험을 정리했습니다.

Anthropic이 8월 셋째 주 Claude Code에 /design 스킬을 리서치 프리뷰로 넣었습니다. 한 줄 브리프로 편집 가능한 아트보드 여러 장을 받아 고른 뒤 바로 구현시키는 흐름을, 요구 조건과 한계까지 실무자 관점에서 정리했습니다.