본문으로 건너뛰기

MaxKernel — 에이전트가 쓴 TPU 커널, 사람 대비 2.32배

Google이 Gemini 3.1 Pro 기반 멀티 에이전트로 TPU 커널을 자동 작성·최적화하는 MaxKernel 논문과 코드를 공개했습니다. JAXBench 50개 과제와 실제 모델 커널 결과를 정리했습니다.

AI피셜 편집부· 2분 읽기원문 보기 ↗
TPU v4 패키지와 액체냉각 모듈 네 개가 실린 인쇄회로기판
사진: Norman P. Jouppi, George Kurian, Sheng Li, Peter Ma, Rahul Nagarajan, Lifeng Nai · CC BY 4.0

핵심 답변

Google 연구진은 arXiv 2609.04523 논문에서 Gemini 3.1 Pro로 움직이는 멀티 에이전트 시스템 MaxKernel이 TPU용 Pallas 커널을 자동으로 작성·검증·프로파일링해, 50개 과제로 구성된 JAXBench에서 기하평균 1.58배, 실제 모델 커널 7종에서는 2.32배 속도 향상을 냈다고 밝혔습니다. 같은 커널을 사람이 손으로 최적화한 참조 결과는 2.02배였고, 코드는 GitHub AI-Hypercomputer/accelerator-agents 저장소에 Apache 2.0으로 공개돼 있습니다.

TL;DR세 줄 요약

  • MaxKernel은 계획·구현·테스트·자동 튜닝·프로파일링 서브 에이전트를 공유하는 세 가지 운용 방식(사람 개입, 자율 루프, 그래프 탐색)으로 TPU 커널을 만듭니다.
  • JAXBench 50개 과제에서 병렬 탐색 방식이 50/50 컴파일·정답에 기하평균 1.58배 속도 향상을 냈고, Best-of-N 기준선은 1.08배였습니다.
  • 실제 모델 커널에서는 기하평균 2.32배로 사람이 쓴 참조 커널(2.02배)을 넘었고, DeepSeek-V4 프리필 커널은 7.85배였습니다.
  • 모든 실험이 Gemini 3.1 Pro 하나로 진행됐고 다른 LLM 비교는 향후 과제로 남겼습니다. 저장소는 '공식 지원 제품이 아님'이라고 명시합니다.

핵심 사실

논문
arXiv 2609.04523제출 2026-09-03, 목록 게시 9월 7일
소속
Google · Google DeepMind저자 10명
에이전트 LLM
Gemini 3.1 Pro모든 LLM 호출에 단일 모델
JAXBench
50개 과제LLM 어텐션 연산 17개 + KernelBench 융합 연산 33개
JAXBench 속도 향상
기하평균 1.58배MaxKernel Parallel, 50/50 정답
실제 커널
2.32배 vs 사람 2.02배기하평균, Parallel 방식
코드
GitHub, Apache 2.0AI-Hypercomputer/accelerator-agents

무슨 일인가요

Google과 Google DeepMind 연구진 10명이 쓴 논문 "MaxKernel: Agentic Kernel Generation for TPUs"가 9월 3일 arXiv에 제출돼 9월 7일 목록에 올라왔습니다. 논문 MaxKernel은 LLM과 컴파일러 피드백을 결합해 가속기용 고성능 커널을 설계하고 작성하는 멀티 에이전트 시스템으로, 계획·구현·자가 디버깅·테스트·하드웨어 프로파일링을 맡는 서브 에이전트 풀을 공유합니다. 논문

전산실에 늘어선 컴퓨터 클러스터 랙
커널 성능은 결국 이런 가속기 랙에서 실제 시간으로 측정됩니다. 사진은 데이터센터의 컴퓨터 클러스터입니다.· 사진: ChrisDag · CC BY 2.0

운용 방식은 세 가지입니다. 사람 개입(HITL) 방식은 서브 에이전트가 한 단계를 마칠 때마다 제어권을 사용자에게 돌려주고, 자율 루프(Auto) 방식은 계획·생성·테스트·프로파일링을 닫힌 루프로 반복하며, 그래프 탐색 방식은 Auto 에이전트를 병렬 탐색이나 빔 탐색 안에서 돌립니다. 논문 서브 에이전트는 커널 생성·수정, 테스트·검증, 자동 튜닝, XProf 프로파일링으로 나뉩니다. 논문 실험의 모든 LLM 호출은 Gemini 3.1 Pro로 이뤄졌습니다. 논문

MaxKernel Auto 루프 (워크로드당 5회 반복, 5회 독립 실행)
  1. 계획

    커널 구조 설계

  2. 구현

    Pallas 커널 작성·수정

  3. 테스트·검증

    컴파일·정답 확인

  4. 프로파일링

    XProf 트레이스 분석

  5. 자동 튜닝

    파라미터 조정 후 재계획

숫자로 보면

논문이 함께 내놓은 JAXBench는 TPU 커널 과제 50개로, LLM 아키텍처의 어텐션 계열 연산 17개와 KernelBench 데이터셋의 융합 연산 33개로 구성됩니다. 논문 후보를 여러 개 뽑아 고르는 Best-of-N 기준선은 기하평균 1.08배에 정답이면서 빨라진 과제(Fast₁)가 6/50이었던 반면, MaxKernel Auto는 1.39배에 22/50, 빔 탐색은 1.49배에 31/50, 병렬 탐색은 1.58배에 34/50이었고 병렬·빔 탐색 모두 50개 과제를 전부 컴파일·정답 처리했습니다. 논문 빔 탐색 설정은 빔 폭 3, 최대 깊이 3, 노드당 확장 가지 2개, 노드 내부 루프 최대 2회였습니다. 논문

JAXBench 기하평균 속도 향상 (배)
0.00배0.50배1.00배1.50배2.00배Best-of-NMaxKernel AutoMaxKernel BeamMaxKernel Parallel1.08배1.39배1.49배1.58배
JAXBench 기하평균 속도 향상 (배)
항목속도 향상
Best-of-N1.08배
MaxKernel Auto1.39배
MaxKernel Beam1.49배
MaxKernel Parallel1.58배

출처: arXiv 2609.04523 Table 1

실제 오픈소스 모델에서 가져온 프로덕션 커널에서는 사람이 쓴 참조 커널이 기하평균 2.02배였고, MaxKernel 병렬 탐색은 2.32배, 빔 탐색은 1.78배였습니다. 논문

커널MaxKernel 결과
DeepSeek-V4 프리필7.85배
Qwen3-Next 훈련 스텝4.70배
DeepSeek-V4 디코드2.36배
StreamIndex_topk1.66배
Qwen3-Next 순전파1.63배
Mamba v2 SSD1.10배
MLA v1지연 시간 8.68% 개선

표의 수치는 모두 논문 Table 3 기재값입니다. 논문

무엇을 보면 되나요

코드는 GitHub의 AI-Hypercomputer/accelerator-agents 저장소에 Apache 2.0으로 올라와 있고, PyTorch 코드를 JAX로 옮기는 MaxCode와 Pallas 커널을 쓰는 MaxKernel 두 에이전트가 들어 있습니다. 공식 README는 Gemini API와 Python 3.11 이상을 요구하며 "공식 지원 Google 제품이 아님"이라고 밝히고 있고, 이 글 작성 시점 스타는 62개입니다. 데이터

자주 묻는 질문

어떤 모델이 커널을 쓰나요?
논문은 모든 LLM 질의와 에이전트 상호작용을 Gemini 3.1 Pro로 진행했다고 밝혔습니다. 다른 LLM으로 바꿨을 때의 결과는 향후 과제로 남겨 두었고, 저장소 README는 에이전트 추론에 Gemini API를 쓴다고 적고 있습니다.
JAXBench는 무엇인가요?
논문이 함께 제안한 TPU 커널 벤치마크입니다. LLM 아키텍처에서 나온 어텐션 계열 연산 17개와 KernelBench 데이터셋에서 가져온 융합 연산 33개, 합쳐 50개 과제로 구성됩니다. 컴파일 여부, 정답 여부, 그리고 정답이면서 1.0배 넘게 빨라진 과제 수(Fast₁)를 함께 봅니다.
NVIDIA GPU에도 쓸 수 있나요?
MaxKernel은 JAX의 커널 언어인 Pallas로 TPU 커널을 쓰는 도구이며, 저장소는 CUDA 커널을 Pallas로 옮기는 기능을 지원한다고 적었습니다. GPU 커널 생성 자체는 이번 논문의 범위가 아닙니다.

출처 · 4

  1. 1MaxKernel: Agentic Kernel Generation for TPUs (arXiv 2609.04523)논문arxiv.org/abs/2609.04523
  2. 2같은 논문 HTML 전문 (arXiv)논문arxiv.org/html/2609.04523
  3. 3AI-Hypercomputer/accelerator-agents 저장소 (GitHub)공식 발표github.com/AI-Hypercomputer/accelerator-agents
  4. 4Hugging Face Daily Papers 항목참고huggingface.co/papers/2609.04523

이 글의 마크다운 원문: /posts/maxkernel-tpu-kernel-agents/md/ · 인용 시 출처를 “AI피셜”으로 표기해 주세요.

이 글이 도움이 됐다면 동료에게 보내 주세요.

AI피셜 새 글 알림

새 글이 올라오면 메일로 알려드려요

매일 5편, 5분 브리프. 스팸 없이 새 글 소식만. 언제든 한 번에 해지.

같은 태그·카테고리의 글을 골랐습니다.

활용·도구· 2

Copilot 모델 4종 폐기 — 논문 42%가 '은퇴 모델' 인용

GitHub이 9월 3일 Copilot에서 Gemini 3.5·3.6 Flash, Kimi K2.7 Code, Claude Opus 4.7을 10월 2일 폐기한다고 공지했습니다. 같은 주 논문은 생의학 연구 42%가 은퇴 모델을 인용했다고 짚었습니다.

  • #코딩 에이전트
  • #GitHub Copilot
  • #모델 폐기
활용·도구· 2

Funes — 코딩 에이전트 기억, 인수인계보다 8배 싸다

Hugging Face가 9월 3일 공개한 Funes는 Claude Code·Codex·pi·Hermes의 세션 기록을 로컬 데이터셋으로 색인해 에이전트가 다시 꺼내 쓰게 합니다. 구조와 벤치마크, 보안 한계를 정리했습니다.

  • #코딩 에이전트
  • #오픈소스
  • #Hugging Face
논문 한입· 2

τ^τ-Bench — 에이전트가 만든 상담봇, 합격률 23.9%

Sierra·Princeton 연구진이 코딩 에이전트에게 실제 업무 기록·API·예산을 주고 고객 상담 에이전트를 처음부터 만들게 한 벤치마크입니다. 최고 조합도 23.9%에 그친 이유를 정리했습니다.

  • #논문
  • #코딩 에이전트
  • #벤치마크