# MaxKernel — 에이전트가 쓴 TPU 커널, 사람 대비 2.32배

> Google이 Gemini 3.1 Pro 기반 멀티 에이전트로 TPU 커널을 자동 작성·최적화하는 MaxKernel 논문과 코드를 공개했습니다. JAXBench 50개 과제와 실제 모델 커널 결과를 정리했습니다.

- 출처 사이트: AI피셜 (https://aifficial.net/posts/maxkernel-tpu-kernel-agents/)
- 발행: 2026-09-07
- 카테고리: 활용·도구 · 태그: Google, TPU, 코딩 에이전트, 오픈소스, 논문

## 핵심 답변

Google 연구진은 arXiv 2609.04523 논문에서 Gemini 3.1 Pro로 움직이는 멀티 에이전트 시스템 MaxKernel이 TPU용 Pallas 커널을 자동으로 작성·검증·프로파일링해, 50개 과제로 구성된 JAXBench에서 기하평균 1.58배, 실제 모델 커널 7종에서는 2.32배 속도 향상을 냈다고 밝혔습니다. 같은 커널을 사람이 손으로 최적화한 참조 결과는 2.02배였고, 코드는 GitHub AI-Hypercomputer/accelerator-agents 저장소에 Apache 2.0으로 공개돼 있습니다.

## 요약

- MaxKernel은 계획·구현·테스트·자동 튜닝·프로파일링 서브 에이전트를 공유하는 세 가지 운용 방식(사람 개입, 자율 루프, 그래프 탐색)으로 TPU 커널을 만듭니다.
- JAXBench 50개 과제에서 병렬 탐색 방식이 50/50 컴파일·정답에 기하평균 1.58배 속도 향상을 냈고, Best-of-N 기준선은 1.08배였습니다.
- 실제 모델 커널에서는 기하평균 2.32배로 사람이 쓴 참조 커널(2.02배)을 넘었고, DeepSeek-V4 프리필 커널은 7.85배였습니다.
- 모든 실험이 Gemini 3.1 Pro 하나로 진행됐고 다른 LLM 비교는 향후 과제로 남겼습니다. 저장소는 '공식 지원 제품이 아님'이라고 명시합니다.

## 핵심 사실

| 항목 | 값 |
|---|---|
| 논문 | arXiv 2609.04523 (제출 2026-09-03, 목록 게시 9월 7일) |
| 소속 | Google · Google DeepMind (저자 10명) |
| 에이전트 LLM | Gemini 3.1 Pro (모든 LLM 호출에 단일 모델) |
| JAXBench | 50개 과제 (LLM 어텐션 연산 17개 + KernelBench 융합 연산 33개) |
| JAXBench 속도 향상 | 기하평균 1.58배 (MaxKernel Parallel, 50/50 정답) |
| 실제 커널 | 2.32배 vs 사람 2.02배 (기하평균, Parallel 방식) |
| 코드 | GitHub, Apache 2.0 (AI-Hypercomputer/accelerator-agents) |


## 무슨 일인가요

Google과 Google DeepMind 연구진 10명이 쓴 논문 "MaxKernel: Agentic Kernel Generation for TPUs"가 9월 3일 arXiv에 제출돼 9월 7일 목록에 올라왔습니다.  MaxKernel은 LLM과 컴파일러 피드백을 결합해 가속기용 고성능 커널을 설계하고 작성하는 멀티 에이전트 시스템으로, 계획·구현·자가 디버깅·테스트·하드웨어 프로파일링을 맡는 서브 에이전트 풀을 공유합니다. 



운용 방식은 세 가지입니다. 사람 개입(HITL) 방식은 서브 에이전트가 한 단계를 마칠 때마다 제어권을 사용자에게 돌려주고, 자율 루프(Auto) 방식은 계획·생성·테스트·프로파일링을 닫힌 루프로 반복하며, 그래프 탐색 방식은 Auto 에이전트를 병렬 탐색이나 빔 탐색 안에서 돌립니다.  서브 에이전트는 커널 생성·수정, 테스트·검증, 자동 튜닝, XProf 프로파일링으로 나뉩니다.  실험의 모든 LLM 호출은 Gemini 3.1 Pro로 이뤄졌습니다. 



## 숫자로 보면

논문이 함께 내놓은 JAXBench는 TPU 커널 과제 50개로, LLM 아키텍처의 어텐션 계열 연산 17개와 KernelBench 데이터셋의 융합 연산 33개로 구성됩니다.  후보를 여러 개 뽑아 고르는 Best-of-N 기준선은 기하평균 1.08배에 정답이면서 빨라진 과제(Fast₁)가 6/50이었던 반면, MaxKernel Auto는 1.39배에 22/50, 빔 탐색은 1.49배에 31/50, 병렬 탐색은 1.58배에 34/50이었고 병렬·빔 탐색 모두 50개 과제를 전부 컴파일·정답 처리했습니다.  빔 탐색 설정은 빔 폭 3, 최대 깊이 3, 노드당 확장 가지 2개, 노드 내부 루프 최대 2회였습니다. 



실제 오픈소스 모델에서 가져온 프로덕션 커널에서는 사람이 쓴 참조 커널이 기하평균 2.02배였고, MaxKernel 병렬 탐색은 2.32배, 빔 탐색은 1.78배였습니다. 

| 커널 | MaxKernel 결과 |
| --- | --- |
| DeepSeek-V4 프리필 | 7.85배 |
| Qwen3-Next 훈련 스텝 | 4.70배 |
| DeepSeek-V4 디코드 | 2.36배 |
| StreamIndex_topk | 1.66배 |
| Qwen3-Next 순전파 | 1.63배 |
| Mamba v2 SSD | 1.10배 |
| MLA v1 | 지연 시간 8.68% 개선 |

표의 수치는 모두 논문 Table 3 기재값입니다. 

## 무엇을 보면 되나요

코드는 GitHub의 AI-Hypercomputer/accelerator-agents 저장소에 Apache 2.0으로 올라와 있고, PyTorch 코드를 JAX로 옮기는 MaxCode와 Pallas 커널을 쓰는 MaxKernel 두 에이전트가 들어 있습니다.  README는 Gemini API와 Python 3.11 이상을 요구하며 "공식 지원 Google 제품이 아님"이라고 밝히고 있고, 이 글 작성 시점 스타는 62개입니다. 


저자들은 다른 LLM으로 바꿨을 때의 절제 실험을 향후 과제로 남겼고, 진화 탐색이나 탐욕 탐색 같은 다른 탐색 방식도 아직 시도하지 않았다고 적었습니다. 즉 이번 수치는 Gemini 3.1 Pro 한 모델과 병렬·빔 두 탐색 방식에서 나온 결과입니다. 



이 논문의 핵심은 "사람보다 빠른 커널"이라는 헤드라인보다 Best-of-N 1.08배와 병렬 탐색 1.58배의 차이에 있습니다. 같은 모델이라도 프로파일러 트레이스를 읽고 다시 계획하는 루프가 있느냐에 따라 결과가 갈렸습니다. TPU를 쓰지 않는 팀에게도, 컴파일러·프로파일러 피드백을 에이전트 루프에 넣는 설계는 그대로 옮겨 쓸 수 있는 교훈이라고 봅니다. 다만 프로덕션 커널 비교는 7종에 그치므로 2.32배라는 숫자를 일반화하기에는 이릅니다. 



## 자주 묻는 질문

**Q. 어떤 모델이 커널을 쓰나요?**

논문은 모든 LLM 질의와 에이전트 상호작용을 Gemini 3.1 Pro로 진행했다고 밝혔습니다. 다른 LLM으로 바꿨을 때의 결과는 향후 과제로 남겨 두었고, 저장소 README는 에이전트 추론에 Gemini API를 쓴다고 적고 있습니다.

**Q. JAXBench는 무엇인가요?**

논문이 함께 제안한 TPU 커널 벤치마크입니다. LLM 아키텍처에서 나온 어텐션 계열 연산 17개와 KernelBench 데이터셋에서 가져온 융합 연산 33개, 합쳐 50개 과제로 구성됩니다. 컴파일 여부, 정답 여부, 그리고 정답이면서 1.0배 넘게 빨라진 과제 수(Fast₁)를 함께 봅니다.

**Q. NVIDIA GPU에도 쓸 수 있나요?**

MaxKernel은 JAX의 커널 언어인 Pallas로 TPU 커널을 쓰는 도구이며, 저장소는 CUDA 커널을 Pallas로 옮기는 기능을 지원한다고 적었습니다. GPU 커널 생성 자체는 이번 논문의 범위가 아닙니다.

## 출처

1. [MaxKernel: Agentic Kernel Generation for TPUs (arXiv 2609.04523)](https://arxiv.org/abs/2609.04523) (paper)
2. [같은 논문 HTML 전문 (arXiv)](https://arxiv.org/html/2609.04523) (paper)
3. [AI-Hypercomputer/accelerator-agents 저장소 (GitHub)](https://github.com/AI-Hypercomputer/accelerator-agents) (official)
4. [Hugging Face Daily Papers 항목](https://huggingface.co/papers/2609.04523) (other)

_이 문서는 AI피셜 편집부가 작성했습니다. 인용 시 출처를 표기해 주세요._