무슨 일인가요
Google과 Google DeepMind 연구진 10명이 쓴 논문 "MaxKernel: Agentic Kernel Generation for TPUs"가 9월 3일 arXiv에 제출돼 9월 7일 목록에 올라왔습니다. 논문 MaxKernel은 LLM과 컴파일러 피드백을 결합해 가속기용 고성능 커널을 설계하고 작성하는 멀티 에이전트 시스템으로, 계획·구현·자가 디버깅·테스트·하드웨어 프로파일링을 맡는 서브 에이전트 풀을 공유합니다. 논문

운용 방식은 세 가지입니다. 사람 개입(HITL) 방식은 서브 에이전트가 한 단계를 마칠 때마다 제어권을 사용자에게 돌려주고, 자율 루프(Auto) 방식은 계획·생성·테스트·프로파일링을 닫힌 루프로 반복하며, 그래프 탐색 방식은 Auto 에이전트를 병렬 탐색이나 빔 탐색 안에서 돌립니다. 논문 서브 에이전트는 커널 생성·수정, 테스트·검증, 자동 튜닝, XProf 프로파일링으로 나뉩니다. 논문 실험의 모든 LLM 호출은 Gemini 3.1 Pro로 이뤄졌습니다. 논문
계획
커널 구조 설계
구현
Pallas 커널 작성·수정
테스트·검증
컴파일·정답 확인
프로파일링
XProf 트레이스 분석
자동 튜닝
파라미터 조정 후 재계획
숫자로 보면
논문이 함께 내놓은 JAXBench는 TPU 커널 과제 50개로, LLM 아키텍처의 어텐션 계열 연산 17개와 KernelBench 데이터셋의 융합 연산 33개로 구성됩니다. 논문 후보를 여러 개 뽑아 고르는 Best-of-N 기준선은 기하평균 1.08배에 정답이면서 빨라진 과제(Fast₁)가 6/50이었던 반면, MaxKernel Auto는 1.39배에 22/50, 빔 탐색은 1.49배에 31/50, 병렬 탐색은 1.58배에 34/50이었고 병렬·빔 탐색 모두 50개 과제를 전부 컴파일·정답 처리했습니다. 논문 빔 탐색 설정은 빔 폭 3, 최대 깊이 3, 노드당 확장 가지 2개, 노드 내부 루프 최대 2회였습니다. 논문
| 항목 | 속도 향상 |
|---|---|
| Best-of-N | 1.08배 |
| MaxKernel Auto | 1.39배 |
| MaxKernel Beam | 1.49배 |
| MaxKernel Parallel | 1.58배 |
출처: arXiv 2609.04523 Table 1
실제 오픈소스 모델에서 가져온 프로덕션 커널에서는 사람이 쓴 참조 커널이 기하평균 2.02배였고, MaxKernel 병렬 탐색은 2.32배, 빔 탐색은 1.78배였습니다. 논문
| 커널 | MaxKernel 결과 |
|---|---|
| DeepSeek-V4 프리필 | 7.85배 |
| Qwen3-Next 훈련 스텝 | 4.70배 |
| DeepSeek-V4 디코드 | 2.36배 |
| StreamIndex_topk | 1.66배 |
| Qwen3-Next 순전파 | 1.63배 |
| Mamba v2 SSD | 1.10배 |
| MLA v1 | 지연 시간 8.68% 개선 |
표의 수치는 모두 논문 Table 3 기재값입니다. 논문
무엇을 보면 되나요
코드는 GitHub의 AI-Hypercomputer/accelerator-agents 저장소에 Apache 2.0으로 올라와 있고, PyTorch 코드를 JAX로 옮기는 MaxCode와 Pallas 커널을 쓰는 MaxKernel 두 에이전트가 들어 있습니다. 공식 README는 Gemini API와 Python 3.11 이상을 요구하며 "공식 지원 Google 제품이 아님"이라고 밝히고 있고, 이 글 작성 시점 스타는 62개입니다. 데이터



