본문으로 건너뛰기

작업 티어로 모델·추론 깊이를 배정하는 오픈소스 스킬

Effort-Router는 코딩 과업을 S/M/L/XL로 판정해 계획·실행·검토마다 다른 모델과 추론 깊이를 배정합니다. 구조와 검증 기록을 정리합니다.

AI피셜 편집부· 7분 읽기원문 보기 ↗
AI피셜 AI 마스코트가 S, M, L, XL 네 갈래 분기 표지판 앞에서 계획·실행·검토용 세 경로로 작업 카드를 나눕니다.
과업의 크기를 먼저 재고, 그 크기에 맞는 모델과 추론 깊이를 고르는 것이 이 스킬의 전부입니다.· 사진: AI 생성 이미지 (ChatGPT 이미지 생성 · Aside 연동)

TL;DR요약

  • Effort-Router는 과업을 S/M/L/XL 티어로 판정하고 계획·실행·검토마다 다른 모델과 추론 깊이를 배정하는 오픈소스 스킬입니다.
  • 실무는 GPT-5.6-Luna max, 계획은 GPT-6-Astra medium, 검토는 Pro 요금제에서 Astra high로 보내는 매핑을 기본값으로 둡니다.
  • 검토는 별도 에이전트가 맡고 단계 사이는 state.json과 증거 번들로 잇는다는 원칙을 하니스 논문 6편에서 끌어왔습니다.
  • 공개 검증 기록은 표본 3회 규모이며 유령 에이전트 지목률 0/3, 티어 일치율 3/3을 보고했지만 확대 실험은 아직입니다.
AI피셜 마스코트가 티어 판정, 단계별 모델 배정, 검토 역할 분리와 상태 파일, 소규모 검증 기록의 한계를 네 컷으로 설명합니다.
판정에서 검증 한계까지 네 컷으로 정리했습니다.· 그림: AI 생성 이미지 (ChatGPT 이미지 생성 · Aside 연동)

핵심 사실

공개
2026-09-03GitHub acc0mplish/Effort-Router, 최근 갱신 2026-09-19(r17).
티어
S/M/L/XL규모와 위험도로 판정한 뒤 단계별 모델·추론 깊이를 배정합니다.
기본 매핑
Luna max·Astra medium/high실무 실행·계획·검토 순서이며 Plus 요금제는 검토도 medium입니다.
검증 표본
기준 1회·스킬 3회TESTS.md 자체 기록 기준이며 확대 표본은 후속 과제로 명시했습니다.

모든 일을 같은 모델로 시키지 않기

코딩 에이전트에게 오타 수정과 결제 모듈 교체를 같은 모델, 같은 추론 깊이로 맡기면 어떻게 될까요. GitHub 사용자 acc0mplish가 2026년 9월 3일 공개한 Effort-Router는 이 질문에서 출발한 Codex·ChatGPT용 스킬(skill, 에이전트가 읽고 따르는 절차 문서 묶음)입니다. 과업의 규모와 위험도를 S/M/L/XL 네 티어로 먼저 판정하고, 그 티어에 따라 계획·실행·검토 단계마다 다른 모델과 추론 깊이(reasoning effort)를 배정합니다. 공식

저자는 필요성을 세 문장으로 요약합니다. 단일 모델·단일 추론 깊이는 단순 수정에 과투자하고 대형 변경은 과소 검증하게 만듭니다. 자기 산출물을 자기가 검토하는 것은 검토가 아닙니다. 서브에이전트 호출은 상태가 없으므로 단계 사이를 잇는 상태 계약이 없으면 인계가 산문 재구성에 의존해 무너집니다. 공식

계획·실행·검토가 서로 다른 모델을 씁니다

기본 매핑은 명확합니다. 구현·수정·테스트 같은 모든 실무 실행은 GPT-5.6-Luna의 max 추론으로, 명세 작성과 계획·아키텍처 설계는 GPT-6-Astra의 medium으로, 스펙 검토·문제 분석·PR 판정·보안 감사는 Astra의 high로 보냅니다. ChatGPT Plus 요금제에서는 검토도 medium으로 낮추고, 스크립트가 로그인된 요금제를 조회해 역할 설정 파일에 반영합니다. 공식

단계모델추론 깊이
실무 실행·구현·테스트GPT-5.6-Lunamax
명세·계획·아키텍처GPT-6-Astramedium
검토·PR 판정·보안 감사GPT-6-Astrahigh (Plus는 medium)
Effort-Router README의 모델 매핑 표 화면입니다. 작업 유형별 모델과 추론 깊이가 표로 정리되어 있습니다.
README의 모델 매핑 표입니다. 요금제에 따라 검토 단계의 추론 깊이가 달라집니다.· 사진: GitHub 저장소 화면 · 분석 목적 인용

흐름은 티어 판정, 요구, 수용 기준, 작업, 증거, 학습의 여섯 단계로 이어집니다. 서브에이전트는 state.json을 쓰지 않고 메인 세션만 갱신하며, 완료 보고는 서술이 아니라 실행 명령 원문과 종료 코드로 남기고 상위 세션이 핵심 검증 하나를 다시 실행합니다. 저자는 라우팅의 본질이 추론 깊이 수치가 아니라 역할과 산출물의 분리라고 강조합니다. 공식

논문 여섯 편에서 끌어온 설계

역할을 계획자·개발자·품질검증으로 나누고 증거 번들과 계보를 남기는 구조는 Harness-of-Harness 논문에서, state.json 같은 최소 정보 상태 계약은 SKILL.state 논문에서 가져왔다고 밝힙니다. 반복 3회가 원샷 대비 17~22점 높았다는 관측을 인용하며 이득의 원천은 호출량이 아니라 호출 사이를 잇는 상태라고 해석합니다. 논문

선택 기능인 jev 판단 계층은 TypeSafe의 Jev API로 티어·중복·루프·완료 여부 같은 예·아니오 판정을 서브에이전트를 띄우기 전에 내립니다. 저자는 판정 한 번의 비용을 약 0.3초와 약 1,200토큰으로 적고, 네 갈래 이상의 선택이나 간접 관련성 판단에는 쓸 수 없다는 한계 표도 함께 실었습니다. 이는 AI피셜이 다룬 Jev를 실제 하니스에 붙인 사례이기도 합니다. 공식

검증 기록은 아직 작습니다

저장소의 TESTS.md는 같은 과업을 스킬 없이 1회, 스킬을 주입해 3회 투입한 결과를 기록합니다. 스킬 없는 조건에서는 설치되지 않은 에이전트 네 종을 지목했고 티어 체계 없이 재량으로 모델을 골랐습니다. 스킬 조건에서는 티어 일치율 3/3, 테이블 밖 에이전트 지목률 0/3을 보였습니다. 표본이 작다는 점은 저자가 먼저 적었고, 과업 5개에 3회 반복하는 확대 실험은 후속 과제로 남아 있습니다. 데이터

같은 문서에는 개정 뒤 재검증에서 한 표본의 인용이 본문과 반대였다는 정정도 남아 있습니다. 관측된 실패 한 건을 규칙 한 줄로 바꾼다는 이 스킬의 원칙이 자기 검증 문서에도 적용된 셈입니다. 저장소는 공개 3주 차이고 별표는 한 자릿수이며 라이선스 파일은 아직 없습니다. 시험해 볼 때는 개인 환경에서 설정 백업을 먼저 두는 편이 안전합니다. 데이터

자주 묻는 질문

이 스킬은 어디에 설치합니까?
Codex CLI와 ChatGPT 데스크톱 앱의 Codex 화면이 공유하는 ~/.codex 폴더에 스킬 본체와 역할 정의 파일을 복사하고 전역 설정을 병합합니다. Claude Code, Gemini CLI 등 다른 하니스용 어댑터 문서도 함께 들어 있습니다.
왜 계획과 실행에 다른 모델을 씁니까?
저자는 단일 모델·단일 추론 깊이로 모든 과업을 처리하면 작은 수정에 과투자하고 큰 변경은 과소 검증된다고 설명합니다. 계획과 검토에는 더 신중한 모델을, 실행에는 깊은 추론을 배정하는 방식입니다.
jev 판단 계층은 무엇입니까?
비싼 서브에이전트를 띄우기 전에 티어·중복·루프 여부 같은 예·아니오 판정을 TypeSafe의 Jev API로 빠르게 내리는 선택 기능입니다. API 키가 없으면 기존 절차로 동작합니다.
효과가 검증됐습니까?
저장소의 TESTS.md는 같은 과업을 스킬 유무로 비교한 소규모 관측(기준 1회, 스킬 3회)만 담고 있습니다. 저자도 과업 5개·3회 반복의 확대 표본을 후속 과제로 적었습니다.

출처 · 4

  1. 1Effort-Router 저장소공식 발표github.com/acc0mplish/Effort-Router
  2. 2Effort-Router 검증 기록(TESTS.md)데이터github.com/acc0mplish/Effort-Router/blob/main/TESTS.md
  3. 3Harness-of-Harness 논문논문arxiv.org/abs/2609.01481
  4. 4SKILL.state 논문논문arxiv.org/abs/2608.26263

이 글의 마크다운 원문: /posts/effort-router-tier-model-routing/md/ · 인용 시 출처를 “AI피셜”으로 표기해 주세요.

도움이 됐다면

공유

더보기

다음으로 읽을 글

같은 태그·카테고리에서 세 편을 골랐습니다.

TPU v4 패키지와 액체냉각 모듈 네 개가 실린 인쇄회로기판
활용·도구· 6

MaxKernel — 에이전트가 쓴 TPU 커널, 사람 대비 2.32배

Google이 Gemini 3.1 Pro 기반 멀티 에이전트로 TPU 커널을 자동 작성·최적화하는 MaxKernel 논문과 코드를 공개했습니다. JAXBench 50개 과제와 실제 모델 커널 결과를 정리했습니다.

  • #Google
  • #TPU
  • #코딩 에이전트
모니터에 소스 코드를 띄워 놓고 작업하는 개발자
활용·도구· 5

Funes — 코딩 에이전트 기억, 인수인계보다 8배 싸다

Hugging Face가 9월 3일 공개한 Funes는 Claude Code·Codex·pi·Hermes의 세션 기록을 로컬 데이터셋으로 색인해 에이전트가 다시 꺼내 쓰게 합니다. 구조와 벤치마크, 보안 한계를 정리했습니다.

  • #코딩 에이전트
  • #오픈소스
  • #Hugging Face