# 작업 티어로 모델·추론 깊이를 배정하는 오픈소스 스킬

> Effort-Router는 코딩 과업을 S/M/L/XL로 판정해 계획·실행·검토마다 다른 모델과 추론 깊이를 배정합니다. 구조와 검증 기록을 정리합니다.

- 출처 사이트: AI피셜 (https://aifficial.net/posts/effort-router-tier-model-routing/)
- 발행: 2026-09-20
- 카테고리: 활용·도구 · 태그: AI 에이전트, Codex, 오픈소스, 코딩 에이전트, Jev

## 핵심 답변

Effort-Router는 GitHub 사용자 acc0mplish가 2026년 9월 3일 공개한 Codex·ChatGPT용 스킬입니다. 코딩 과업의 규모와 위험을 S/M/L/XL 티어로 판정한 뒤, 실무 실행은 GPT-5.6-Luna의 max 추론, 계획은 GPT-6-Astra의 medium, 검토는 Astra의 high로 나눠 보냅니다. 자기 산출물을 자기가 검토하지 않도록 역할과 산출물을 분리하고, 단계 사이를 state.json과 증거 번들로 잇는 것이 핵심 설계입니다. 저장소의 검증 기록은 표본 3회의 소규모 관측이며, 저자 스스로 확대 표본을 후속 과제로 적어 두었습니다.

## 한 장 요약(만화)

![AI피셜 마스코트가 티어 판정, 단계별 모델 배정, 검토 역할 분리와 상태 파일, 소규모 검증 기록의 한계를 네 컷으로 설명합니다.](https://aifficial.net/images/posts/effort-router-tier-model-routing/comic-v1.0.0.webp)

## 요약

- Effort-Router는 과업을 S/M/L/XL 티어로 판정하고 계획·실행·검토마다 다른 모델과 추론 깊이를 배정하는 오픈소스 스킬입니다.
- 실무는 GPT-5.6-Luna max, 계획은 GPT-6-Astra medium, 검토는 Pro 요금제에서 Astra high로 보내는 매핑을 기본값으로 둡니다.
- 검토는 별도 에이전트가 맡고 단계 사이는 state.json과 증거 번들로 잇는다는 원칙을 하니스 논문 6편에서 끌어왔습니다.
- 공개 검증 기록은 표본 3회 규모이며 유령 에이전트 지목률 0/3, 티어 일치율 3/3을 보고했지만 확대 실험은 아직입니다.

## 핵심 사실

| 항목 | 값 |
|---|---|
| 공개 | 2026-09-03 (GitHub acc0mplish/Effort-Router, 최근 갱신 2026-09-19(r17).) |
| 티어 | S/M/L/XL (규모와 위험도로 판정한 뒤 단계별 모델·추론 깊이를 배정합니다.) |
| 기본 매핑 | Luna max·Astra medium/high (실무 실행·계획·검토 순서이며 Plus 요금제는 검토도 medium입니다.) |
| 검증 표본 | 기준 1회·스킬 3회 (TESTS.md 자체 기록 기준이며 확대 표본은 후속 과제로 명시했습니다.) |


## 모든 일을 같은 모델로 시키지 않기

코딩 에이전트에게 오타 수정과 결제 모듈 교체를 같은 모델, 같은 추론 깊이로 맡기면 어떻게 될까요. GitHub 사용자 acc0mplish가 2026년 9월 3일 공개한 Effort-Router는 이 질문에서 출발한 Codex·ChatGPT용 스킬(skill, 에이전트가 읽고 따르는 절차 문서 묶음)입니다. 과업의 규모와 위험도를 S/M/L/XL 네 티어로 먼저 판정하고, 그 티어에 따라 계획·실행·검토 단계마다 다른 모델과 추론 깊이(reasoning effort)를 배정합니다. 

저자는 필요성을 세 문장으로 요약합니다. 단일 모델·단일 추론 깊이는 단순 수정에 과투자하고 대형 변경은 과소 검증하게 만듭니다. 자기 산출물을 자기가 검토하는 것은 검토가 아닙니다. 서브에이전트 호출은 상태가 없으므로 단계 사이를 잇는 상태 계약이 없으면 인계가 산문 재구성에 의존해 무너집니다. 

## 계획·실행·검토가 서로 다른 모델을 씁니다

기본 매핑은 명확합니다. 구현·수정·테스트 같은 모든 실무 실행은 GPT-5.6-Luna의 max 추론으로, 명세 작성과 계획·아키텍처 설계는 GPT-6-Astra의 medium으로, 스펙 검토·문제 분석·PR 판정·보안 감사는 Astra의 high로 보냅니다. ChatGPT Plus 요금제에서는 검토도 medium으로 낮추고, 스크립트가 로그인된 요금제를 조회해 역할 설정 파일에 반영합니다. 

| 단계 | 모델 | 추론 깊이 |
| --- | --- | --- |
| 실무 실행·구현·테스트 | GPT-5.6-Luna | max |
| 명세·계획·아키텍처 | GPT-6-Astra | medium |
| 검토·PR 판정·보안 감사 | GPT-6-Astra | high (Plus는 medium) |



흐름은 티어 판정, 요구, 수용 기준, 작업, 증거, 학습의 여섯 단계로 이어집니다. 서브에이전트는 state.json을 쓰지 않고 메인 세션만 갱신하며, 완료 보고는 서술이 아니라 실행 명령 원문과 종료 코드로 남기고 상위 세션이 핵심 검증 하나를 다시 실행합니다. 저자는 라우팅의 본질이 추론 깊이 수치가 아니라 역할과 산출물의 분리라고 강조합니다. 

## 논문 여섯 편에서 끌어온 설계

역할을 계획자·개발자·품질검증으로 나누고 증거 번들과 계보를 남기는 구조는 Harness-of-Harness 논문에서, state.json 같은 최소 정보 상태 계약은 SKILL.state 논문에서 가져왔다고 밝힙니다. 반복 3회가 원샷 대비 17~22점 높았다는 관측을 인용하며 이득의 원천은 호출량이 아니라 호출 사이를 잇는 상태라고 해석합니다. 

선택 기능인 jev 판단 계층은 TypeSafe의 Jev API로 티어·중복·루프·완료 여부 같은 예·아니오 판정을 서브에이전트를 띄우기 전에 내립니다. 저자는 판정 한 번의 비용을 약 0.3초와 약 1,200토큰으로 적고, 네 갈래 이상의 선택이나 간접 관련성 판단에는 쓸 수 없다는 한계 표도 함께 실었습니다. 이는 [AI피셜이 다룬 Jev](/posts/typesafe-system-one-jev/)를 실제 하니스에 붙인 사례이기도 합니다. 

## 검증 기록은 아직 작습니다

저장소의 TESTS.md는 같은 과업을 스킬 없이 1회, 스킬을 주입해 3회 투입한 결과를 기록합니다. 스킬 없는 조건에서는 설치되지 않은 에이전트 네 종을 지목했고 티어 체계 없이 재량으로 모델을 골랐습니다. 스킬 조건에서는 티어 일치율 3/3, 테이블 밖 에이전트 지목률 0/3을 보였습니다. 표본이 작다는 점은 저자가 먼저 적었고, 과업 5개에 3회 반복하는 확대 실험은 후속 과제로 남아 있습니다. 

같은 문서에는 개정 뒤 재검증에서 한 표본의 인용이 본문과 반대였다는 정정도 남아 있습니다. 관측된 실패 한 건을 규칙 한 줄로 바꾼다는 이 스킬의 원칙이 자기 검증 문서에도 적용된 셈입니다. 저장소는 공개 3주 차이고 별표는 한 자릿수이며 라이선스 파일은 아직 없습니다. 시험해 볼 때는 개인 환경에서 설정 백업을 먼저 두는 편이 안전합니다. 


저는 이 저장소에서 모델 이름표보다 "자기 검토는 검토가 아니다"라는 문장이 오래 남았습니다. 사람 조직에서 당연한 분리를 에이전트 하니스에 옮기면, 결국 누가 상태를 쓰고 누가 증거를 남기느냐의 문제로 돌아오니까요. 다만 표본 3회의 자체 기록은 아직 주장에 가깝고, 추론 깊이 설정이 프록시에서 조용히 강등될 수 있다는 저자의 실측 메모는 이런 라우팅이 환경에 얼마나 민감한지도 함께 보여 줍니다. 독자님의 에이전트 워크플로에서는 계획과 검토를 지금 누가 맡고 있는지, 한 번 적어 보시면 어떨까요. 



## 자주 묻는 질문

**Q. 이 스킬은 어디에 설치합니까?**

Codex CLI와 ChatGPT 데스크톱 앱의 Codex 화면이 공유하는 ~/.codex 폴더에 스킬 본체와 역할 정의 파일을 복사하고 전역 설정을 병합합니다. Claude Code, Gemini CLI 등 다른 하니스용 어댑터 문서도 함께 들어 있습니다.

**Q. 왜 계획과 실행에 다른 모델을 씁니까?**

저자는 단일 모델·단일 추론 깊이로 모든 과업을 처리하면 작은 수정에 과투자하고 큰 변경은 과소 검증된다고 설명합니다. 계획과 검토에는 더 신중한 모델을, 실행에는 깊은 추론을 배정하는 방식입니다.

**Q. jev 판단 계층은 무엇입니까?**

비싼 서브에이전트를 띄우기 전에 티어·중복·루프 여부 같은 예·아니오 판정을 TypeSafe의 Jev API로 빠르게 내리는 선택 기능입니다. API 키가 없으면 기존 절차로 동작합니다.

**Q. 효과가 검증됐습니까?**

저장소의 TESTS.md는 같은 과업을 스킬 유무로 비교한 소규모 관측(기준 1회, 스킬 3회)만 담고 있습니다. 저자도 과업 5개·3회 반복의 확대 표본을 후속 과제로 적었습니다.

## 출처

1. [Effort-Router 저장소](https://github.com/acc0mplish/Effort-Router) (official)
2. [Effort-Router 검증 기록(TESTS.md)](https://github.com/acc0mplish/Effort-Router/blob/main/TESTS.md) (data)
3. [Harness-of-Harness 논문](https://arxiv.org/abs/2609.01481) (paper)
4. [SKILL.state 논문](https://arxiv.org/abs/2608.26263) (paper)

_이 문서는 AI피셜 편집부가 작성했습니다. 인용 시 출처를 표기해 주세요._