무슨 일인가요
커맨드라인 코딩 에이전트는 이미 파일을 읽고 쓰며 긴 세션을 버팁니다. 그런데 실제 연구는 채팅 도구, IDE, 터미널, 집필 환경으로 흩어지고, 무엇을 왜 그렇게 정했는지는 거의 남지 않습니다. Dr. Claw는 여기에 새 자율 에이전트를 하나 더 얹는 대신, 기존 실행기를 감싸는 조율 계층을 두는 쪽을 택했습니다. 논문
구조는 세 층입니다. 채팅·과제·파일·버전을 한자리에 두는 상호작용 층, 의도를 실행 가능한 과제로 쪼개고 수명을 관리하는 조율 층, 서로 다른 실행기를 호출하는 실행 층입니다. 상태는 과제 그래프, 산출물 저장소, 결정 로그, 실행 추적 네 가지 객체에 남습니다. 논문 스킬 라이브러리에는 조사·아이디어·실험·출판·홍보 다섯 단계에 매핑된 스킬 58개가 있고, 배포 카탈로그 기준으로는 171개입니다. 논문

무엇이 좋아졌나요
비교는 같은 실행기(GPT-5.4)를 쓰는 맨 커맨드라인 에이전트를 대조군으로 삼았습니다. 조율 계층이 더한 것만 떼어 보려는 설계입니다. 열린 과제 3개를 21개 항목으로 채점한 결과 풀링 점수는 0.952 대 0.873, 2승 1무였습니다. 논문
| 항목 | 완성도 |
|---|---|
| 맨 CLI 에이전트 | 0.873 |
| Dr. Claw | 0.952 |
출처: arXiv 2609.00365
흥미로운 대목은 차이가 난 자리입니다. 모델을 세 개 이상 학습하고 교차검증·보정·절제 실험을 하는 항목은 양쪽 모두 1.00으로 만점이었습니다. 벌어진 곳은 연구 위생 쪽입니다. 논문
| 항목 | 맨 CLI 에이전트 | Dr. Claw |
|---|---|---|
| 한계 절 서술 | 0.33 | 1.00 |
| 하위집단 분석 | 0.33 | 1.00 |
| 실제 문헌 인용 | 0.00 | 0.67 |
맨 에이전트는 세 과제 모두에서 실제 문헌 인용을 하나도 만들지 못했습니다. Dr. Claw가 비긴 한 과제에서는 참고문헌 감사 스킬이 발동하지 않아 인용을 똑같이 놓쳤습니다. 기제가 작동할 때만 효과가 난다는 뜻입니다. 논문
사용자 연구
AI 박사과정 7명, 세 단계 비교
아이디어·실험·출판 세 단계에서 무도구·범용 AI 어시스턴트와 비교했습니다
완료 시간 구간이 짧고 도구 전환 횟수가 적었습니다
블라인드 평가 산출물 품질이 가장 높았습니다
가장 강하게 갈린 지표는 사용 경험이고, 여기서만 모든 쌍대 비교가 유의했습니다
사전에 3주 무료 사용 기간을 준 뒤 진행한 회고적 연구입니다
무엇을 보면 되나요
저장소는 AGPL-3.0으로 공개돼 있고 상위 구성요소는 GPL-3.0입니다. 논문 실행 중 과제 그래프에는 평균 17개 과제가 추적됐고 실행기는 실행당 12개 안팎의 스킬 파일을 읽었습니다. 논문



