# Dr. Claw 공개 — 코딩 에이전트를 감싼 연구 워크스페이스

> 자율 연구 에이전트를 하나 더 만드는 대신, 기존 코딩 에이전트를 감사 가능한 작업 흐름으로 감쌌습니다. 완성도는 올랐지만 통계적 유의성은 아직입니다.

- 출처 사이트: AI피셜 (https://aifficial.net/posts/dr-claw-vibe-research-workspace/)
- 발행: 2026-09-08
- 카테고리: 오픈소스 · 태그: 오픈소스, 논문, 코딩 에이전트, 과학 AI, 에이전트

## 핵심 답변

Dr. Claw는 Claude Code·Gemini CLI 같은 기존 코딩 에이전트를 실행기로 두고 그 위에 과제 그래프·결정 로그·스킬 라이브러리를 얹은 오픈소스 연구 워크스페이스입니다. 같은 실행기를 쓴 맨 CLI 에이전트와 비교했을 때 연구 완성도가 0.873에서 0.952로 올랐지만, 저자들은 표본이 작아 통계적으로 유의하지는 않다고 명시했습니다.

## 요약

- 새 자율 에이전트를 만드는 대신 기존 코딩 에이전트를 감싸는 조율 계층을 만든 것이 핵심입니다.
- 과제 그래프·산출물 저장소·결정 로그·실행 추적 네 가지 상태 객체가 사람의 결정과 AI 실행을 연결합니다.
- 실행기를 GPT-5.4로 고정한 비교에서 완성도 21개 항목 기준 0.952 대 0.873, 3개 과제 중 2승 1무였습니다.
- 차이는 모델링이 아니라 연구 위생에서 났습니다. 한계 절 서술 0.33→1.00, 하위집단 분석 0.33→1.00, 실제 문헌 인용 0.00→0.67입니다.

## 핵심 사실

| 항목 | 값 |
|---|---|
| 논문 | arXiv 2609.00365 (2026-08-31 제출, EMNLP 2026 System Demonstrations 채택) |
| 저장소 | OpenLAIR/dr-claw (AGPL-3.0, 상위 구성요소는 GPL-3.0) |
| 스킬 라이브러리 | 58개 / 배포 카탈로그 171개 (조사·아이디어·실험·출판·홍보 다섯 단계) |
| 완성도 | 0.952 vs 0.873 (21개 항목 기준, 실행기 GPT-5.4 고정) |
| 효과 크기 | Δ=+0.079 (95% 부트스트랩 CI [-0.00, +0.14] 로 0을 포함) |
| 사용자 연구 | AI 박사과정 7명 (아이디어·실험·출판 세 단계) |


## 무슨 일인가요

커맨드라인 코딩 에이전트는 이미 파일을 읽고 쓰며 긴 세션을 버팁니다. 그런데 실제 연구는 채팅 도구, IDE, 터미널, 집필 환경으로 흩어지고, 무엇을 왜 그렇게 정했는지는 거의 남지 않습니다. Dr. Claw는 여기에 새 자율 에이전트를 하나 더 얹는 대신, 기존 실행기를 감싸는 조율 계층을 두는 쪽을 택했습니다. 

구조는 세 층입니다. 채팅·과제·파일·버전을 한자리에 두는 상호작용 층, 의도를 실행 가능한 과제로 쪼개고 수명을 관리하는 조율 층, 서로 다른 실행기를 호출하는 실행 층입니다. 상태는 과제 그래프, 산출물 저장소, 결정 로그, 실행 추적 네 가지 객체에 남습니다.  스킬 라이브러리에는 조사·아이디어·실험·출판·홍보 다섯 단계에 매핑된 스킬 58개가 있고, 배포 카탈로그 기준으로는 171개입니다. 



## 무엇이 좋아졌나요

비교는 같은 실행기(GPT-5.4)를 쓰는 맨 커맨드라인 에이전트를 대조군으로 삼았습니다. 조율 계층이 더한 것만 떼어 보려는 설계입니다. 열린 과제 3개를 21개 항목으로 채점한 결과 풀링 점수는 0.952 대 0.873, 2승 1무였습니다. 



흥미로운 대목은 차이가 난 자리입니다. 모델을 세 개 이상 학습하고 교차검증·보정·절제 실험을 하는 항목은 양쪽 모두 1.00으로 만점이었습니다. 벌어진 곳은 연구 위생 쪽입니다. 

| 항목 | 맨 CLI 에이전트 | Dr. Claw |
| --- | --- | --- |
| 한계 절 서술 | 0.33 | 1.00 |
| 하위집단 분석 | 0.33 | 1.00 |
| 실제 문헌 인용 | 0.00 | 0.67 |

맨 에이전트는 세 과제 모두에서 실제 문헌 인용을 하나도 만들지 못했습니다. Dr. Claw가 비긴 한 과제에서는 참고문헌 감사 스킬이 발동하지 않아 인용을 똑같이 놓쳤습니다. 기제가 작동할 때만 효과가 난다는 뜻입니다. 




저자들이 직접 밝힌 한계가 분명합니다. 과제당 1회만 돌린 탐색적 파일럿이라 풀링 차이 +0.079의 95% 부트스트랩 신뢰구간이 0을 포함하고, Dr. Claw는 상태를 기록하느라 더 느립니다. 집필 파일의 참조 해석률이 100% 대 62% 로 나오지만 참조 개수가 48개 대 8개라 양에 좌우된 값입니다. 채점은 파일에 무엇이 있는지 세는 방식이라 정확성 검사가 아니며, 과제도 의료 한 분야에서만 나왔습니다. 


## 무엇을 보면 되나요

저장소는 AGPL-3.0으로 공개돼 있고 상위 구성요소는 GPL-3.0입니다.  실행 중 과제 그래프에는 평균 17개 과제가 추적됐고 실행기는 실행당 12개 안팎의 스킬 파일을 읽었습니다. 


이 논문에서 재현할 가치가 있는 것은 시스템보다 실험 설계라고 봅니다. 실행기를 고정해 놓고 조율 계층만 바꿔 비교했기 때문에, 점수 차가 모델 성능이 아니라 작업 흐름에서 왔다는 것을 구분해서 볼 수 있습니다. 그리고 그 차이가 전부 한계 서술·하위집단 분석·인용 같은 절차 항목에서 나왔다는 결과는, 지금 에이전트에 부족한 것이 능력이 아니라 절차를 잊지 않게 하는 장치라는 쪽을 가리킵니다. 다만 과제 3개와 참가자 7명으로는 아직 방향 표시 이상은 아닙니다. 



## 자주 묻는 질문

**Q. 완전 자율 AI 과학자와 무엇이 다른가요?**

저자들은 사람이 결정하고 AI가 실행하는 경계를 명시적으로 그은 것을 차별점으로 내세웁니다. 계획·실행·집필이 하나의 추적 가능한 루프 안에 있고, 중간에 실패해도 상태를 잃지 않고 되돌리거나 넘겨줄 수 있게 설계했습니다.

**Q. 성능 차이가 실제로 있는 건가요?**

방향은 일관되지만 유의하지는 않습니다. 세 과제 모두에서 Dr. Claw가 같거나 앞섰지만 과제당 1회씩만 돌렸고, 풀링한 차이 +0.079의 95% 신뢰구간이 0을 포함합니다. 저자들도 이를 '탐색적 파일럿'이라고 부릅니다.

**Q. 무엇을 쓸 수 있나요?**

저장소가 AGPL-3.0으로 공개돼 있고 상위 구성요소는 GPL-3.0입니다. 실행기는 주류 커맨드라인 코딩 에이전트를 그대로 쓰므로, 이미 쓰고 있는 에이전트를 바꾸지 않고 조율 계층만 얹는 형태입니다.

## 출처

1. [Dr. Claw: An AI Scientist Workspace for Vibe Research (arXiv 2609.00365)](https://arxiv.org/abs/2609.00365) (paper)
2. [같은 논문 HTML 전문 (arXiv)](https://arxiv.org/html/2609.00365v1) (paper)
3. [OpenLAIR/dr-claw 저장소 (GitHub)](https://github.com/OpenLAIR/dr-claw) (official)

_이 문서는 AI피셜 편집부가 작성했습니다. 인용 시 출처를 표기해 주세요._