본문으로 건너뛰기

Dr. Claw 공개 — 코딩 에이전트를 감싼 연구 워크스페이스

자율 연구 에이전트를 하나 더 만드는 대신, 기존 코딩 에이전트를 감사 가능한 작업 흐름으로 감쌌습니다. 완성도는 올랐지만 통계적 유의성은 아직입니다.

AI피셜 편집부· 2분 읽기원문 보기 ↗
1947년 실험실에서 현미경 앞에 앉아 작업 중인 유전학자 바버라 매클린톡
사진: Smithsonian Institution/Science Service; Restored by Adam Cuerden · Public domain

핵심 답변

Dr. Claw는 Claude Code·Gemini CLI 같은 기존 코딩 에이전트를 실행기로 두고 그 위에 과제 그래프·결정 로그·스킬 라이브러리를 얹은 오픈소스 연구 워크스페이스입니다. 같은 실행기를 쓴 맨 CLI 에이전트와 비교했을 때 연구 완성도가 0.873에서 0.952로 올랐지만, 저자들은 표본이 작아 통계적으로 유의하지는 않다고 명시했습니다.

TL;DR세 줄 요약

  • 새 자율 에이전트를 만드는 대신 기존 코딩 에이전트를 감싸는 조율 계층을 만든 것이 핵심입니다.
  • 과제 그래프·산출물 저장소·결정 로그·실행 추적 네 가지 상태 객체가 사람의 결정과 AI 실행을 연결합니다.
  • 실행기를 GPT-5.4로 고정한 비교에서 완성도 21개 항목 기준 0.952 대 0.873, 3개 과제 중 2승 1무였습니다.
  • 차이는 모델링이 아니라 연구 위생에서 났습니다. 한계 절 서술 0.33→1.00, 하위집단 분석 0.33→1.00, 실제 문헌 인용 0.00→0.67입니다.

핵심 사실

논문
arXiv 2609.003652026-08-31 제출, EMNLP 2026 System Demonstrations 채택
저장소
OpenLAIR/dr-clawAGPL-3.0, 상위 구성요소는 GPL-3.0
스킬 라이브러리
58개 / 배포 카탈로그 171개조사·아이디어·실험·출판·홍보 다섯 단계
완성도
0.952 vs 0.87321개 항목 기준, 실행기 GPT-5.4 고정
효과 크기
Δ=+0.07995% 부트스트랩 CI [-0.00, +0.14] 로 0을 포함
사용자 연구
AI 박사과정 7명아이디어·실험·출판 세 단계

무슨 일인가요

커맨드라인 코딩 에이전트는 이미 파일을 읽고 쓰며 긴 세션을 버팁니다. 그런데 실제 연구는 채팅 도구, IDE, 터미널, 집필 환경으로 흩어지고, 무엇을 왜 그렇게 정했는지는 거의 남지 않습니다. Dr. Claw는 여기에 새 자율 에이전트를 하나 더 얹는 대신, 기존 실행기를 감싸는 조율 계층을 두는 쪽을 택했습니다. 논문

구조는 세 층입니다. 채팅·과제·파일·버전을 한자리에 두는 상호작용 층, 의도를 실행 가능한 과제로 쪼개고 수명을 관리하는 조율 층, 서로 다른 실행기를 호출하는 실행 층입니다. 상태는 과제 그래프, 산출물 저장소, 결정 로그, 실행 추적 네 가지 객체에 남습니다. 논문 스킬 라이브러리에는 조사·아이디어·실험·출판·홍보 다섯 단계에 매핑된 스킬 58개가 있고, 배포 카탈로그 기준으로는 171개입니다. 논문

유리 진열장 안에 펼쳐진 오토 한의 1938년 실험 노트
Dr. Claw가 남기려는 것은 결과물이 아니라 결정의 흔적입니다. 사진은 도이체스 박물관에 전시된 오토 한의 1938년 실험 노트입니다.· 사진: J Brew · CC BY-SA 2.0

무엇이 좋아졌나요

비교는 같은 실행기(GPT-5.4)를 쓰는 맨 커맨드라인 에이전트를 대조군으로 삼았습니다. 조율 계층이 더한 것만 떼어 보려는 설계입니다. 열린 과제 3개를 21개 항목으로 채점한 결과 풀링 점수는 0.952 대 0.873, 2승 1무였습니다. 논문

열린 과제 완성도 (21개 항목 기준, 풀링)
0.0000.2500.5000.7501.000맨 CLI 에이전트Dr. Claw0.8730.952
열린 과제 완성도 (21개 항목 기준, 풀링)
항목완성도
맨 CLI 에이전트0.873
Dr. Claw0.952

출처: arXiv 2609.00365

흥미로운 대목은 차이가 난 자리입니다. 모델을 세 개 이상 학습하고 교차검증·보정·절제 실험을 하는 항목은 양쪽 모두 1.00으로 만점이었습니다. 벌어진 곳은 연구 위생 쪽입니다. 논문

항목맨 CLI 에이전트Dr. Claw
한계 절 서술0.331.00
하위집단 분석0.331.00
실제 문헌 인용0.000.67

맨 에이전트는 세 과제 모두에서 실제 문헌 인용을 하나도 만들지 못했습니다. Dr. Claw가 비긴 한 과제에서는 참고문헌 감사 스킬이 발동하지 않아 인용을 똑같이 놓쳤습니다. 기제가 작동할 때만 효과가 난다는 뜻입니다. 논문

사용자 연구

AI 박사과정 7명, 세 단계 비교

  1. 아이디어·실험·출판 세 단계에서 무도구·범용 AI 어시스턴트와 비교했습니다

  2. 완료 시간 구간이 짧고 도구 전환 횟수가 적었습니다

  3. 블라인드 평가 산출물 품질이 가장 높았습니다

  4. 가장 강하게 갈린 지표는 사용 경험이고, 여기서만 모든 쌍대 비교가 유의했습니다

사전에 3주 무료 사용 기간을 준 뒤 진행한 회고적 연구입니다

무엇을 보면 되나요

저장소는 AGPL-3.0으로 공개돼 있고 상위 구성요소는 GPL-3.0입니다. 논문 실행 중 과제 그래프에는 평균 17개 과제가 추적됐고 실행기는 실행당 12개 안팎의 스킬 파일을 읽었습니다. 논문

자주 묻는 질문

완전 자율 AI 과학자와 무엇이 다른가요?
저자들은 사람이 결정하고 AI가 실행하는 경계를 명시적으로 그은 것을 차별점으로 내세웁니다. 계획·실행·집필이 하나의 추적 가능한 루프 안에 있고, 중간에 실패해도 상태를 잃지 않고 되돌리거나 넘겨줄 수 있게 설계했습니다.
성능 차이가 실제로 있는 건가요?
방향은 일관되지만 유의하지는 않습니다. 세 과제 모두에서 Dr. Claw가 같거나 앞섰지만 과제당 1회씩만 돌렸고, 풀링한 차이 +0.079의 95% 신뢰구간이 0을 포함합니다. 저자들도 이를 '탐색적 파일럿'이라고 부릅니다.
무엇을 쓸 수 있나요?
저장소가 AGPL-3.0으로 공개돼 있고 상위 구성요소는 GPL-3.0입니다. 실행기는 주류 커맨드라인 코딩 에이전트를 그대로 쓰므로, 이미 쓰고 있는 에이전트를 바꾸지 않고 조율 계층만 얹는 형태입니다.

출처 · 3

  1. 1Dr. Claw: An AI Scientist Workspace for Vibe Research (arXiv 2609.00365)논문arxiv.org/abs/2609.00365
  2. 2같은 논문 HTML 전문 (arXiv)논문arxiv.org/html/2609.00365v1
  3. 3OpenLAIR/dr-claw 저장소 (GitHub)공식 발표github.com/OpenLAIR/dr-claw

이 글의 마크다운 원문: /posts/dr-claw-vibe-research-workspace/md/ · 인용 시 출처를 “AI피셜”으로 표기해 주세요.

동료에게도 보내 주세요.

AI피셜 새 글 알림

새 글이 올라오면 메일로 알려드려요

매일 새 글, 5분 브리프. 스팸 없이 소식만. 언제든 한 번에 해지.

같은 태그·카테고리의 글을 골랐습니다.

활용·도구· 2

MaxKernel — 에이전트가 쓴 TPU 커널, 사람 대비 2.32배

Google이 Gemini 3.1 Pro 기반 멀티 에이전트로 TPU 커널을 자동 작성·최적화하는 MaxKernel 논문과 코드를 공개했습니다. JAXBench 50개 과제와 실제 모델 커널 결과를 정리했습니다.

  • #Google
  • #TPU
  • #코딩 에이전트
논문 한입· 2

프런티어 모델 22종, 화학 벤치마크 답을 '외워서' 냈다

독일 연구진이 LLM 22종을 분자 물성 회귀 벤치마크 12개에서 자릿수 단위로 검사해, 5개 데이터셋에서 모델 절반 이상이 공개된 값을 그대로 꺼내 쓴다는 것을 보였습니다. 방법과 한계를 정리했습니다.

  • #논문
  • #벤치마크
  • #평가
논문 한입· 2

모델을 바꾸면 에이전트 메모리가 깨진다 — 최대 13%p

LinkedIn 연구진이 에이전트 메모리 4가지 구조가 모델 교체를 얼마나 견디는지 통제 실험했습니다. 요약 노트는 최대 13.28%p 흔들렸고 고정 스키마 그래프는 거의 변하지 않았습니다.

  • #논문
  • #에이전트
  • #메모리