본문으로 건너뛰기

테스트 기법 26종 실험 — 지시 없는 쪽이 더 나았다

코딩 에이전트에게 TDD·퍼징·형식 검증을 시켜 Zstd를 구현시킨 실험입니다. 조건마다 160회씩 돌린 결과와, 에이전트가 실제로 무엇을 했는지 정리했습니다.

AI피셜 편집부· 2분 읽기원문 보기 ↗
밤에 모니터 두 대에 테스트 출력과 소스 코드가 떠 있는 개발자 책상
사진: AI 생성 이미지 (gpt-image-2)

핵심 답변

댄 루는 코딩 에이전트에 26가지 테스트 기법과 4가지 스킬을 지시해 Rust로 Zstd를 구현시키고 조건마다 160회씩 돌렸습니다. 아무 지시도 주지 않은 기본 조건이 평균을 크게 웃돌았고, 기법 이름을 알려 주는 것만으로는 에이전트가 그 기법을 제대로 쓰지 못했습니다.

TL;DR세 줄 요약

  • 조건은 26개(TDD, 퍼징, 속성 기반 테스트, QuickCheck, Lean 4, TLA+, Verus, Kani 등)와 스킬 4개, 모델은 codex의 GPT-5.6 Sol, 노력 수준 medium·xhigh 각 80회씩 총 160회입니다.
  • 지표는 숨겨진 테스트를 100% 통과한 실행의 비율입니다. 압도적으로 앞선 조건은 없었고, 지시 없는 기본 조건이 평균 이상이었습니다.
  • 퍼징 조건에서 구조적 무작위 입력을 실제로 만든 실행은 160회 중 10회였고, 그중 절반이 진짜 버그를 찾았습니다.
  • 가장 인기 있는 테스트 스킬은 정확도를 올리지 못한 채 비용만 medium 26%, xhigh 41% 늘렸습니다.

핵심 사실

실험
Rust로 Zstd 구현IMAP RFC 구현 평가도 함께 진행
조건 수
26개 + 스킬 4개
실행 수
조건당 160회medium·xhigh 각 80회
모델
codex + GPT-5.6 Sol
지표
숨겨진 테스트 100% 통과 비율
가장 나은 조건
직접 쓴 간단한 스킬·proptest·속성 기반 테스트xhigh 기준

무슨 일인가요

댄 루가 코딩 에이전트에게 Rust로 Zstd를 구현하게 하면서 프롬프트 끝에 "테스트 주도 개발을 쓰세요", "Lean 4를 쓰세요", "QuickCheck을 쓰세요" 같은 한 줄을 붙였습니다. 조건은 26개, 여기에 스킬 4개를 더했고, 모델은 codex의 GPT-5.6 Sol입니다. 노력 수준 medium과 xhigh에서 각각 80회씩, 조건마다 160회를 돌렸습니다. 지표는 숨겨진 테스트를 100% 통과한 실행의 비율입니다. 데이터

결과부터 말하면 압도적으로 앞선 조건이 없었고, 아무 지시도 없는 기본 조건이 평균을 뚜렷하게 웃돌았습니다. 데이터 xhigh 에서는 퍼징·속성 기반 테스트 계열이 형식 검증 계열보다 평균적으로 조금 나았고, medium 에서는 순위가 더 뒤섞였습니다. 데이터

실험실 작업대에 같은 모양의 유리 바이알이 줄지어 서 있고 그중 하나만 색이 다른 모습
같은 과제에 조건만 26가지로 바꿔 조건당 160회씩 돌린 실험입니다. 이미지는 실험 구조를 나타낸 연출 사진입니다.· 사진: AI 생성 이미지 (gpt-image-2)

에이전트는 실제로 무엇을 했나요

조건160회 중 실제로 벌어진 일
퍼징구조적 무작위 입력을 만든 실행 10회, 그중 절반이 진짜 버그를 찾음
QuickCheck63회는 속성을 딱 하나만 검사
차등 테스트135회가 "차등 테스트라 부를 만한 것"을 했지만 두 구현을 만든 실행은 0회
Verus테스트를 쓴 실행 89회로 기본 조건과 동일, 대신 나쁜 테스트가 더 많음
TDD구현 전에 실패하는 테스트를 둔 실행 67회 (기본 조건은 0회)

TDD 조건은 형식만 보면 제대로 지켜졌습니다. 실질 구현 전에 실패하는 테스트를 만든 실행이 160회 중 67회로, 기본 조건의 0회와 대비됩니다. 그런데도 정확도는 떨어졌습니다. 데이터 차등 테스트 조건은 전체에서 세 번째로 나쁜 성적이었는데, 두 구현을 만들어 서로 대조한 실행이 하나도 없었습니다. 데이터 저자의 표현대로 에이전트는 평소 쓰던 테스트를 다른 기법의 껍데기 안에 넣거나, 기법을 표면만 흉내 내는 쪽으로 갔습니다. 데이터

10 / 160

퍼징 조건에서 구조적 무작위 입력을 실제로 만든 실행

그중 절반이 진짜 버그를 찾았고, 일부는 사소하지 않은 사례였습니다

스킬은 도움이 됐나요

에이전트에게 관련 스킬을 찾아보라고 해서 상위에 나온 스킬들을 붙여 봤는데, 정확도는 나아지지 않고 비용만 늘었습니다. 가장 큰 스킬은 본문 34,000자에 Rust 참고 문서 45,000자가 딸려 2만 토큰을 넘겼고, 실행 시작 때 로드된 뒤 이후 동작마다 다시 읽혔습니다. 데이터 반면 저자가 2분 만에 쓴 짧은 스킬은 기본 동작에서 벗어나도록 밀어 주는 방식이었고 가장 좋은 축에 들었습니다. 데이터

큰 테스트 스킬을 붙였을 때의 비용 증가
0%13%25%38%50%mediumxhigh26%41%
큰 테스트 스킬을 붙였을 때의 비용 증가
항목비용 증가
medium26%
xhigh41%

출처: danluu.com/agentic-testing

스킬은 붙여 놓아도 항상 쓰이지 않습니다. 한 스킬은 160회 중 157회 사용됐지만, 다른 스킬은 실제로 문서를 열어 읽은 실행이 108회에 그쳤습니다. 데이터

무엇을 보면 되나요

오늘 바꿀 수 있는 것

기법 이름 대신 구조를 주세요

  1. '속성 기반 테스트를 쓰세요' 같은 한 줄은 거의 효과가 없습니다

  2. 무작위 입력을 만들라고만 하면 대부분 흥미롭지 않은 입력을 만들고 크래시만 확인합니다

  3. 테스트·분류 구조를 사람이 먼저 잡고 에이전트가 덧붙이게 하는 편이 낫습니다

  4. 긴 스킬 문서는 정확도를 올리지 못한 채 토큰만 먹습니다

26개 조건 × 160회 실행에서 관찰된 경향입니다

같이 돌린 IMAP RFC 구현 평가에서는 완벽 점수를 낸 실행이 딱 하나뿐이었습니다. 데이터

자주 묻는 질문

그럼 테스트 지시를 아예 하지 말라는 뜻인가요?
기법 이름만 던지는 지시가 도움이 안 됐다는 뜻입니다. 저자는 테스트와 분류 구조를 사람이 먼저 잡아 주고 에이전트가 거기에 덧붙이게 하면 감독 없이도 그럭저럭 굴러간다고 적었습니다. 짧게 쓴 자기 스킬이 가장 좋은 축이었던 것도 같은 맥락입니다.
형식 검증은 왜 성적이 나빴나요?
에이전트가 도구는 켜지만 관련 없는 성질을 증명하는 데 그쳤기 때문입니다. Verus 조건에서 테스트를 쓴 실행은 160회 중 89회로 기본 조건과 같았는데, 내용은 틀린 결과를 테스트에 박아 넣거나 통과하기 쉬운 테스트를 만드는 쪽이 더 많았습니다.
스킬을 붙이면 왜 비용이 오르나요?
검증한 스킬은 본문 34,000자에 Rust 참고 문서 45,000자가 딸려 2만 토큰을 넘겼습니다. 실행 시작 때 로드되고 이후 여러 동작마다 다시 읽히면서 비용이 medium 26%, xhigh 41% 늘었습니다.

출처 · 2

  1. 1How well do agents use test/verification techniques? (Dan Luu)데이터danluu.com/agentic-testing/
  2. 2앞선 실험 — 언어별 에이전트 코딩 효과 비교 (Dan Luu)데이터danluu.com/pl-tokens/

이 글의 마크다운 원문: /posts/agent-test-technique-eval-26/md/ · 인용 시 출처를 “AI피셜”으로 표기해 주세요.

동료에게도 보내 주세요.

AI피셜 새 글 알림

새 글이 올라오면 메일로 알려드려요

매일 새 글, 5분 브리프. 스팸 없이 소식만. 언제든 한 번에 해지.

같은 태그·카테고리의 글을 골랐습니다.

활용·도구· 2

Funes — 코딩 에이전트 기억, 인수인계보다 8배 싸다

Hugging Face가 9월 3일 공개한 Funes는 Claude Code·Codex·pi·Hermes의 세션 기록을 로컬 데이터셋으로 색인해 에이전트가 다시 꺼내 쓰게 합니다. 구조와 벤치마크, 보안 한계를 정리했습니다.

  • #코딩 에이전트
  • #오픈소스
  • #Hugging Face
논문 한입· 2

프런티어 모델 22종, 화학 벤치마크 답을 '외워서' 냈다

독일 연구진이 LLM 22종을 분자 물성 회귀 벤치마크 12개에서 자릿수 단위로 검사해, 5개 데이터셋에서 모델 절반 이상이 공개된 값을 그대로 꺼내 쓴다는 것을 보였습니다. 방법과 한계를 정리했습니다.

  • #논문
  • #벤치마크
  • #평가
논문 한입· 2

τ^τ-Bench — 에이전트가 만든 상담봇, 합격률 23.9%

Sierra·Princeton 연구진이 코딩 에이전트에게 실제 업무 기록·API·예산을 주고 고객 상담 에이전트를 처음부터 만들게 한 벤치마크입니다. 최고 조합도 23.9%에 그친 이유를 정리했습니다.

  • #논문
  • #코딩 에이전트
  • #벤치마크