본문으로 건너뛰기

SWE-2, 첫 코드 수정까지 48단계에서 18단계로

Cognition의 새 코딩 모델은 파일 탐색을 줄여 먼저 수정에 들어갑니다. 자체 평가의 비용 절감과 시험별 차이를 함께 봅니다.

AI피셜 편집부· 3분 읽기원문 보기 ↗
Cognition의 SWE-2 공식 발표 이미지
사진: Cognition

TL;DR요약

  • SWE-2는 9월 10일 공개됐어요.
  • 첫 수정까지 중앙값은 48단계에서 18단계로 줄었어요.
  • 회사 자체 평가이며, 시험에 따라 경쟁 모델과의 차이가 달라요.
SWE-2 공개, 첫 수정 중앙값 48단계에서 18단계, 평균 127단계에서 53단계, medium 비용 81% 감소, 시험별 차이와 실제 작업 비교를 설명하는 여섯 컷
단계와 비용 비교는 FrontierCode 1.1 Main의 SWE-1.7 대비 SWE-2 medium 자체 평가예요.· 그림: AI 생성 이미지 (gpt-image-2)

핵심 사실

공개일
2026-09-10
비교 조건
SWE-1.7 대 SWE-2 mediumFrontierCode 1.1 Main

코드를 읽기만 하던 시간이 줄었어요

코딩 AI가 파일만 계속 읽고 수정은 늦게 시작할 때가 있죠. Cognition은 9월 10일 공개한 SWE-2에서 이 탐색을 줄였다고 밝혔어요. 작업을 이어서 수행하는 코딩 에이전트(coding agent)의 새 모델이며, Devin Desktop과 CLI에서 제공돼요. 공식

회사 시험에서 SWE-2 medium의 첫 수정까지 중앙값은 18단계였어요. 이전 SWE-1.7은 48단계였죠. 평균 전체 단계도 127에서 53으로 줄었고, 비용은 81% 낮아졌어요. 같은 시험 묶음에서 측정한 결과예요. 공식

짧게 일해도 제대로 고쳤을까요

성능 평가 시험인 벤치마크(benchmark)는 시험지와 비슷해요. 어떤 문제를 넣느냐에 따라 잘하는 모델이 달라져요. 공식 표에서도 SWE-2의 Terminal-Bench 4 점수는 27.3%로 Fable 5.1의 55.8%보다 낮아요. 공식

확인할 항목독자가 볼 의미
수정까지 걸린 단계준비에 쓰는 작업량
시험의 채점 기준무엇을 성공으로 보는지
사람이 다시 고친 시간실제 업무에 남는 비용

FrontierCode는 실제 공개 저장소의 코드 변경 요청을 바탕으로 문제를 만들어요. 실행되는지만 보지 않고 코드 품질도 평가해요. 채점 기준표를 둔 실무 시험에 가까워요. 공식

인터넷 사용도 무조건 막지 않아요. API 문서를 읽는 것은 허용하되, 이미 공개된 정답 수정을 가져오는 실행은 탐지해 0점 처리해요. 설명서를 읽는 것과 해답지를 베끼는 것을 나누는 셈이에요. 공식

내 작업 한 묶음으로 비교해 보세요

Cognition의 비교표는 모델마다 주로 쓰는 실행 도구를 적용하고 추론 강도 중 최고 점수를 보고해요. 모델 하나만 바꾼 동일 환경 실험으로 읽으면 안 돼요. 공식

자주 하는 버그 수정과 테스트 추가를 골라 시간, 통과 여부, 재수정 시간을 적어 보세요. 먼저 수정하는 능력이 내 저장소에서도 도움이 되는지 판단할 수 있어요.

컴퓨터 화면에 표시된 PHP 코드
코드 화면 자료 이미지예요. SWE-2 실행 화면은 아니에요.· 사진: Ron23545 · CC BY-SA 4.0

자주 묻는 질문

제 업무도 같은 비율로 빨라질까요?
회사 시험 결과를 그대로 적용할 수는 없어요. 자주 맡기는 수정 작업으로 시간과 결과 품질을 함께 비교해 보세요.
시험에서 인터넷 답을 가져오면 어떡하나요?
FrontierCode 1.1은 문서 검색과 정답 코드 열람을 구분해요. 정답을 얻는 부당한 인터넷 사용이 감지된 실행에는 0점을 줍니다.

출처 · 2

  1. 1Cognition SWE-2 발표와 평가 방법공식 발표cognition.com/blog/swe-2
  2. 2FrontierCode 1.1 평가 설계공식 발표cognition.com/blog/frontier-code-1.1

이 글의 마크다운 원문: /posts/swe-two-coding-cost/md/ · 인용 시 출처를 “AI피셜”으로 표기해 주세요.

이 글이 도움이 됐다면 추천해 주세요.

동료에게도 보내 주세요.

댓글

로그인 없이 닉네임과 비밀번호만으로도 남길 수 있어요.

로그인하면 비밀번호 없이 쓰고 지울 수 있어요.

댓글을 불러오는 중입니다…

댓글 남기기

나중에 이 댓글을 지울 때 씁니다.

1000자까지 쓸 수 있습니다. 서식 없이 평문으로 보입니다.

AI피셜 주간 하이라이트

한 주 동안 AI 소식에서 중요한 것만 골라 월요일 아침에 보내드릴게요

같은 태그·카테고리의 글을 골랐습니다.

밤에 모니터 두 대에 테스트 출력과 소스 코드가 떠 있는 개발자 책상
활용·도구· 6

테스트 기법 26종 실험 — 지시 없는 쪽이 더 나았다

코딩 에이전트에게 TDD·퍼징·형식 검증을 시켜 Zstd를 구현시킨 실험입니다. 조건마다 160회씩 돌린 결과와, 에이전트가 실제로 무엇을 했는지 정리했습니다.

  • #코딩 에이전트
  • #평가
  • #형식 검증
TPU v4 패키지와 액체냉각 모듈 네 개가 실린 인쇄회로기판
활용·도구· 6

MaxKernel — 에이전트가 쓴 TPU 커널, 사람 대비 2.32배

Google이 Gemini 3.1 Pro 기반 멀티 에이전트로 TPU 커널을 자동 작성·최적화하는 MaxKernel 논문과 코드를 공개했습니다. JAXBench 50개 과제와 실제 모델 커널 결과를 정리했습니다.

  • #Google
  • #TPU
  • #코딩 에이전트