# SWE-2, 첫 코드 수정까지 48단계에서 18단계로

> Cognition의 새 코딩 모델은 파일 탐색을 줄여 먼저 수정에 들어갑니다. 자체 평가의 비용 절감과 시험별 차이를 함께 봅니다.

- 출처 사이트: AI피셜 (https://aifficial.net/posts/swe-two-coding-cost/)
- 발행: 2026-09-11
- 카테고리: 모델 출시 · 태그: Cognition, 코딩 에이전트, SWE-2

## 핵심 답변

Cognition은 SWE-2 medium이 자체 평가에서 이전 모델보다 일찍 코드를 수정하고 적은 단계로 작업했다고 밝혔어요. 실제 도입 판단에는 시험 점수와 사람이 다시 고치는 비용을 함께 봐야 해요.

## 한 장 요약(만화)

![SWE-2 공개, 첫 수정 중앙값 48단계에서 18단계, 평균 127단계에서 53단계, medium 비용 81% 감소, 시험별 차이와 실제 작업 비교를 설명하는 여섯 컷](https://aifficial.net/images/posts/swe-two-coding-cost/comic-v1.0.0.webp)

## 요약

- SWE-2는 9월 10일 공개됐어요.
- 첫 수정까지 중앙값은 48단계에서 18단계로 줄었어요.
- 회사 자체 평가이며, 시험에 따라 경쟁 모델과의 차이가 달라요.

## 핵심 사실

| 항목 | 값 |
|---|---|
| 공개일 | 2026-09-10 |
| 비교 조건 | SWE-1.7 대 SWE-2 medium (FrontierCode 1.1 Main) |


## 코드를 읽기만 하던 시간이 줄었어요

코딩 AI가 파일만 계속 읽고 수정은 늦게 시작할 때가 있죠. Cognition은 9월 10일 공개한 SWE-2에서 이 탐색을 줄였다고 밝혔어요. 작업을 이어서 수행하는 코딩 에이전트(coding agent)의 새 모델이며, Devin Desktop과 CLI에서 제공돼요. 

회사 시험에서 SWE-2 medium의 첫 수정까지 중앙값은 18단계였어요. 이전 SWE-1.7은 48단계였죠. 평균 전체 단계도 127에서 53으로 줄었고, 비용은 81% 낮아졌어요. 같은 시험 묶음에서 측정한 결과예요. 

## 짧게 일해도 제대로 고쳤을까요

성능 평가 시험인 벤치마크(benchmark)는 시험지와 비슷해요. 어떤 문제를 넣느냐에 따라 잘하는 모델이 달라져요. 공식 표에서도 SWE-2의 Terminal-Bench 4 점수는 27.3%로 Fable 5.1의 55.8%보다 낮아요. 

| 확인할 항목 | 독자가 볼 의미 |
| --- | --- |
| 수정까지 걸린 단계 | 준비에 쓰는 작업량 |
| 시험의 채점 기준 | 무엇을 성공으로 보는지 |
| 사람이 다시 고친 시간 | 실제 업무에 남는 비용 |

FrontierCode는 실제 공개 저장소의 코드 변경 요청을 바탕으로 문제를 만들어요. 실행되는지만 보지 않고 코드 품질도 평가해요. 채점 기준표를 둔 실무 시험에 가까워요. 

인터넷 사용도 무조건 막지 않아요. API 문서를 읽는 것은 허용하되, 이미 공개된 정답 수정을 가져오는 실행은 탐지해 0점 처리해요. 설명서를 읽는 것과 해답지를 베끼는 것을 나누는 셈이에요. 

## 내 작업 한 묶음으로 비교해 보세요

Cognition의 비교표는 모델마다 주로 쓰는 실행 도구를 적용하고 추론 강도 중 최고 점수를 보고해요. 모델 하나만 바꾼 동일 환경 실험으로 읽으면 안 돼요. 

자주 하는 버그 수정과 테스트 추가를 골라 시간, 통과 여부, 재수정 시간을 적어 보세요. 먼저 수정하는 능력이 내 저장소에서도 도움이 되는지 판단할 수 있어요.




AI가 얼마나 오래 생각했는지보다 완성된 수정에 얼마가 들었는지가 더 유용한 기준인 것 같아요. 답을 기다리는 시간과 검토 시간을 함께 재면 도구 선택도 쉬워지겠죠. 여러분은 코딩 AI의 어느 단계에서 가장 오래 기다리시나요? 댓글로 남겨 주세요. 



## 자주 묻는 질문

**Q. 제 업무도 같은 비율로 빨라질까요?**

회사 시험 결과를 그대로 적용할 수는 없어요. 자주 맡기는 수정 작업으로 시간과 결과 품질을 함께 비교해 보세요.

**Q. 시험에서 인터넷 답을 가져오면 어떡하나요?**

FrontierCode 1.1은 문서 검색과 정답 코드 열람을 구분해요. 정답을 얻는 부당한 인터넷 사용이 감지된 실행에는 0점을 줍니다.

## 출처

1. [Cognition SWE-2 발표와 평가 방법](https://cognition.com/blog/swe-2) (official)
2. [FrontierCode 1.1 평가 설계](https://cognition.com/blog/frontier-code-1.1) (official)

_이 문서는 AI피셜 편집부가 작성했습니다. 인용 시 출처를 표기해 주세요._