코드를 읽기만 하던 시간이 줄었어요
코딩 AI가 파일만 계속 읽고 수정은 늦게 시작할 때가 있죠. Cognition은 9월 10일 공개한 SWE-2에서 이 탐색을 줄였다고 밝혔어요. 작업을 이어서 수행하는 코딩 에이전트(coding agent)의 새 모델이며, Devin Desktop과 CLI에서 제공돼요. 공식
회사 시험에서 SWE-2 medium의 첫 수정까지 중앙값은 18단계였어요. 이전 SWE-1.7은 48단계였죠. 평균 전체 단계도 127에서 53으로 줄었고, 비용은 81% 낮아졌어요. 같은 시험 묶음에서 측정한 결과예요. 공식
짧게 일해도 제대로 고쳤을까요
성능 평가 시험인 벤치마크(benchmark)는 시험지와 비슷해요. 어떤 문제를 넣느냐에 따라 잘하는 모델이 달라져요. 공식 표에서도 SWE-2의 Terminal-Bench 4 점수는 27.3%로 Fable 5.1의 55.8%보다 낮아요. 공식
| 확인할 항목 | 독자가 볼 의미 |
|---|---|
| 수정까지 걸린 단계 | 준비에 쓰는 작업량 |
| 시험의 채점 기준 | 무엇을 성공으로 보는지 |
| 사람이 다시 고친 시간 | 실제 업무에 남는 비용 |
FrontierCode는 실제 공개 저장소의 코드 변경 요청을 바탕으로 문제를 만들어요. 실행되는지만 보지 않고 코드 품질도 평가해요. 채점 기준표를 둔 실무 시험에 가까워요. 공식
인터넷 사용도 무조건 막지 않아요. API 문서를 읽는 것은 허용하되, 이미 공개된 정답 수정을 가져오는 실행은 탐지해 0점 처리해요. 설명서를 읽는 것과 해답지를 베끼는 것을 나누는 셈이에요. 공식
내 작업 한 묶음으로 비교해 보세요
Cognition의 비교표는 모델마다 주로 쓰는 실행 도구를 적용하고 추론 강도 중 최고 점수를 보고해요. 모델 하나만 바꾼 동일 환경 실험으로 읽으면 안 돼요. 공식
자주 하는 버그 수정과 테스트 추가를 골라 시간, 통과 여부, 재수정 시간을 적어 보세요. 먼저 수정하는 능력이 내 저장소에서도 도움이 되는지 판단할 수 있어요.







댓글
로그인 없이 닉네임과 비밀번호만으로도 남길 수 있어요.
로그인하면 비밀번호 없이 쓰고 지울 수 있어요.
댓글을 불러오는 중입니다…
댓글 남기기