무슨 일인가요
Meta AI Research는 9월 2일 Muse Spark 1.3을 공개했습니다. 공식 글은 "더 똑똑하고 실제로 더 쓸모 있는" 모델이라며 "개인 초지능(personal superintelligence)"을 향한 진전이라고 표현합니다. 공식 Muse Spark 1.2의 후속으로, Muse Code(macOS·Linux 설치 스크립트)와 Meta Model API에서 바로 쓸 수 있습니다. 공식
이번 버전의 핵심은 벤치마크보다 행동입니다. Meta는 "모호한 프롬프트에는 명확히 되묻고, 막히면 사용자의 도움을 구하며, 중대한 행동 전에는 확인한다"고 썼고, "자기가 할 수 있는 것과 없는 것, 아는 것과 모르는 것을 더 잘 파악해, 장애물에 부딪히면 결과를 지어내는 대신 그 사실을 알린다"고 설명했습니다. 공식 긴 스레드 하나에서 여러 워크플로를 동시에 굴리며 장기 작업을 이어 가도록 설계했고, 적대적 입력과 프롬프트 인젝션에 대한 저항도 강화했다고 밝혔습니다. 공식
MUSE SPARK 1.3 · 행동 변화
덜 부르고, 덜 쓰고, 모르면 묻는다
코딩에서 툴 호출 약 20%, 토큰 약 25% 감소 (1.2 대비)
모호하면 되묻고, 막히면 도움 요청, 중대한 행동 전 확인
장애물을 만나면 결과를 지어내지 않고 보고
적대적 입력·프롬프트 인젝션 저항 강화
출처: Meta AI Research 공식 블로그 (2026-09-02)
숫자로 보면
가격은 1.2와 같습니다. OpenRouter 등록 기준 입력 $1.25, 출력 $4.25, 캐시 읽기 $0.15(100만 토큰당)이고 컨텍스트는 1,048,576토큰입니다. 보도 프롬프트와 출력을 Meta가 학습에 쓸 수 있는 Contributor 등급은 $0.10·$0.20입니다. 보도 같은 날 나온 Gemini 3.8 Flash의 도입 가격(입력 $0.75·출력 $3.75)과 나란히 놓으면 이렇습니다. 공식

- Muse Spark 1.3
- Muse Spark 1.3 Contributor
- Gemini 3.8 Flash (도입가)
| 항목 | Muse Spark 1.3 | Muse Spark 1.3 Contributor | Gemini 3.8 Flash (도입가) |
|---|---|---|---|
| 입력 | 1.25 | 0.10 | 0.75 |
| 출력 | 4.25 | 0.20 | 3.75 |
출처: OpenRouter 모델 페이지, Coursiv, Google Gemini API 가격 페이지 (2026-09-02)
벤치마크는 공식 글에 스코어카드 이미지로만 실려 있고 본문에는 숫자가 없습니다. 공식 보도가 옮긴 수치는 다음과 같습니다. 보도
| 벤치마크 | Muse Spark 1.3 | 비교 |
|---|---|---|
| DeepSWE v1.1 | 75.4 | Claude Opus 5 74.0, GPT-5.6 Sol 72.7 |
| Terminal-Bench 2.1 | 88.8 | GPT-5.6 Sol 88.8 (동률), Opus 5 86.7 |
| MRCR v2 (장문 검색) | 98.5 / 98.1 | 256K |
| OSWorld 2.0 | 66.9 (max) | xhigh 모드 57.2 |
| GDPval-AA v2 Elo | 1,754 (max) | xhigh 모드 1,709 |
| JobBench | 64.9 (max) | xhigh 모드 61.2 |
| Artificial Analysis 지능 지수 | 61 (xhigh) / 62 (max) | max는 프리뷰 기준 |
max 모드는 어디까지 열렸나
여기서 쟁점이 생깁니다. Meta 공식 글은 "max 추론이 포함된 Muse Spark 1.3을 Muse Code와 Meta Model API에서 지금 쓸 수 있다"고 씁니다. 공식 반면 Coursiv는 지금 고객이 쓸 수 있는 것은 xhigh 설정이고, 가장 높은 점수를 낸 max는 파트너 대상 제한 프리뷰로 "추가 안전성 테스트 뒤 곧" 제공된다고 정리했습니다. 보도 MarkTechPost도 max 모드가 "안전성 테스트 게이트에 걸려 있다"고 썼습니다. 보도 어느 쪽이 맞는지는 실제 API에서 max 옵션을 호출해 확인하는 수밖에 없습니다. 추정
비용 쪽도 한 번 더 볼 필요가 있습니다. Coursiv에 따르면 Artificial Analysis 지수에서 xhigh 등급의 작업당 비용은 $0.55인데, 1.2보다 작업당 입력 토큰을 57% 더 써서 토큰 단가는 낮아도 작업당 비용은 오히려 늘 수 있습니다. 보도 Contributor 등급에는 분당 100건 요청 제한이 붙고, Meta AI 책임자 Alexandr Wang은 개발자 가운데 의미 있는 두 자릿수 비율이 이 등급을 고른다고 Axios에 말했다고 합니다. 보도
무엇을 보면 되나요
- Muse Code 사용자: 툴 호출과 토큰이 줄어든다는 주장은 코딩 작업 기준입니다. 같은 작업을 1.2와 1.3으로 돌려 실제 토큰 사용량을 비교해 보세요.
- API 도입 검토 팀: Contributor 등급은 값이 12분의 1 수준이지만 데이터 활용 조건이 붙습니다. 고객 데이터나 비밀 코드에는 표준 등급만 쓰는 것이 맞습니다. 추정
- 지켜볼 것: max 모드의 실제 제공 범위, 공식 로드맵에 오른 "더 큰 모델"과 "오픈 가중치 릴리스"의 시점·라이선스.



