본문으로 건너뛰기

Meta Muse Spark 1.3 — 툴 호출 20% 적은 에이전트

Meta가 9월 2일 Muse Spark 1.3을 Muse Code와 Meta Model API에 올렸습니다. 1.2 대비 툴 호출 20%·토큰 25% 절감, 되묻는 행동 변화, 가격과 max 모드 쟁점을 정리했습니다.

AI피셜 편집부· 3분 읽기원문 보기 ↗
해커톤 행사장에서 노트북 키보드로 코드를 입력하는 개발자
사진: Gaelle Berton · CC BY-SA 3.0

핵심 답변

Meta는 2026년 9월 2일 Muse Spark 1.3을 공개하며 코딩 작업에서 1.2 대비 툴 호출 약 20%, 토큰 약 25%를 덜 쓰고, 모호한 지시에는 되묻고 중대한 행동 전에 확인하도록 훈련했다고 밝혔습니다. 가격은 입력 $1.25·출력 $4.25(100만 토큰당)로 1.2와 같고 컨텍스트는 1M 토큰이며, 최고 점수를 낸 max 추론 모드의 제공 범위를 두고 공식 글과 보도가 엇갈립니다.

TL;DR세 줄 요약

  • Muse Spark 1.3은 Muse Code와 Meta Model API에서 9월 2일 제공을 시작했고, 가중치는 비공개입니다.
  • 코딩에서 툴 호출 약 20%·토큰 약 25% 절감, 프롬프트 인젝션 저항 강화, 막히면 결과를 지어내지 않고 보고하도록 훈련했다는 것이 공식 설명입니다.
  • 가격은 입력 $1.25·출력 $4.25, 캐시 입력 $0.15이며, 데이터 활용에 동의하는 Contributor 등급은 $0.10·$0.20입니다.
  • 보도된 스코어카드 수치는 DeepSWE v1.1 75.4, Terminal-Bench 2.1 88.8 등이지만 상당수가 max 모드 기준이고, 널리 풀린 것은 xhigh 모드라는 지적이 있습니다.

핵심 사실

발표일
2026-09-02Meta AI Research 블로그
가격
$1.25 / $4.25입력/출력, 100만 토큰당 (OpenRouter 등록 기준)
Contributor 등급
$0.10 / $0.20프롬프트·출력이 Meta 제품 개선에 쓰일 수 있음 (보도)
컨텍스트
1,048,576 토큰
효율
툴 호출 약 -20%, 토큰 약 -25%1.2 대비, 코딩 작업, Meta 발표
제공 경로
Muse Code · Meta Model APIdev.meta.ai

무슨 일인가요

Meta AI Research는 9월 2일 Muse Spark 1.3을 공개했습니다. 공식 글은 "더 똑똑하고 실제로 더 쓸모 있는" 모델이라며 "개인 초지능(personal superintelligence)"을 향한 진전이라고 표현합니다. 공식 Muse Spark 1.2의 후속으로, Muse Code(macOS·Linux 설치 스크립트)와 Meta Model API에서 바로 쓸 수 있습니다. 공식

이번 버전의 핵심은 벤치마크보다 행동입니다. Meta는 "모호한 프롬프트에는 명확히 되묻고, 막히면 사용자의 도움을 구하며, 중대한 행동 전에는 확인한다"고 썼고, "자기가 할 수 있는 것과 없는 것, 아는 것과 모르는 것을 더 잘 파악해, 장애물에 부딪히면 결과를 지어내는 대신 그 사실을 알린다"고 설명했습니다. 공식 긴 스레드 하나에서 여러 워크플로를 동시에 굴리며 장기 작업을 이어 가도록 설계했고, 적대적 입력과 프롬프트 인젝션에 대한 저항도 강화했다고 밝혔습니다. 공식

MUSE SPARK 1.3 · 행동 변화

덜 부르고, 덜 쓰고, 모르면 묻는다

  1. 코딩에서 툴 호출 약 20%, 토큰 약 25% 감소 (1.2 대비)

  2. 모호하면 되묻고, 막히면 도움 요청, 중대한 행동 전 확인

  3. 장애물을 만나면 결과를 지어내지 않고 보고

  4. 적대적 입력·프롬프트 인젝션 저항 강화

출처: Meta AI Research 공식 블로그 (2026-09-02)

숫자로 보면

가격은 1.2와 같습니다. OpenRouter 등록 기준 입력 $1.25, 출력 $4.25, 캐시 읽기 $0.15(100만 토큰당)이고 컨텍스트는 1,048,576토큰입니다. 보도 프롬프트와 출력을 Meta가 학습에 쓸 수 있는 Contributor 등급은 $0.10·$0.20입니다. 보도 같은 날 나온 Gemini 3.8 Flash의 도입 가격(입력 $0.75·출력 $3.75)과 나란히 놓으면 이렇습니다. 공식

서버 랙이 양옆으로 늘어선 데이터센터 통로
토큰 단가가 낮아도 작업당 토큰이 늘면 청구서는 늘어납니다. 사진은 버지니아 공대의 데이터센터입니다.· 사진: Christopher Bowns · CC BY-SA 2.0
100만 토큰당 가격 (달러)
0.001.252.503.755.00입력출력1.254.250.100.200.753.75
  • Muse Spark 1.3
  • Muse Spark 1.3 Contributor
  • Gemini 3.8 Flash (도입가)
100만 토큰당 가격 (달러)
항목Muse Spark 1.3Muse Spark 1.3 ContributorGemini 3.8 Flash (도입가)
입력1.250.100.75
출력4.250.203.75

출처: OpenRouter 모델 페이지, Coursiv, Google Gemini API 가격 페이지 (2026-09-02)

벤치마크는 공식 글에 스코어카드 이미지로만 실려 있고 본문에는 숫자가 없습니다. 공식 보도가 옮긴 수치는 다음과 같습니다. 보도

벤치마크Muse Spark 1.3비교
DeepSWE v1.175.4Claude Opus 5 74.0, GPT-5.6 Sol 72.7
Terminal-Bench 2.188.8GPT-5.6 Sol 88.8 (동률), Opus 5 86.7
MRCR v2 (장문 검색)98.5 / 98.1256K512K / 512K1M 토큰 구간
OSWorld 2.066.9 (max)xhigh 모드 57.2
GDPval-AA v2 Elo1,754 (max)xhigh 모드 1,709
JobBench64.9 (max)xhigh 모드 61.2
Artificial Analysis 지능 지수61 (xhigh) / 62 (max)max는 프리뷰 기준

max 모드는 어디까지 열렸나

여기서 쟁점이 생깁니다. Meta 공식 글은 "max 추론이 포함된 Muse Spark 1.3을 Muse Code와 Meta Model API에서 지금 쓸 수 있다"고 씁니다. 공식 반면 Coursiv는 지금 고객이 쓸 수 있는 것은 xhigh 설정이고, 가장 높은 점수를 낸 max는 파트너 대상 제한 프리뷰로 "추가 안전성 테스트 뒤 곧" 제공된다고 정리했습니다. 보도 MarkTechPost도 max 모드가 "안전성 테스트 게이트에 걸려 있다"고 썼습니다. 보도 어느 쪽이 맞는지는 실제 API에서 max 옵션을 호출해 확인하는 수밖에 없습니다. 추정

비용 쪽도 한 번 더 볼 필요가 있습니다. Coursiv에 따르면 Artificial Analysis 지수에서 xhigh 등급의 작업당 비용은 $0.55인데, 1.2보다 작업당 입력 토큰을 57% 더 써서 토큰 단가는 낮아도 작업당 비용은 오히려 늘 수 있습니다. 보도 Contributor 등급에는 분당 100건 요청 제한이 붙고, Meta AI 책임자 Alexandr Wang은 개발자 가운데 의미 있는 두 자릿수 비율이 이 등급을 고른다고 Axios에 말했다고 합니다. 보도

무엇을 보면 되나요

  • Muse Code 사용자: 툴 호출과 토큰이 줄어든다는 주장은 코딩 작업 기준입니다. 같은 작업을 1.2와 1.3으로 돌려 실제 토큰 사용량을 비교해 보세요.
  • API 도입 검토 팀: Contributor 등급은 값이 12분의 1 수준이지만 데이터 활용 조건이 붙습니다. 고객 데이터나 비밀 코드에는 표준 등급만 쓰는 것이 맞습니다. 추정
  • 지켜볼 것: max 모드의 실제 제공 범위, 공식 로드맵에 오른 "더 큰 모델"과 "오픈 가중치 릴리스"의 시점·라이선스.

자주 묻는 질문

Muse Spark 1.3은 오픈 가중치인가요?
아닙니다. 이번 릴리스는 API와 Muse Code로만 제공됩니다. Meta는 공식 글에서 '더 큰 모델과 Muse Spark 오픈 가중치 릴리스'를 로드맵에 올려 두었다고만 밝혔고, 버전이나 시점, 라이선스는 적지 않았습니다.
max 모드와 xhigh 모드는 무엇이 다른가요?
추론에 쓰는 계산량 설정입니다. 보도된 스코어카드에서 OSWorld 2.0은 max 66.9 대 xhigh 57.2, GDPval-AA v2 Elo는 1,754 대 1,709로 차이가 큽니다. Meta 공식 글은 'max 추론이 포함된 1.3을 제공한다'고 썼지만, 보도에 따르면 지금 고객이 쓸 수 있는 것은 xhigh이고 max는 파트너 대상 제한 프리뷰로 추가 안전성 테스트 뒤 제공된다고 합니다.
Contributor 등급은 무엇인가요?
같은 모델을 입력 $0.10·출력 $0.20에 쓰는 대신 프롬프트와 출력이 Meta의 모델·제품 개선에 사용될 수 있는 등급입니다. 고객 데이터나 비밀 코드를 다루는 작업에는 표준 등급을 쓰는 편이 안전합니다.

출처 · 5

  1. 1Introducing Muse Spark 1.3 (Meta AI Research 공식 블로그)공식 발표research.meta.ai/blog/introducing-muse-spark-1-3
  2. 2Muse Spark 1.3 — API Pricing & Providers (OpenRouter)데이터openrouter.ai/meta/muse-spark-1.3
  3. 3Gemini API 가격 (Google AI for Developers)공식 발표ai.google.dev/gemini-api/docs/pricing
  4. 4Meta Muse Spark 1.3: Benchmarks, Pricing, and the Price of Cheap Tokens (Coursiv)보도coursiv.io/blog/muse-spark-1-3
  5. 5Meta AI Released Muse Spark 1.3 (MarkTechPost)보도www.marktechpost.com/2026/09/03/meta-ai-released-muse-spark-1-3-an-agentic-coding-model-that-uses-20-fewer-tool-calls-and-25-fewer-tokens-than-muse-spark-1-2/

이 글의 마크다운 원문: /posts/meta-muse-spark-1-3/md/ · 인용 시 출처를 “AI피셜”으로 표기해 주세요.

이 글이 도움이 됐다면 동료에게 보내 주세요.

AI피셜 새 글 알림

새 글이 올라오면 메일로 알려드려요

매일 5편, 5분 브리프. 스팸 없이 새 글 소식만. 언제든 한 번에 해지.

같은 태그·카테고리의 글을 골랐습니다.

모델· 2

Lyria 3.5 공개 — 최대 3분 노래, 곡당 $0.08

Google이 9월 3일 Gemini API에 Lyria 3.5를 공개 프리뷰로 올리고 9월 4일 Gemini 앱에 넣었습니다. 길이·보컬·가격·제한을 정리했습니다.

  • #Google DeepMind
  • #Gemini
  • #모델 출시
모델· 4

GPT-6 Astra 출시 — 사이버 'Critical' 첫 공개 모델

OpenAI가 9월 3일 GPT-6 Astra 롤아웃을 시작했습니다. 컨텍스트 105만 토큰, 입력 $10·출력 $50, 사이버 'Critical'에 처음 닿은 모델의 사양과 안전 평가를 정리했습니다.

  • #OpenAI
  • #GPT-6
  • #모델 출시
모델· 3

Gemini 3.8 Flash 출시 — 같은 값, 추론·보안 강화

Google이 9월 2일 Gemini 3.8 Flash를 3.7과 같은 가격에 내놓고, 취약점 탐지·패치용 3.8 Flash Cyber는 Fairwind 프로그램으로 제한 공개했습니다. 수치와 조건을 정리했습니다.

  • #Gemini
  • #Google DeepMind
  • #모델 출시