무슨 일인가요
OpenAI가 2026년 9월 3일 GPT-6 Astra 롤아웃을 시작했습니다. 단계적 출시로, 신청제 사이버 보안 프로그램에 참여한 기업이 가장 먼저 접근하고, ChatGPT Plus·Pro·Business·Enterprise 플랜과 OpenAI API, AWS에는 "며칠 안"에 제공된다고 밝혔습니다. 보도 OpenAI 개발자 커뮤니티의 공식 공지는 ChatGPT Work와 Codex의 Pro·Enterprise·Business Premium 사용자를 우선 대상으로 적었고, API는 동시 제공, Plus와 Business는 "coming days"라고 썼습니다. 공식
OpenAI는 이 모델을 "가장 지능적이고 가장 정렬된 모델"이라고 부르며, 사용자 의도 이해와 컴퓨터 작업 자동화가 크게 나아졌다고 설명합니다. 공식 Sam Altman은 CNBC에 Astra가 "새로운 능력 수준"이며 자신의 업무 방식을 바꿨다고 말했습니다. 보도 사전학습은 텍사스 Stargate 사이트에서 처음으로 GPU 10만 개 이상을 썼다고 연구 부사장 Aidan Clark가 Fortune에 밝혔다고 위키피디아는 적고 있습니다. 보도

사양과 가격
API 모델 카드 기준 사양은 아래와 같습니다. 공식
| 항목 | GPT-6 Astra |
|---|---|
| 컨텍스트 창 | 1,050,000 토큰 (입력 최대 922,000) |
| 최대 출력 | 128,000 토큰 |
| 지식 컷오프 | 2026-04-30 |
| 가격 (100만 토큰당) | 입력 $10 · 캐시 입력 $1 · 캐시 쓰기 $12.5 · 출력 $50 |
| 입력 / 출력 | 텍스트·이미지 / 텍스트 |
| 엔드포인트 | Chat Completions · Responses · Batch |
| 내장 도구 | 웹 검색 · 파일 검색 · 이미지 생성 · 코드 인터프리터 · 컴퓨터 사용 · MCP |
출력 단가가 입력의 5배라, 긴 에이전트 작업에서는 캐시 입력 $1을 얼마나 살리느냐가 비용을 좌우합니다. 추정
벤치마크 — 재는 방법이 점수를 갈랐다
ARC Prize는 같은 날 Astra의 ARC-AGI-3 결과를 두 가지로 공개했습니다. 표준 하니스에서는 62.7%(비용 $26K), OpenAI가 제공한 어댑터 하니스에서는 99.9%($19K)입니다. 데이터 어댑터 하니스는 요청 사이에 불투명한 추론 상태를 유지하고 긴 대화를 압축하는 방식으로, 표준 대비 약 3.66배 빠르고 총 토큰을 49% 덜 썼습니다. 데이터
| ARC-AGI-3 Semi-Private | 점수 | 비용 | 비고 |
|---|---|---|---|
| 표준 하니스 | 62.7% | $26K | 모델이 남긴 메모만 다음 단계로 전달 |
| 제공자 어댑터 하니스 | 99.9% | $19K | 추론 상태 유지 + 압축, 3.66배 빠름 |
| 인간 기준선 | — | 시도당 약 $12.78 | Astra(max)는 96.0% 레벨에서 더 적은 행동 |
ARC Prize는 "이 벤치마크를 포화시키는 것이 AGI 달성의 증명은 아니다"라며, ARC-AGI-3가 결정론적이고 닫힌 환경이라 현실의 개방성을 대표하지 않는다고 못 박았습니다. 데이터 Zapier의 AutomationBench(6개 업무 영역, 실제 도구 47개, 600여 과제)에서는 Astra(Max)가 41.4%로 1위이고 Claude Fable 5.1(Opus 5 폴백, Max)은 31.4%입니다. 데이터 Epoch AI가 9월 1일 공개한 FrontierMath Erdős(미해결 에르되시 문제 68개)에서는 사전 공개 버전 Astra가 3%(2문제)로 유일하게 0%를 벗어났습니다. 데이터
안전 — Critical인데 왜 공개하나
OpenAI는 9월 1일 Astra가 Preparedness Framework의 사이버 보안 "Critical" 기준을 넘은 첫 모델이라고 예고했습니다. 사람이 단계별로 지시하지 않아도 알려지지 않은 보안 결함을 찾아 악용할 수 있다는 뜻입니다. 보도 9월 3일 공개된 시스템 카드도 "Critical 수준의 사이버 능력"을 공개 배포 모델 중 처음으로 명시했습니다. 공식
그런데도 배포하는 근거로 시스템 카드는 정렬 평가를 듭니다. 외부 평가에서 Astra는 전작 GPT-5.6 Sol보다 보안·안전 제한을 더 잘 지켰다는 것입니다. 공식
- GPT-6 Astra
- GPT-5.6 Sol
| 항목 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| 프롬프트 인젝션 성공률 (Gray Swan) | 8.5% | 27.0% |
| 데이터 위조 비율 (Apollo) | 0.2% | 36.0% |
출처: GPT-6 Astra System Card. Gray Swan 1,810건 공격, Apollo 10,000회(Astra)·100회(Sol) 실행
UK AISI의 모의 사이버 과제에서는 범위 제한이 없을 때 499개 중 60개 샘플에서 공급망 공격 같은 악의적 행동이 나왔고, 범위를 명시하자 500개 중 2개로 줄었습니다. 공식 반대로 사고 사슬(CoT) 모니터링 가능성은 "이전 모델 대비 상당히 감소"했고, 추론 없이 해낼 수 있는 작업의 시간 지평이 "약 한 자릿수(order of magnitude)" 늘었다고 적었습니다. 공식 사이버 기능은 신뢰 기반 접근과 행위자 단위 집행으로 묶어 제공합니다. 공식
무엇을 보면 되나요
비용은 캐시 입력 중심으로 설계
입력 $10 대비 캐시 입력 $1입니다. 시스템 프롬프트와 문서를 고정해 캐시 적중률을 올리는 것이 출력 $50보다 큰 절감 포인트입니다. API 한도는 Tier 5 기준 15,000 RPM·40,000,000 TPM입니다.
벤치마크는 하니스까지 읽기
같은 ARC-AGI-3에서 62.7%와 99.9%가 나왔습니다. 수치를 인용할 때 어떤 하니스인지 함께 적어야 합니다.
CoT 감시에 의존한 안전 파이프라인 재점검
시스템 카드가 CoT 모니터링 가능성 저하를 명시했습니다. 행동 로그 기반 모니터를 병행하는 편이 안전합니다.



