본문으로 건너뛰기

AI 값 또 내려갈까? 딥시크가 줄인 ‘임시 기억’

딥시크 V4.1-Flash는 토큰당 KV 캐시를 이전 Flash의 약 4분의 1로 줄였습니다. 출력 100만 토큰은 오프피크 0.6달러. 이런 효율화가 다른 회사의 가격까지 바꿨을까요?

AI피셜 편집부· 8분 읽기원문 보기 ↗
데이터센터 서버실에서 기술자가 노트북을 켜 놓고 서버 랙의 케이블을 정리하고 있다
사진: Derrick Coetzee · CC0

TL;DR요약

  • DeepSeek 이 9월 10일 DeepSeek-V4.1-Flash 를 MIT 라이선스로 공개했습니다. 글과 이미지를 함께 받고 100만 토큰까지 읽습니다.
  • 뼈대는 552B 인데 토큰 하나에 입력 8B, 출력 16B 만 켭니다. 토큰당 KV 캐시는 890바이트로 앞 세대의 약 4분의 1입니다.
  • DeepSeek 이 함께 실은 비교표에서 DeepSWE v1.1 74.2점, Terminal-Bench 2.1 90.6점으로 가장 높았습니다.
  • 출력 100만 토큰이 오프피크 0.6달러입니다. V4-Pro 요청은 9월 14일부터 Flash 로 넘어갑니다.
DeepSeek V4.1 Flash의 KV 캐시, 활성 파라미터, 입력 길이, 자체 벤치마크와 출력 요금을 설명하는 여섯 칸 만화.
AI가 긴 대화를 기억하는 데 드는 공간을 줄인 방식과 공개 요금입니다.· 그림: AI 생성 이미지 (OpenAI)

핵심 사실

공개일
2026-09-10
라이선스
MIT가중치까지 공개
뼈대 파라미터
552B토큰당 활성은 입력 8B · 출력 16B
컨텍스트
100만 토큰최대 출력 384K
토큰당 KV 캐시
890바이트V4-Flash 는 3,514바이트
출력 100만 토큰
0.6달러오프피크 기준, 피크는 1.2달러

무슨 일인가요

DeepSeek 이 2026년 9월 10일 DeepSeek-V4.1-Flash 를 공개했습니다. 글과 이미지를 함께 받아 글로 답하는 모델이고, 한 번에 100만 토큰까지 읽습니다. 가중치는 MIT 라이선스로 Hugging Face 에 올라가 있어 회사 제품에 그대로 넣어도 됩니다. 공식

눈에 띄는 것은 크기가 아니라 켜지는 양입니다. 뼈대 전체는 552B 인데, 토큰 하나를 처리할 때 실제로 계산에 참여하는 것은 입력을 읽는 단계에서 8B, 답을 쓰는 단계에서 16B 뿐입니다. 공식

DeepSeek 세대별 토큰당 전역 KV 캐시 크기를 비교한 가로 막대그래프. V1 은 389,120바이트, V3.2 는 48,068바이트, V4-Flash 는 3,514바이트, V4.1-Flash 는 890바이트다
DeepSeek 이 모델 카드에 실은 그래프입니다. 가로축은 토큰 하나를 기억해 두는 데 드는 바이트 수이고, 위에서 아래로 2023년 11월 V1 부터 이번 V4.1-Flash 까지 내려옵니다.· 사진: DeepSeek

AI의 임시 기억을 작게 만들었어요

모델은 앞서 읽은 문장을 매번 다시 계산하지 않으려고 중간 결과를 쌓아 둡니다. 이 임시 기억을 키·값 캐시(key-value cache, KV cache)라고 부릅니다. 대화가 길어질수록 쌓이는 양이 늘고, 그만큼 GPU 메모리를 차지합니다. 메모리가 꽉 차면 한 대의 서버가 동시에 받을 수 있는 요청이 줄어듭니다. 이 공간을 줄이면 같은 서버로 더 많은 요청을 처리할 여지가 생깁니다. 사용료에는 이 비용 외에도 계산량과 회사의 가격 정책 등이 함께 반영됩니다.

DeepSeek 은 토큰 하나당 이 임시 기억을 890바이트까지 줄였습니다. 지난 4월 V4-Flash 가 3,514바이트였으니 약 4분의 1이고, 2023년 11월 V1 의 389,120바이트와 견주면 437분의 1입니다. 공식

890바이트

토큰 하나를 기억하는 데 드는 용량

DeepSeek-V1 은 389,120바이트였습니다

줄인 방법은 구조를 바꾼 것입니다. 40층을 20층 인코더와 20층 디코더로 나눈 뒤(회사는 이 구조를 Causal Encoder-Decoder 라고 부릅니다), 디코더가 쓸 임시 기억을 층마다 따로 만들지 않고 인코더의 마지막 결과에서 한 번에 뽑아 씁니다. 여기에 임시 기억을 4비트로 눌러 담는 방식을 더했습니다. 공식

값은 3분의 1 아래로

모델입력 100만 토큰 (캐시 미스)출력 100만 토큰
DeepSeek V4.1-Flash0.15달러0.6달러
DeepSeek V4-Pro0.66달러1.98달러

오프피크 기준이고, 피크 시간(주중 UTC 01시부터 04시, 06시부터 10시)에는 두 배를 받습니다. 이미 읽은 내용을 다시 보낼 때 붙는 캐시 히트 값은 100만 토큰에 0.003달러입니다. 공식

DeepSeek 은 V4-Pro 를 거두는 중입니다. 2026년 9월 14일부터 V4-Pro 로 보낸 요청은 Flash 로 넘어가고 Flash 값으로 청구됩니다. 공식

이긴 곳과 뒤진 곳

네 가지 에이전트 벤치마크에서 DeepSeek-V4.1-Flash 와 Kimi-K3, GLM-5.3, Opus 5, GPT-5.6 Sol 의 점수를 비교한 막대그래프
같은 모델 카드에 실린 비교표입니다. 네 항목 중 셋에서 V4.1-Flash 가 가장 높지만, 맨 왼쪽 Terminal-Bench 3.0 에서는 Opus 5 가 43.3점으로 앞섭니다. 비교 대상과 항목은 DeepSeek 이 골랐습니다.· 사진: DeepSeek

코드 저장소를 고치는 DeepSWE v1.1 에서 74.2점, 터미널 작업을 시키는 Terminal-Bench 2.1 에서 90.6점을 받았습니다. 같은 표의 Opus 5 는 각각 74.0점과 89.1점입니다. 프로그래밍 경진 대회 점수인 Codeforces 레이팅은 3471 로, 앞 세대인 V4-Pro 의 3348 을 넘었습니다. 이 항목에는 다른 회사 모델의 값이 실려 있지 않습니다. 데이터

여러 단계를 길게 이어 가는 작업에서는 격차가 반대로 벌어집니다. Terminal-Bench 3.0 은 30.0점으로 Opus 5 의 43.3점에 못 미치고, 4.0 은 31.2점 대 51.8점입니다. 전문가 시험 문제를 푸는 HLE 도 36.8점으로 Opus 5 의 56.3점과 차이가 큽니다. 데이터

이 기술이 다른 회사 AI도 싸게 만들었을까요?

딥시크의 효율화 방식이 다른 공개 모델로 이어진 사례는 있습니다. Moonshot의 Kimi K2 기술 보고서는 DeepSeek V3와 비슷한 구조를 사용하며, 메모리를 압축하는 다중 헤드 잠재 어텐션(Multi-head Latent Attention, MLA)을 채택했다고 명시했습니다. 오늘 나온 V4.1의 새 방식이 아니라 앞선 세대 기술의 확산 사례입니다. 논문

OpenAI와 Anthropic의 가격도 실제로 내려간 적이 있습니다. OpenAI는 2025년 6월 o3 가격을 80% 내리면서 같은 모델의 추론 실행 체계를 최적화했다고 설명했습니다. Anthropic의 Opus는 4의 입력·출력 100만 토큰당 15·75달러에서, 새 모델 4.5의 5·25달러로 가격이 낮아졌습니다. 공식 그 가격 인하가 딥시크 기술을 가져온 결과라는 공개 근거는 확인되지 않았습니다. 효율화의 확산과 가격 인하는 각각 확인되지만, 두 회사에서의 직접적인 인과관계까지 확인된 것은 아닙니다.

2025년 1월의 첫 딥시크 충격과 비교하면 어떨까요? 당시에는 “AI 경쟁에 꼭 막대한 비용이 필요한가”라는 질문 자체가 새로웠습니다. 이번 충격이 더 작을 것이라는 예상은 가능하지만, 이번 발표가 실제로 시장에 덜 충격을 줬다고 판단할 자료는 아직 확보하지 못했습니다. 추정

자주 묻는 질문

가중치를 받아서 직접 돌릴 수 있나요?
MIT 라이선스로 Hugging Face 에 올라와 있어 상업적 사용까지 됩니다. 다만 뼈대가 552B 라 개인 장비에 올리기는 어렵습니다. 토큰당 켜지는 것이 8B 라는 말은 계산량이 적다는 뜻이지, 가중치를 적게 실어도 된다는 뜻이 아닙니다.
값이 이렇게 싼데 성능은 떨어지지 않나요?
벤치마크마다 갈립니다. 코드 수정과 터미널 작업에서는 DeepSeek 이 실은 비교표에서 가장 높았지만, 여러 단계를 오래 이어 가는 Terminal-Bench 3.0·4.0 에서는 Opus 5 에 10점 이상 뒤집니다.
지금 쓰는 V4-Pro 는 어떻게 되나요?
DeepSeek 은 V4-Pro 를 단계적으로 거둔다고 밝혔습니다. 2026년 9월 14일부터 V4-Pro 로 보낸 요청은 Flash 모델로 넘어가고 Flash 값으로 청구됩니다.

출처 · 7

  1. 1Kimi K2 Technical Report — Architecture논문arxiv.org/html/2507.20534v1
  2. 2o3 is 80% cheaper (OpenAI, 2025-06-10)공식 발표community.openai.com/t/o3-is-80-cheaper-and-introducing-o3-pro/1284925
  3. 3Introducing Claude 4 (Anthropic, 2025-05-22)공식 발표www.anthropic.com/news/claude-4
  4. 4Introducing Claude Opus 4.5 (Anthropic, 2025-11-24)공식 발표www.anthropic.com/news/claude-opus-4-5
  5. 52025년 1월 딥시크 발표 뒤 미국 증시 (AP)보도apnews.com/article/52c54e361616509280bd2775674b6b4b
  6. 6DeepSeek-V4.1-Flash 모델 카드 (Hugging Face)공식 발표huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
  7. 7DeepSeek API 요금표공식 발표api-docs.deepseek.com/quick_start/pricing

이 글의 마크다운 원문: /posts/deepseek-v4-1-flash-kv-cache/md/ · 인용 시 출처를 “AI피셜”으로 표기해 주세요.

이 글이 도움이 됐다면 추천해 주세요.

동료에게도 보내 주세요.

댓글

로그인 없이 닉네임과 비밀번호만으로도 남길 수 있어요.

로그인하면 비밀번호 없이 쓰고 지울 수 있어요.

댓글을 불러오는 중입니다…

댓글 남기기

나중에 이 댓글을 지울 때 씁니다.

1000자까지 쓸 수 있습니다. 서식 없이 평문으로 보입니다.

AI피셜 주간 하이라이트

한 주 동안 AI 소식에서 중요한 것만 골라 월요일 아침에 보내드릴게요

같은 태그·카테고리의 글을 골랐습니다.

왼쪽의 코드 편집기 창에서 라임색 화살표가 오른쪽 영상 편집 타임라인으로 이어지고, 타임라인 위에 로봇 손이 놓인 일러스트
활용·도구· 11

FFmpeg를 쥔 코딩 에이전트, 엿새 만에 별 781개

ffmpeg-skill 은 코딩 에이전트에게 영상 편집 도구 39개를 쥐여 주는 스킬입니다. 코드로 영상을 만드는 Remotion, 가진 소재를 조립하는 Hyperframe 까지 세 갈래를 갈라 정리했습니다.

  • #영상 편집
  • #에이전트
  • #오픈소스
K2 Horizon을 만든 IFM의 모기관 MBZUAI 캠퍼스의 황금빛 다목적 홀 건물
오픈소스· 6

K2 Horizon — 0.9B부터 375B까지 '완전 개방' 모델

MBZUAI 산하 IFM이 9월 3일 K2 Horizon 패밀리를 Apache 2.0으로 공개했습니다. 375B MoE 플래그십의 벤치마크와 가중치·데이터·코드·체크포인트 공개 범위를 정리했습니다.

  • #오픈소스
  • #IFM
  • #K2 Horizon