/ 블로그 / V4-Flash-0731
ENGINEERING BLOG · 2026.08.05

DeepSeek V4-Flash-0731 공식 출시:
파라미터 그대로, Agent 성능만 V4-Pro를 앞지르다

2026년 7월 31일 DeepSeek는 V4-Flash-0731을 공식 API 베타로 공개했습니다. 총 284B·활성 13B라는 4월 프리뷰와 동일한 아키텍처를 유지한 채 후처리(post-training)만 재실행했으며, 더 큰 V4-Pro 프리뷰를 여러 Agent·코딩 벤치마크에서 앞섰습니다. 반면 V4-Pro 공식판과 자체 Agent 프레임워크 Harness는 2026년 8월 5일 기준으로도 미공개입니다. 본 글은 Agent 파이프라인을 설계하는 AI 개발자, API 비용에 민감한 프로덕트 팀, 중국 오픈 웨이트 경쟁을 추적하는 기술 리더를 위해 공식 타임라인, Harness minimal mode 벤치 해석, Artificial Analysis 지수 50 대 Kimi K3 57, 입력 $0.14/$0.0028·출력 $0.28 요금을 정리합니다. 핵심 결론: DeepSeek는 「1위 점수」가 아니라 「충분한 지능 + 극단적 저가」로 승부하며, 중국 개발자들이 「斩杀线(킬 라인)」이라 부르는 가격 하한이 Kimi K3·Qwen3.8-Max 선형에도 직접 영향을 줍니다.

01

이번 업데이트는 새 모델 등장이 아니라 동일 Flash에 후처리를 갈아끼운 릴리스입니다. 그럼에도 7–8월 중국 LLM 릴리스 밀집 구간에서 파급력이 큽니다.

  • 4월 24일: V4 프리뷰와 MIT 오픈 웨이트(V4-Pro 1.6T/49B, V4-Flash 284B/13B, 100만 token 컨텍스트).
  • 7월 24일: 레거시 deepseek-chat / deepseek-reasoner 중단, V4 네이밍 전환.
  • 7월 27일: Kimi K3 2.8T 전체 가중치 Hugging Face 공개 — DeepSeek에 경쟁 압력.
  • 7월 31일: V4-Flash-0731 공식 API 베타, Hugging Face 가중치 동기화, changelog에서 Harness 최초 공개. API 전용, 앱·웹 채팅 미갱신.
  • 8월 3일: Alibaba Qwen3.8-Max GA — 「万亿参数 주간」 지속.
  • 8월 5일(집필 시점): V4-Pro 공식판·Harness 출시일 미확정. 「8월 10–20일 GA」 보도는 비공식 출처에 한정됩니다.

중국 개발자 커뮤니티는 DeepSeek의 「충분한 성능 + 바닥 가격」 조합을 斩杀线(zhǎn shā xiàn, 킬 라인)이라 부릅니다. 성능으로 확실히 앞서지 못하면서 가격도 못 내리면 시장 존재감을 잃는다는 임계값입니다. V4-Pro 지연 당시 창업가 Liang Wenfeng을 「梁白开(공약 공백)」이라 조롱하던 분위기가 Flash 성과 상회 이후 「梁圣(현인)」 쪽으로 되돌아간 것도, 커뮤니티 감정의 빠른 진자운동을 보여 줍니다. OpenAI GPT-5.6 Luna 대폭 인하 등 동시기 가격 조정도 이 맥락에서 읽을 수 있습니다.

02

DeepSeek-V4-Flash-0731 핵심 사양 (2026-07-31 공식판)
항목 V4-Flash-0731 V4-Pro (프리뷰만)
상태공식판 (2026-07-31)프리뷰 (4/24~, 공식판 미출시)
총/활성 파라미터284B / 13B (4월과 동일)1.6T / 49B
컨텍스트100만 token100만 token
API 입력 (캐시 미스 / 히트)$0.14 / $0.0028 (100만 token)$0.435 / $0.003625
API 출력$0.28 / 100만 token$0.87
라이선스MIT (오픈 웨이트)MIT
Terminal Bench 2.0 (DeepSeek 자체·Harness minimal)82.767.9 (프리뷰)
Artificial Analysis Intelligence Index50 (제3자)
Harness7/31 changelog 최초 공개, minimal mode 벤치 사용, 본체 미출시 (8/5 기준)

Agent 계열 점수(Terminal Bench 2.0 등)는 DeepSeek 자체 Harness minimal mode로 측정되었습니다. 공식 문서도 「harness 선택에 극도로 민감」하다고 경고하므로 Claude Code 등으로 그대로 옮겨 비교할 수 없습니다.

03

작은 Flash가 큰 Pro 프리뷰를 넘은 이유. DeepSeek는 성능 향상 원인을 「파라미터 확대가 아닌 후처리 재실행」으로 명시했습니다. 2026년 하반기 경쟁 축은 단순 스케일보다 데이터 품질과 post-training 기법으로 이동하고 있음을 시사합니다.

아키텍처는 기술 보고서 『DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence』에 따르며 0731에서도 동일합니다.

  • 혼합 어텐션 (CSA + HCA): Compressed Sparse Attention과 Heavy Compressed Attention 결합. 대외적으로 DSA(DeepSeek Sparse Attention)로 설명되며, 100만 token에서 FLOPs를 V3.2 대비 27%, KV Cache를 10%(Flash 7%)까지 줄인다고 공식은 밝혔습니다.
  • mHC (Manifold-Constrained Hyper-Connections): Birkhoff 다면체 제약 4채널 잔차 혼합으로 61층 규모에서도 신호 안정화.
  • Muon Optimizer: AdamW 대신 Newton–Schulz 직교화 그래디언트로 수렴 속도·안정성 개선.

Harness minimal mode. 7월 31일 changelog에 처음 등장한 DeepSeek Harness는 파일 I/O·도구 호출·다단계 엔지니어링을 처리하는 자체 Agent 실행 프레임워크로, Claude Code 대체를 목표로 합니다. V4-Flash-0731 Agent 벤치(Terminal Bench 2.0, Toolathlon 등)는 모두 미공개 Harness minimal mode, 추론 max, top_p=0.95, temperature=1.0 조건입니다. DeepSeek 스스로 「점수를 맹신하지 말라」고 한 부분은 벤더 자체 보고 + 특정 프레임워크 결과로 분리해야 합니다.

실전에서는 해외 개발자 커뮤니티에서 입력 캐시 히트율 저하, 안전 분류기 타임아웃 피드백도 보고되었습니다. 벤치 상승과 운영 마찰은 별개로 봐야 합니다.

04

중국 오픈 웨이트 주력 모델 비교 (2026년 8월 초)
모델 총/활성 파라미터 입력/출력 (100만 token) AA Intelligence Index AA 작업당 평균 비용
DeepSeek V4-Flash-0731 284B / 13B $0.14 (미스) / $0.28 50 ~$0.03
Kimi K3 2.8T / ~104B (추정) $3.00 / $15.00 57 ~$0.86
Qwen3.8-Max 2.4T / 95B $2.00 / $6.00 미수록 (집필 시점) 미수록
GPT-5.6 Sol 비공개 Flash 대비 +9pt 이상 ~$1.86
Claude Fable 5 비공개 Flash 대비 +9pt 이상 ~$3.15

Artificial Analysis 독립 지수에서 V4-Flash(50)는 Kimi K3(57)보다 낮습니다. 그러나 작업당 비용은 Kimi의 약 1/29, Claude Fable 5의 약 1/105입니다. DeepSeek는 「최강」이 아니라 대량 Agent 호출·배치 처리용 가격 파괴를 노립니다.

프로덕션 API 선형 전에 다음 6단계를 권장합니다.

  1. 워크로드 분류: 고빈도 라우팅·배치 요약은 Flash, 깊은 추론·세계 지식은 V4-Pro 프리뷰 또는 상위 클로즈드 모델을 검토합니다.
  2. Harness 의존 벤치 분리: Terminal Bench 2.0의 82.7은 minimal mode 전제입니다. Claude Code / OpenClaw / Cursor에서 동일 A/B 테스트가 필요합니다.
  3. 캐시 히트율 시뮬레이션: 입력 $0.14와 $0.0028 차이는 약 50배입니다. Agent 루프에서 캐시가 안 먹히면 斩杀线 가격 이점이 사라집니다.
  4. 레거시 model명 점검: deepseek-chat은 7/24 중단됐습니다. deepseek-v4-flash가 0731 빌드를 가리키는지 SDK 기본값을 확인합니다.
  5. 3사 TCO 병렬 비교: 월 10억 input·2억 output token 가정 시 Flash 출력 $0.28은 Qwen3.8-Max($6)·Kimi K3($15)보다 한 자릿수 이상 저렴하지만 AA 지수 7pt 격차가 있습니다.
  6. Agent 실행 환경 고정: API 선형과 병행해 Claude Code 등 로컬 연동 Mac이 가상화로 끊기면 어떤 모델도 프로덕션에서 못 씁니다. 요금 페이지에서 베어메탈 Mac mini 노드를 확인하세요.

05

V4-Flash-0731은 「싼 Flash」 이상의 의미를 갖습니다. 후처리만으로 Pro 프리뷰를 넘긴 사실은 파라미터 경쟁 종료 신호이고, Harness 미공개·V4-Pro 공식판 대기·벤치의 프레임워크 의존이라는 3가지 불확실성은 8월 5일에도 남아 있습니다.

V4-Flash-0731은 새 모델인가요?

아닙니다. 284B/13B 아키텍처는 4월 프리뷰와 동일하며 성능 향상은 후처리 재실행 때문입니다. API deepseek-v4-flash는 자동으로 0731 빌드를 가리킵니다.

V4-Pro 공식판과 Harness는 언제 쓸 수 있나요?

2026년 8월 5일 기준 미공개입니다. DeepSeek changelog는 「가능한 한 빨리」만 명시했으며, 8월 10–20일 GA 등 구체 일정은 비공식 보도에 한정됩니다.

Kimi K3와 비교하면 어느 쪽이 강한가요?

Artificial Analysis Intelligence Index는 Kimi K3 57, V4-Flash 50입니다. 비용은 Flash가 약 1/29. 지능 상한은 Kimi, 대량 Agent 호출은 Flash가 현실적입니다.

DeepSeek Agent 벤치를 믿어도 되나요?

SWE-bench Verified 등 제3자 벤치는 참고 가치가 있으나, Terminal Bench 2.0 등은 미공개 Harness minimal mode 자체 측정입니다. 다른 도구로의 독립 재현을 기다려야 합니다.

Claude Opus 4.8 대비 얼마나 저렴한가요?

보도 기준 캐시 미스 입력 약 36배, 캐시 히트 입력 약 179배, 출력 약 89배 저렴하다고 알려졌습니다. 리스트 가격 비교이며 실제 TCO는 캐시·재시도에 좌우됩니다.

인용 가능 데이터 (2026-08-05):

  • 공식판: 2026-07-31 (V4-Flash-0731)
  • 파라미터: 284B 총 / 13B 활성 (유지)
  • 요금: 입력 $0.14 / $0.0028, 출력 $0.28 (100만 token)
  • Terminal Bench 2.0: 82.7 vs V4-Pro preview 67.9 (Harness minimal, 자체)
  • Artificial Analysis Index: 50 vs Kimi K3 57
  • 미공개: V4-Pro 공식판, Harness (8/5)

외부 참고 (게시 전 재확인 권장):

DeepSeek API 문서

Artificial Analysis — 독립 모델 벤치마크

Hugging Face — deepseek-ai 모델 카드

DeepSeek Platform — API 콘솔

API 단가 차이는 표에서 분명하지만, Harness 미공개 벤치를 그대로 믿는 선형, 캐시가 안 먹는 Agent 루프, 가상화 Mac에서 Claude Code가 끊기는 프로덕션이 겹치면 어떤 모델도 기대대로 동작하지 않습니다. ZUKCLOUD 베어메탈 Mac mini 클라우드 노드는 Hypervisor 손실 없이 Root 권한·7×24 Agent 자동화에 맞춘 고정 인프라입니다. 요금 페이지에서 플랜을 확인하거나 베어메탈 아키텍처 선언V4 GA 해설을 함께 읽어 보세요. 斩杀线 너머에서 이기는 팀은 최저가 API가 아니라 Agent 기반이 먼저 안정된 팀입니다.