/ 블로그 / DeepSeek V4
ENGINEERING BLOG · 2026.07.20

DeepSeek V4 정식 출시:
가격·아키텍처·GPT-5.6 성능 격차

3개월의 기다림 끝에 DeepSeek V4 GA(정식판)가 2026년 7월 20일 정식 출시되었습니다. 본 글은 AI 개발자, 인디 개발자, 장문 컨텍스트 Agent 엔지니어, 예산에 민감한 AI 제품 팀을 대상으로 기술 아키텍처, 벤치마크 점수, 피크·오프피크 가격, GPT-5.6 / Claude Fable 5와의 횡단 비교, 그리고 7월 24일까지의 API 마이그레이션 다섯 가지 관점에서 종합적으로 해석합니다. 정식판 업그레이드가 가치 있는지, 상용 과금 체계에서 비용을 최소화하는 방법을 판단하는 데 도움이 됩니다.

01

4월 프리뷰판과 비교하면 GA 정식판은 Agent 역량, 수학 추론, 코드 생성의 전문적 강화에 더해 처음으로 피크·오프피크 차등 과금을 도입했습니다. 이는 DeepSeek가 「거의 무료」에서 규율 있는 상용 운영으로 나아가는 신호입니다. 기쁨과 함께 프로덕션 환경 개발자는 다음 페인포인트에 즉시 대응해야 합니다.

  • API 마이그레이션 카운트다운: 구 모델 ID deepseek-chatdeepseek-reasoner2026년 7월 24일 15:59 UTC(베이징 시간 7월 24일 23:59)에 영구 중단됩니다. 마이그레이션하지 않은 프로덕션 서비스는 즉시 중단됩니다.
  • 피크 과금 복잡도: 평일 09:00–12:00, 14:00–18:00(베이징 시간) 요금이 2배입니다. 24×7 Agent 파이프라인은 청구 모델 재설계가 필요합니다.
  • 폐쇄형 플래그십이 가장 어려운 작업에서 여전히 선두: Claude Fable 5는 SWE-bench Pro에서 80.3%를 유지합니다. 리더보드만 쫓고 작업당 비용을 계산하지 않으면 과다 지불할 수 있습니다.
  • 셀프호스팅 ≠ 제로 운영: MIT 오픈소스이지만 1.6T MoE 프로덕션 추론에는 전문 GPU 클러스터가 필요합니다. 대부분의 팀은 API를 사용하며 네트워크와 쿼터 리스크는 남습니다.

한 줄 요약: V4 프리뷰는 이미 강력했습니다. 정식판은 Agent·수학·코드 전문 강화에 더해 공식 상용 과금 체계를 갖추었습니다.

02

DeepSeek V4 주요 타임라인 (2026)
일자 이벤트
4월 24일V4 프리뷰 출시 + 오픈소스(MIT): V4-Pro(1.6T)와 V4-Flash(284B)
5월V4-Flash와 V4-Pro 프로덕션 튜닝 버전 출시, API 정식 이용 가능
6월V4-Pro 출력 가격 영구 75% 인하($0.87/M tokens)
6월 29일전체 API 사용자에게 이메일: 7월 중순 GA, 최초 피크 과금 공개
7월 19일다수 개발자 GA 그레이 테스트 자격 획득, 언론 「정식판 내일 출시 가능」 보도
7월 20일GA 정식판 출시(본 글 게시일)
7월 24일구 API deepseek-chatdeepseek-reasoner 영구 중단

모델 패밀리 개요

V4-Pro vs V4-Flash 사양 비교
사양 V4-Pro V4-Flash
총 파라미터1.6조(1.6T)2840억(284B)
토큰당 활성 파라미터490억(49B)130억(13B)
Transformer 레이어61층43층
컨텍스트 윈도우1,000,000 tokens1,000,000 tokens
최대 출력384K tokens384K tokens
정밀도FP4(전문가 가중치) + FP8(기타)FP4 + FP8 혼합
사전학습 데이터33T+ tokens32T+ tokens
라이선스MITMIT

핵심 아키텍처 혁신: 100만 token 컨텍스트를 지탱하는 이유

기존 Transformer는 KV Cache 메모리 소비가 컨텍스트 길이에 선형 증가합니다. DeepSeek V4는 3가지 핵심 혁신으로 이를 해결했습니다(Kimi K3의 KDA 경로와 달리 V4는 CSA + HCA 하이브리드 어텐션을 선택):

① 하이브리드 어텐션(CSA + HCA)——V2/V3 시대 MLA를 폐기하고 두 가지 새 메커니즘의 하이브리드를 채택합니다:

  • 압축 희소 어텐션(CSA): KV 시퀀스를 Softmax 게이트 풀링으로 4배 압축한 뒤 FP4 「라이트닝 인덱서」로 top-k 희소 선택(Pro: top-1024, Flash: top-512), 최근 128 token 슬라이딩 윈도우 유지. 1M 컨텍스트에서 추론 FLOPs는 V3.2의 27%에 불과합니다.
  • 고밀도 압축 어텐션(HCA): 토큰을 128배 압축해 전역 밀집 어텐션으로 장거리 의존성 포착. Flash는 처음 2층에서 HCA, 이후 CSA/HCA 교대.
  • 종합 효과: 1M token 시나리오에서 KV Cache 메모리는 V3.2의 10%(Flash는 7%까지).

② 다양체 제약 하이퍼커넥션(mHC): 4채널 잔차 스트림을 도입하고 이중확률 행렬 제약(Birkhoff 다면체)을 만족하는 혼합 행렬로 61층 깊은 네트워크에서도 신호를 안정적으로 전파합니다.

③ Muon 옵티마이저: 학습 시 Muon(AdamW 아님)을 채택하고 뉴턴-슐츠 직교화로 그래디언트를 처리합니다. 수렴이 빠르고 학습이 안정적입니다.

3가지 추론 모드

V4 추론 모드와 적용 시나리오
모드 특징 적용 시나리오
Non-think사고 연쇄 없음, 최고속 응답간단한 Q&A, 라우팅
Think High명시적 추론(사고 연쇄 태그)중간 복잡도 작업, 코드 디버깅
Think Max최대 추론 깊이, 384K+ 컨텍스트 필요복잡한 수학, 장체인 Agent

공식 권장 샘플링 파라미터: temperature=1.0, top_p=1.0(전 모드 공통).

03

V4-Pro 핵심 벤치마크 데이터
벤치마크 DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified80.6% ★ 오픈소스 최고96.0%별도 미공개~69%
SWE-bench Pro55.4%80.3%78.1%69.2%
LiveCodeBench (Pass@1)93.5%88.1%87.4%83.2%
Codeforces Elo3,206
Terminal-Bench 2.183.9%88.0%85.1%82.7%

SWE-bench Verified는 「실제 GitHub 저장소 버그 수정」 테스트입니다. 80.6%는 현재 오픈소스 모델 최고 점수로 Gemini 3.1 Pro와 동률입니다. SWE-bench Pro는 더 엄격하며 Claude Fable 5의 80.3%가 현재 선두입니다.

가성비 횡단 비교

Artificial Analysis 평가에 따르면: Claude Fable 5는 Strategy & Ops 지수 작업당 $3.48(점수 50). DeepSeek V4-Pro는 동종 작업당 $0.03(점수 38). V4-Flash는 6개 지수 카테고리 모두 작업당 $0.04 미만입니다. Fable 5 비용은 V4-Pro의 116배이며 점수는 약 12점(31%)만 높습니다.

DeepSeek V4-Pro vs GPT-5.6 Sol vs Claude Fable 5 포지셔닝
차원 DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
오픈소스✅ MIT❌ 폐쇄형❌ 폐쇄형
셀프호스팅 가능
컨텍스트 윈도우1M tokens미공개1M tokens
API 출력가(오프피크)$0.87/M~$15/M$50/M
피크 출력가$1.74/M
Agent 역량강력, 멀티 Agent 오케스트레이션강력최강
권장 시나리오예산 제한 / 프라이빗 배포 / 장문 컨텍스트복잡 알고리즘 + 수학 추론최고 코드 역량, 비용 무관
  • 예산 제한 / 고빈도 호출 / 프라이빗 배포: V4-Pro 또는 V4-Flash 권장
  • 최고 코드 역량, 비용 무관: Claude Fable 5(SWE-bench Pro 최고)
  • 복잡 알고리즘 + 수학 추론: GPT-5.6 Sol / Ultra
  • 초대규모 로그/문서 처리: V4-Flash 캐시 히트 입력 $0.0028/M만

04

GA 버전에서 가장 주목받고 논쟁적인 변화——전력 시간대별 요금과 유사하게 피크 시간대(베이징 시간 평일 09:00–12:00, 14:00–18:00) 요금이 2배입니다.

V4-Pro / V4-Flash 피크·오프피크 과금 전체 가격표
모델 과금 항목 오프피크 피크
V4-Pro입력(캐시 히트)¥0.025 / $0.0035 / 1M2배
V4-Pro입력(캐시 미스)¥3.00 / $0.435 / 1M¥6.00 / $0.87
V4-Pro출력¥6.00 / $0.87 / 1M¥12.00 / $1.74
V4-Flash입력(캐시 히트)¥0.02 / $0.0028 / 1M2배
V4-Flash입력(캐시 미스)¥1.00 / $0.14 / 1M¥2.00 / $0.28
V4-Flash출력¥2.00 / $0.28 / 1M¥4.00 / $0.56

비용을 최대한 절감하는 4가지 방법:

  • 비실시간 작업을 오프피크로: 배치 문서 처리, 데이터 라벨링, 코드 리뷰를 18:00 이후 또는 9:00 이전에 스케줄링
  • 캐시 히트 활용: 반복 System Prompt로 Prompt Cache 구축. Flash 캐시 히트는 $0.0028/M로 거의 무료
  • Flash로 라우팅: 간단한 의도 인식·라우팅 판단은 V4-Flash, 복잡한 추론은 V4-Pro로
  • 청구 알림 사전 수신: DeepSeek은 과금 변경 24시간 전 이메일 알림을 약속

피크 시간에도 V4-Pro 출력가($1.74/M)는 Claude Opus 4.8($15/M)보다 8.6배 저렴하고 GPT-5.6 Sol(약 $15/M)과 동일한 배수입니다.

05

⚠️ 중요 경고: 구 모델명 deepseek-chatdeepseek-reasoner2026년 7월 24일 15:59 UTC(베이징 시간 7월 24일 23:59)에 영구 중단됩니다.

구 API에서 신규 모델로 마이그레이션 매핑
구 모델명 신규 모델명 비고
deepseek-chatdeepseek-v4-flash(비사고 모드)고속, 경량 작업에 적합
deepseek-reasonerdeepseek-v4-flash(사고 모드)또는 deepseek-v4-pro로 업그레이드해 더 강력한 추론
  1. 전체 저장소에서 구 모델명 검색: 코드 저장소, CI 설정, 환경 변수에서 deepseek-chatdeepseek-reasoner를 검색해 모든 호출 지점을 나열합니다.
  2. 마이그레이션 대상 결정: 경량 대화는 deepseek-v4-flash(Non-think). 기존 reasoner 시나리오는 Flash 사고 모드 또는 deepseek-v4-pro 업그레이드.
  3. OpenAI SDK 호출 업데이트: model 파라미터를 신규 이름으로 변경. 사고 모드는 extra_body로 활성화.
  4. Anthropic SDK 호환성 검증: base_urlhttps://api.deepseek.com 유지, model만 업데이트.
  5. Staging 환경 부하 테스트: 7월 24일 전에 오프피크와 피크 모두에서 과금을 검증하고 Prompt Cache 히트율을 확인합니다.
  6. 프로덕션 전환 및 모니터링: 신규 모델명으로 카나리 배포, 오류율과 토큰 비용 모니터링. 마감일 전까지 롤백 창 유지.
migrate_deepseek_v4.py
# ❌ 구写法 (7월 24일 이후 무효)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

# ✅ 신写法 — OpenAI SDK
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    # extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

# ✅ Anthropic SDK 호환
client = anthropic.Anthropic(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)
message = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)

06

  • SWE-bench Verified: 80.6%——현재 오픈소스 모델 최고 점수, Gemini 3.1 Pro와 동률
  • 1M 컨텍스트 KV Cache: V3.2의 10%(Flash 7%), 추론 FLOPs는 V3.2의 27%
  • V4-Pro 출력 가격: 오프피크 $0.87/M, 피크 $1.74/M——폐쇄형 플래그십의 약 1/10~1/100
  • Artificial Analysis 작업당 비용: V4-Pro $0.03 vs Fable 5 $3.48(116배 차이)
  • API 마이그레이션 마감: 2026-07-24 15:59 UTC
  • 라이선스: MIT, 셀프호스팅 및 데이터 국내 보관 지원

의심의 여지 없이 DeepSeek V4 GA는 2026년 오픈소스 대규모 언어 모델 분야에서 가장 중요한 이정표 중 하나입니다. 그 가치는 Claude Fable 5나 GPT-5.6을 모든 어려운 작업에서 이기는 것(아직은 불가)에 있는 것이 아니라, 폐쇄형 플래그십의 1/10~1/100 비용으로 오픈소스 모델 중 논쟁의 여지 없는 최고 성능을 제공한다는 데 있습니다. 피크 과금은 비용 복잡도를 높이지만 본질적으로 여전히 매우 경쟁력 있습니다——「가격 파괴자」에서 「규칙 기반 상용 플랫폼」으로의 성숙 신호입니다.

아래는 주요 참고 출처입니다. 가격, 모델 역량, 마이그레이션 정책은 수시로 업데이트될 수 있으니 출시 후 링크를 다시 확인하세요.

공식 및 기술 문서:

DeepSeek API 공식 문서

arXiv:2606.19348 — DeepSeek V4 기술 논문

제3자 벤치마크 및 분석:

Artificial Analysis — 모델 가성비 평가

HuggingFace — DeepSeek 모델 페이지

DeepSeek V4 Agent를 Xcode·Metal 툴체인과 함께 안정적인 물리 머신에서 장기 운영해야 하는 팀에게 순수 API 호출은 여전히 네트워크 지연과 쿼터 변동에 직면합니다. 공유 VM / 클라우드 가상 Mac은 Hypervisor 오버헤드와 iOS CI 호환성 문제가 있습니다. 프로덕션 환경에서 제로 오버헤드 Apple Silicon, 7×24 가동, 안정적 iOS CI/CD와 AI Agent 자동화(예: 베어메탈 Mac에서 Claude Code / Codex를 영구 실행하고 멀티모델 API 라우팅 연동)가 필요하다면 ZUKCLOUD 베어메탈 Mac mini 클라우드 노드가 일반적으로 더 통제 가능한 선택입니다——전용 물리 머신, 가상화 오버헤드 없음, 일/주/월 유연 과금. 가격주문을 확인하거나 베어메탈 아키텍처 선언DeepSeek 연산 인프라 글에서 Agent급 호스팅 로직을 참고하세요.

현재 deepseek-chat을 사용 중이라면 7월 24일 전에 API 마이그레이션을 완료하세요. 그렇지 않으면 서비스가 중단됩니다.