3개월의 기다림 끝에 DeepSeek V4 GA(정식판)가 2026년 7월 20일 정식 출시되었습니다. 본 글은 AI 개발자, 인디 개발자, 장문 컨텍스트 Agent 엔지니어, 예산에 민감한 AI 제품 팀을 대상으로 기술 아키텍처, 벤치마크 점수, 피크·오프피크 가격, GPT-5.6 / Claude Fable 5와의 횡단 비교, 그리고 7월 24일까지의 API 마이그레이션 다섯 가지 관점에서 종합적으로 해석합니다. 정식판 업그레이드가 가치 있는지, 상용 과금 체계에서 비용을 최소화하는 방법을 판단하는 데 도움이 됩니다.
01 DeepSeek V4 GA: 개발자가 직면하는 3가지 긴급 압박
4월 프리뷰판과 비교하면 GA 정식판은 Agent 역량, 수학 추론, 코드 생성의 전문적 강화에 더해 처음으로 피크·오프피크 차등 과금을 도입했습니다. 이는 DeepSeek가 「거의 무료」에서 규율 있는 상용 운영으로 나아가는 신호입니다. 기쁨과 함께 프로덕션 환경 개발자는 다음 페인포인트에 즉시 대응해야 합니다.
- API 마이그레이션 카운트다운: 구 모델 ID
deepseek-chat과deepseek-reasoner는 2026년 7월 24일 15:59 UTC(베이징 시간 7월 24일 23:59)에 영구 중단됩니다. 마이그레이션하지 않은 프로덕션 서비스는 즉시 중단됩니다. - 피크 과금 복잡도: 평일 09:00–12:00, 14:00–18:00(베이징 시간) 요금이 2배입니다. 24×7 Agent 파이프라인은 청구 모델 재설계가 필요합니다.
- 폐쇄형 플래그십이 가장 어려운 작업에서 여전히 선두: Claude Fable 5는 SWE-bench Pro에서 80.3%를 유지합니다. 리더보드만 쫓고 작업당 비용을 계산하지 않으면 과다 지불할 수 있습니다.
- 셀프호스팅 ≠ 제로 운영: MIT 오픈소스이지만 1.6T MoE 프로덕션 추론에는 전문 GPU 클러스터가 필요합니다. 대부분의 팀은 API를 사용하며 네트워크와 쿼터 리스크는 남습니다.
한 줄 요약: V4 프리뷰는 이미 강력했습니다. 정식판은 Agent·수학·코드 전문 강화에 더해 공식 상용 과금 체계를 갖추었습니다.
02 프리뷰에서 정식판까지: 타임라인과 기술 아키텍처 심층 분석
| 일자 | 이벤트 |
|---|---|
| 4월 24일 | V4 프리뷰 출시 + 오픈소스(MIT): V4-Pro(1.6T)와 V4-Flash(284B) |
| 5월 | V4-Flash와 V4-Pro 프로덕션 튜닝 버전 출시, API 정식 이용 가능 |
| 6월 | V4-Pro 출력 가격 영구 75% 인하($0.87/M tokens) |
| 6월 29일 | 전체 API 사용자에게 이메일: 7월 중순 GA, 최초 피크 과금 공개 |
| 7월 19일 | 다수 개발자 GA 그레이 테스트 자격 획득, 언론 「정식판 내일 출시 가능」 보도 |
| 7월 20일 | GA 정식판 출시(본 글 게시일) |
| 7월 24일 | 구 API deepseek-chat과 deepseek-reasoner 영구 중단 |
모델 패밀리 개요
| 사양 | V4-Pro | V4-Flash |
|---|---|---|
| 총 파라미터 | 1.6조(1.6T) | 2840억(284B) |
| 토큰당 활성 파라미터 | 490억(49B) | 130억(13B) |
| Transformer 레이어 | 61층 | 43층 |
| 컨텍스트 윈도우 | 1,000,000 tokens | 1,000,000 tokens |
| 최대 출력 | 384K tokens | 384K tokens |
| 정밀도 | FP4(전문가 가중치) + FP8(기타) | FP4 + FP8 혼합 |
| 사전학습 데이터 | 33T+ tokens | 32T+ tokens |
| 라이선스 | MIT | MIT |
핵심 아키텍처 혁신: 100만 token 컨텍스트를 지탱하는 이유
기존 Transformer는 KV Cache 메모리 소비가 컨텍스트 길이에 선형 증가합니다. DeepSeek V4는 3가지 핵심 혁신으로 이를 해결했습니다(Kimi K3의 KDA 경로와 달리 V4는 CSA + HCA 하이브리드 어텐션을 선택):
① 하이브리드 어텐션(CSA + HCA)——V2/V3 시대 MLA를 폐기하고 두 가지 새 메커니즘의 하이브리드를 채택합니다:
- 압축 희소 어텐션(CSA): KV 시퀀스를 Softmax 게이트 풀링으로 4배 압축한 뒤 FP4 「라이트닝 인덱서」로 top-k 희소 선택(Pro: top-1024, Flash: top-512), 최근 128 token 슬라이딩 윈도우 유지. 1M 컨텍스트에서 추론 FLOPs는 V3.2의 27%에 불과합니다.
- 고밀도 압축 어텐션(HCA): 토큰을 128배 압축해 전역 밀집 어텐션으로 장거리 의존성 포착. Flash는 처음 2층에서 HCA, 이후 CSA/HCA 교대.
- 종합 효과: 1M token 시나리오에서 KV Cache 메모리는 V3.2의 10%(Flash는 7%까지).
② 다양체 제약 하이퍼커넥션(mHC): 4채널 잔차 스트림을 도입하고 이중확률 행렬 제약(Birkhoff 다면체)을 만족하는 혼합 행렬로 61층 깊은 네트워크에서도 신호를 안정적으로 전파합니다.
③ Muon 옵티마이저: 학습 시 Muon(AdamW 아님)을 채택하고 뉴턴-슐츠 직교화로 그래디언트를 처리합니다. 수렴이 빠르고 학습이 안정적입니다.
3가지 추론 모드
| 모드 | 특징 | 적용 시나리오 |
|---|---|---|
| Non-think | 사고 연쇄 없음, 최고속 응답 | 간단한 Q&A, 라우팅 |
| Think High | 명시적 추론(사고 연쇄 태그) | 중간 복잡도 작업, 코드 디버깅 |
| Think Max | 최대 추론 깊이, 384K+ 컨텍스트 필요 | 복잡한 수학, 장체인 Agent |
공식 권장 샘플링 파라미터: temperature=1.0, top_p=1.0(전 모드 공통).
03 벤치마크: 오픈소스 1위 vs GPT-5.6 / Claude Fable 5
| 벤치마크 | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% ★ 오픈소스 최고 | 96.0% | 별도 미공개 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
SWE-bench Verified는 「실제 GitHub 저장소 버그 수정」 테스트입니다. 80.6%는 현재 오픈소스 모델 최고 점수로 Gemini 3.1 Pro와 동률입니다. SWE-bench Pro는 더 엄격하며 Claude Fable 5의 80.3%가 현재 선두입니다.
가성비 횡단 비교
Artificial Analysis 평가에 따르면: Claude Fable 5는 Strategy & Ops 지수 작업당 $3.48(점수 50). DeepSeek V4-Pro는 동종 작업당 $0.03(점수 38). V4-Flash는 6개 지수 카테고리 모두 작업당 $0.04 미만입니다. Fable 5 비용은 V4-Pro의 116배이며 점수는 약 12점(31%)만 높습니다.
| 차원 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 오픈소스 | ✅ MIT | ❌ 폐쇄형 | ❌ 폐쇄형 |
| 셀프호스팅 가능 | ✅ | ❌ | ❌ |
| 컨텍스트 윈도우 | 1M tokens | 미공개 | 1M tokens |
| API 출력가(오프피크) | $0.87/M | ~$15/M | $50/M |
| 피크 출력가 | $1.74/M | — | — |
| Agent 역량 | 강력, 멀티 Agent 오케스트레이션 | 강력 | 최강 |
| 권장 시나리오 | 예산 제한 / 프라이빗 배포 / 장문 컨텍스트 | 복잡 알고리즘 + 수학 추론 | 최고 코드 역량, 비용 무관 |
- 예산 제한 / 고빈도 호출 / 프라이빗 배포: V4-Pro 또는 V4-Flash 권장
- 최고 코드 역량, 비용 무관: Claude Fable 5(SWE-bench Pro 최고)
- 복잡 알고리즘 + 수학 추론: GPT-5.6 Sol / Ultra
- 초대규모 로그/문서 처리: V4-Flash 캐시 히트 입력 $0.0028/M만
04 DeepSeek V4 피크 과금 계산법: 전체 가격표와 비용 절감 전략
GA 버전에서 가장 주목받고 논쟁적인 변화——전력 시간대별 요금과 유사하게 피크 시간대(베이징 시간 평일 09:00–12:00, 14:00–18:00) 요금이 2배입니다.
| 모델 | 과금 항목 | 오프피크 | 피크 |
|---|---|---|---|
| V4-Pro | 입력(캐시 히트) | ¥0.025 / $0.0035 / 1M | 2배 |
| V4-Pro | 입력(캐시 미스) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 |
| V4-Pro | 출력 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 |
| V4-Flash | 입력(캐시 히트) | ¥0.02 / $0.0028 / 1M | 2배 |
| V4-Flash | 입력(캐시 미스) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 |
| V4-Flash | 출력 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 |
비용을 최대한 절감하는 4가지 방법:
- 비실시간 작업을 오프피크로: 배치 문서 처리, 데이터 라벨링, 코드 리뷰를 18:00 이후 또는 9:00 이전에 스케줄링
- 캐시 히트 활용: 반복 System Prompt로 Prompt Cache 구축. Flash 캐시 히트는 $0.0028/M로 거의 무료
- Flash로 라우팅: 간단한 의도 인식·라우팅 판단은 V4-Flash, 복잡한 추론은 V4-Pro로
- 청구 알림 사전 수신: DeepSeek은 과금 변경 24시간 전 이메일 알림을 약속
피크 시간에도 V4-Pro 출력가($1.74/M)는 Claude Opus 4.8($15/M)보다 8.6배 저렴하고 GPT-5.6 Sol(약 $15/M)과 동일한 배수입니다.
05 deepseek-chat 폐지: API 마이그레이션 6단계 실전(7월 24일 마감)
⚠️ 중요 경고: 구 모델명 deepseek-chat과 deepseek-reasoner는 2026년 7월 24일 15:59 UTC(베이징 시간 7월 24일 23:59)에 영구 중단됩니다.
| 구 모델명 | 신규 모델명 | 비고 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(비사고 모드) | 고속, 경량 작업에 적합 |
deepseek-reasoner | deepseek-v4-flash(사고 모드) | 또는 deepseek-v4-pro로 업그레이드해 더 강력한 추론 |
- 전체 저장소에서 구 모델명 검색: 코드 저장소, CI 설정, 환경 변수에서
deepseek-chat과deepseek-reasoner를 검색해 모든 호출 지점을 나열합니다. - 마이그레이션 대상 결정: 경량 대화는
deepseek-v4-flash(Non-think). 기존 reasoner 시나리오는 Flash 사고 모드 또는deepseek-v4-pro업그레이드. - OpenAI SDK 호출 업데이트:
model파라미터를 신규 이름으로 변경. 사고 모드는extra_body로 활성화. - Anthropic SDK 호환성 검증:
base_url은https://api.deepseek.com유지,model만 업데이트. - Staging 환경 부하 테스트: 7월 24일 전에 오프피크와 피크 모두에서 과금을 검증하고 Prompt Cache 히트율을 확인합니다.
- 프로덕션 전환 및 모니터링: 신규 모델명으로 카나리 배포, 오류율과 토큰 비용 모니터링. 마감일 전까지 롤백 창 유지.
# ❌ 구写法 (7월 24일 이후 무효)
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
# ✅ 신写法 — OpenAI SDK
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
# extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
# ✅ Anthropic SDK 호환
client = anthropic.Anthropic(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
message = client.messages.create(
model="deepseek-v4-pro",
max_tokens=4096,
messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)
06 인용 가능 기술 데이터, 요약 및 엔지니어링 권장사항
- SWE-bench Verified: 80.6%——현재 오픈소스 모델 최고 점수, Gemini 3.1 Pro와 동률
- 1M 컨텍스트 KV Cache: V3.2의 10%(Flash 7%), 추론 FLOPs는 V3.2의 27%
- V4-Pro 출력 가격: 오프피크 $0.87/M, 피크 $1.74/M——폐쇄형 플래그십의 약 1/10~1/100
- Artificial Analysis 작업당 비용: V4-Pro $0.03 vs Fable 5 $3.48(116배 차이)
- API 마이그레이션 마감: 2026-07-24 15:59 UTC
- 라이선스: MIT, 셀프호스팅 및 데이터 국내 보관 지원
의심의 여지 없이 DeepSeek V4 GA는 2026년 오픈소스 대규모 언어 모델 분야에서 가장 중요한 이정표 중 하나입니다. 그 가치는 Claude Fable 5나 GPT-5.6을 모든 어려운 작업에서 이기는 것(아직은 불가)에 있는 것이 아니라, 폐쇄형 플래그십의 1/10~1/100 비용으로 오픈소스 모델 중 논쟁의 여지 없는 최고 성능을 제공한다는 데 있습니다. 피크 과금은 비용 복잡도를 높이지만 본질적으로 여전히 매우 경쟁력 있습니다——「가격 파괴자」에서 「규칙 기반 상용 플랫폼」으로의 성숙 신호입니다.
아래는 주요 참고 출처입니다. 가격, 모델 역량, 마이그레이션 정책은 수시로 업데이트될 수 있으니 출시 후 링크를 다시 확인하세요.
공식 및 기술 문서:
arXiv:2606.19348 — DeepSeek V4 기술 논문
제3자 벤치마크 및 분석:
Artificial Analysis — 모델 가성비 평가
DeepSeek V4 Agent를 Xcode·Metal 툴체인과 함께 안정적인 물리 머신에서 장기 운영해야 하는 팀에게 순수 API 호출은 여전히 네트워크 지연과 쿼터 변동에 직면합니다. 공유 VM / 클라우드 가상 Mac은 Hypervisor 오버헤드와 iOS CI 호환성 문제가 있습니다. 프로덕션 환경에서 제로 오버헤드 Apple Silicon, 7×24 가동, 안정적 iOS CI/CD와 AI Agent 자동화(예: 베어메탈 Mac에서 Claude Code / Codex를 영구 실행하고 멀티모델 API 라우팅 연동)가 필요하다면 ZUKCLOUD 베어메탈 Mac mini 클라우드 노드가 일반적으로 더 통제 가능한 선택입니다——전용 물리 머신, 가상화 오버헤드 없음, 일/주/월 유연 과금. 가격과 주문을 확인하거나 베어메탈 아키텍처 선언과 DeepSeek 연산 인프라 글에서 Agent급 호스팅 로직을 참고하세요.
현재 deepseek-chat을 사용 중이라면 7월 24일 전에 API 마이그레이션을 완료하세요. 그렇지 않으면 서비스가 중단됩니다.