/ 블로그 / 가격 전쟁
ENGINEERING BLOG · 2026.08.17

DeepSeek가 API 요금을 최대 1,100% 올린 이유
중국 오픈웨이트 공세 직후, 청구서를 다시 짜는 법

닷새 안에 API 토큰을 사는 팀, 오픈웨이트를 호스팅하는 팀, 코딩 모델을 고르는 팀이 동시에 세 가지 모순된 신호를 받았습니다. DeepSeek는 일부 구간 API 요금을 최대 1,100% 올렸습니다. 같은 주 알리바바는 한 번도 열어 주지 않았던 2.4조 파라미터 플래그십을 오픈웨이트로 풀었습니다. 지푸 AI(Zhipu)는 GLM-5.3을 내놓아, 같은 기반 모델을 다시 학습하지 않고도 코딩 벤치를 약 6배 끌어올렸습니다. 본고는 타임라인, 요금표, 세 가지 전략, 6단계 청구서 재설계, FAQ를 한자리에 모읍니다. 흐름의 핵심은 단순합니다. 중국 랩은 이제 단가가 아니라 가격 결정력으로 경쟁합니다.

01

고통의 원인은 「또 모델이 나왔다」가 아닙니다. 요금, 라이선스, 성능 레버가 같은 주에 한꺼번에 바뀌었다는 점입니다. 헤드라인 배수는 구간을 섞고, 오픈웨이트는 상업 면허가 아니며, 같은 기반의 후훈련은 하룻밤에도 점수를 바꿉니다. 청구서, 컴플라이언스, 모델 선택을 모두 다시 짜야 하는 이유입니다.

  • 공식 피크가 리셀러에 집니다. DeepSeek를 돌리는 가장 싼 길이 더 이상 공식 피크 요금이 아닙니다.
  • 오픈웨이트, 맞춤 라이선스: 매출 선을 넘으면 별도 상업 허가를 협상해야 합니다.
  • 후훈련이 새 기반을 이깁니다. GLM-5.3은 7,430억 파운데이션을 다시 학습하지 않고도 코딩 점수를 올렸습니다.
  • 미국과 중국의 가격 방향이 반대입니다. 중국은 플래그십 가중치를 열고 상단 요금을 올리고, 미국 랩은 소비자 층을 무료·저가로 내립니다.
2026년 7–8월: 오픈웨이트, 요금 인상, 후훈련
날짜 사건
2026년 7월 16일 Moonshot AI가 Kimi K3(2.8조 파라미터) 오픈웨이트 공개, 미국 안보 검토를 유발
2026년 7월 30일 OpenAI가 최저 구간 GPT-5.6 Luna를 80% 인하
2026년 8월 2–3일 알리바바가 Qwen3.8-Max를 프리뷰한 뒤 호스팅 API로 출시
2026년 8월 6–7일 OpenAI가 Luna를 무료 기본값으로 두고 텍스트 채팅을 무제한 개방
2026년 8월 10일 메타가 Muse Glimmer(300억, Apache 2.0)를 공개하고 플래그십 Muse Spark 1.2 오픈웨이트를 예고
2026년 8월 12일 알리바바가 Qwen3.8-2.4T-A95B 오픈웨이트를 Hugging Face/ModelScope에 게시, xAI가 Grok 4.6 출시
2026년 8월 13일 DeepSeek-V4-Pro GA와 8월 17일 요금 인상 발표, 구글이 더 저렴한 Gemini 3.7 Flash 출시
2026년 8월 14일 지푸가 GLM-5.2와 같은 7,430억 기반을 재사용한 GLM-5.3 출시
2026년 8월 17일 베이징 시간 00:00 DeepSeek 신규 요금 적용

한 걸음 물러서면, 중국 랩이 요금을 올리고 플래그십 가중치를 여는 동안 미국 랩은 소비자 층을 인하하고 무료로 돌렸습니다. 같은 가격 전쟁의 양면입니다. 제품 맥락은 Qwen3.8-Max 출시, DeepSeek V4 GA, GPT-5.6 인하에서 이어집니다.

02

표부터 읽습니다. 피크는 베이징 시간 오전 9시–12시, 오후 2시–6시입니다. 「1,100%」, 「11배」, 「350%」는 모두 맞습니다. 다만 가리키는 과금 행이 다릅니다.

DeepSeek 요금 인상(8월 17일 베이징 00:00 적용, 100만 토큰당, 위안)
과금 항목 기존 요금 신규 오프피크 신규 피크 피크 인상폭
V4-Flash 캐시 히트(입력) ¥0.02 ¥0.05 ¥0.10 ~400%
V4-Flash 캐시 미스(입력) ¥1.0 ¥1.5 ¥3.0 200%
V4-Flash 출력 ¥2.0 ¥4.5 ¥9.0 350%
V4-Pro 캐시 히트(입력) ¥0.025 ¥0.15 ¥0.30 ~1,100%
V4-Pro 캐시 미스(입력) ¥3.0 ¥4.5 ¥9.0 200%
V4-Pro 출력 ¥6.0 ¥13.5 ¥27.0 350%

헤드라인 「1,100%」는 피크 시간 캐시 히트 입력에만 해당합니다. 원래 공짜에 가장 가깝던 구간입니다. 실제 청구서를 지배하는 출력은 350% 올랐습니다. 독립 비용 모델은 현실적인 헤비 워크로드(월 약 8,400만 토큰, 대부분 오프피크, 캐시 히트 절반)에서 청구액 상승이 약 1.8배에 가깝다고 봅니다. 체감은 분명하지만, 가장 자극적인 헤드라인보다는 낮습니다.

Qwen3.8-2.4T-A95B(Qwen3.8-Max 오픈웨이트) 핵심 스펙
항목 내용
파라미터 총 2.4조, 토큰당 활성 950억(MoE, 전문가 512, 라우팅 10 + 공유 1)
컨텍스트 창 오픈 체크포인트 기본 262,144 토큰, 약 101만까지 확장 가능. 호스팅 Max는 기본 100만
공개 일정 8월 2일 프리뷰 → 8월 3일 API 가동 → 8월 12일 오픈웨이트
API 요금(국제) 입력 $2/M, 출력 $6/M
라이선스 Apache 2.0이 아님. 맞춤 「Qwen3.8-Max License」
의미 알리바바가 Max급(플래그십) 모델을 오픈웨이트로 연 첫 사례. Qwen3.5/3.6/3.7 Max는 API 전용이었습니다
GLM-5.3 대 GLM-5.2: 같은 기반, 후훈련만(지푸 자체 측정)
벤치마크 GLM-5.2 GLM-5.3 변화
Terminal-Bench 3.0 4.6% 28.3% +23.7 pts
DeepSWE v1.1 46.2% 66.9% +20.7 pts
Agents' Last Exam (CLI) 23.8% 28.5% +4.7 pts
CyberGym 77.2% 84.5% +7.3 pts
AutomationBench 26.2% 48.2% +22.0 pts

위 수치는 지푸 자체 보고이며, 독립 제3자 재측정은 아직 공개되지 않았습니다. GLM-5.3은 Terminal-Bench 3.0에서 GPT-5.6 Sol(34.6%), Claude Fable 5(33.7%)에 뒤집니다. 오픈웨이트 상위권이지만, 프론티어 단독 승리는 아닙니다.

03

DeepSeek: 정액에서 시간대별 요금으로 — 전략 선회가 아니라 용량 문제

쉬운 오독은 「중국에서 가장 싸던 모델이 마진 압박에 굴복했다」입니다. 구조를 보면 반대입니다. 연산 제약을 요금표에 처음으로 드러낸 회사입니다. GPU 용량이 수요를 따라잡는 동안에는 항상 싼 정액이 고객 획득 도구로 통했습니다. 사용량이 지수로 늘고 용량이 따라가지 못하면 무언가는 명시되어야 합니다. 「유연한 워크로드 스케줄링을 권장한다」는 기업 화법은 「피크 시간 연산이 이제 부족하니, 부하를 직접 옮겨 달라」는 뜻입니다.

해외 보도가 거의 놓친 한 가지가 있습니다. 피크 시간에는 DeepSeek 공식 API가 GMI Cloud, Novita 등 여러 서드파티 리셀러보다 비쌉니다. 이들 리셀러는 현재 V4 Pro를 DeepSeek 신규 피크보다 낮게 게시합니다. 「공식 API가 DeepSeek를 돌리는 항상 가장 싼 길」이라는 전제는 처음으로 깨졌습니다.

알리바바: 오픈웨이트로 생태계 호의를 사고, 맞춤 라이선스로 매출 상한을 지킵니다

Qwen3.8-Max 오픈웨이트는 단순한 시혜가 아닙니다. 알리바바는 두 일을 동시에 했습니다. 2.4조 파라미터 체크포인트 전체를 무료 다운로드로 풀었고, 소형 Qwen에 쓰던 관대한 Apache 2.0이 아닌 맞춤 라이선스를 붙였습니다. 「Model-as-a-Service」 또는 「AI Work Assistant」 사업이 연속 12개월 매출 5,000만 달러를 넘으면 별도 상업 라이선스를 협상해야 하고, 월간 활성 사용자 1억 명 이상 또는 월 매출 2,000만 달러 이상 제품은 모델명을 눈에 띄게 표시해야 합니다.

논리는 분명합니다. 가중치를 풀어 개발자 마인드셰어를 얻고(특히 「중국산 모델」에 기업 구매자가 주저하는 해외에서), 그 위에 경쟁 추론 사업을 세울 수 있는 소수 회사에는 가격 레버리지를 남깁니다. 제한 없는 Apache 2.0으로 나가는 메타 Muse Glimmer와는 다른 베팅입니다. 직전 오픈웨이트 파도는 Kimi K3 전체 가중치 공개에서 확인할 수 있습니다.

죽일 소문이 하나 있습니다. 알리바바 라이선스가 미국, EU, 영국, 한국의 다운로드를 금지한다는 주장입니다. 사실이 아닙니다. 공개된 라이선스 본문에는 지리적·영토 조항이 전혀 없습니다. 공개 주기가 이처럼 빠를 때는 공지 스레드가 아니라 LICENSE 파일을 확인하는 데 몇 초면 충분합니다.

GLM-5.3: 새 기반이 아니라, 더 큰 후훈련 베팅

GLM-5.3에서 가장 흥미로운 사실은 점수가 아니라 방법입니다. GLM-5.2와 같은 7,430억 파라미터 기반, 재학습 없음, Terminal-Bench 3.0에서 약 6배(4.6% → 28.3%) 상승은 후훈련에서 강화 학습 환경을 키운 결과입니다. 사전학습 스케일링 법칙의 수익이 줄어들수록, 후훈련 RL 스케일은 새 파운데이션을 다시 학습하는 것보다 비용 하한이 훨씬 낮은 독립 성능 레버가 됩니다. 진입 장벽이 의미 있게 낮아집니다. OpenAI급 연산 예산이 없는 중위 랩도 에이전트·코딩 벤치 격차를 좁힐 수 있습니다.

PRICE-WAR-2026.LOG
# 세 랩, 세 수, 일주일의 가격 결정력
DeepSeek V4-Pro  : 싼 정액 → 피크/오프피크 (용량이 요금표에 드러남)
Qwen3.8-2.4T     : 첫 Max급 가중치 + 맞춤 라이선스
GLM-5.3          : 같은 743B 기반, 후훈련만
rumor            : 미·EU·영·한 지역 금지 — FALSE, 영토 조항 없음
note: 「중국 모델 = 최저가」는 더 이상 안전한 가정이 아님

04

랩은 하루 만에 새 요금표를 올릴 수 있습니다. 엔지니어링과 조달은 청구서, 라이선스, 추론 박스를 다시 짜야 합니다. 위 공개 숫자에 묶인 여섯 단계입니다.

  1. 공식 요금표를 자기 시간대에 먼저 맞춥니다. DeepSeek 피크는 베이징 시간 오전 9시–12시, 오후 2시–6시(UTC 01:00–04:00, 06:00–10:00)입니다. 미국·유럽 업무 시간은 대부분 오프피크에 떨어지고, 중국 주간은 피크에 앉습니다. 같은 표, 다른 청구서입니다.
  2. 과금 행을 셋으로 나눕니다. 「1,100%」만 보지 않습니다. 캐시 히트 입력은 비율이 가장 크고 절대 위안은 가장 작습니다. 실제 청구를 움직이는 것은 출력(+350%)과 캐시 미스 입력(+200%)입니다. 제3자 모델 하나(월 약 8,400만 토큰, 대부분 오프피크, 캐시 히트 절반)는 약 1.8배에 가깝습니다.
  3. LICENSE 파일을 읽고, 지역 금지 소문은 버립니다. Qwen3.8-Max License에는 영토 조항이 없습니다. 트리거는 Model-as-a-Service / AI Work Assistant 사업의 연속 12개월 매출 5,000만 달러, 또는 모델명 눈에 띄는 표시를 요구하는 월간 활성 1억 / 월 매출 2,000만 달러입니다.
  4. 「더 큰 기반을 다시 학습한다」를 기본 목록에서 뺍니다. GLM-5.3은 7,430억 기반을 유지하고 후훈련 RL 환경을 키웠습니다. 「새 파운데이션이 필요한가」보다 「후훈련 레시피가 한 구간 더 짜낼 수 있는가」를 먼저 묻습니다.
  5. 벤더를 가로질러 가격을 매기고, 「중국 모델 = 최저가」를 버립니다. DeepSeek V4-Pro 오프피크 입력은 약 $0.63/M로, Claude Opus 5(알리바바 자체 비교 비율로 암시되는 약 $5/$25)보다 여전히 훨씬 낮습니다. 다만 Qwen3.8-Max 국제($2/$6)와 GPT-5.6 Luna($0.20/$1.20)는 이제 최소 한 축에서 이를 밑돕니다.
  6. 실제 추론 박스 크기를 잽니다. 2.4조 체크포인트는 4비트에서도 VRAM이 대략 1.2TB입니다. 노트북으로는 호스팅하지 못합니다. 에이전트, 평가, 장기 작업은 여전히 실물 머신이 필요합니다. 워크플로가 Apple Silicon이나 iOS 툴체인에 의존하면 하이퍼바이저 세금을 측정합니다. 베어메탈 아키텍처 노트를 참고합니다.

05

DeepSeek는 여전히 가장 싼 프론티어급 모델인가?

헤드투헤드(위안-달러 약 ¥7.15/$1, 근사)
모델 입력(100만 토큰당) 출력(100만 토큰당) 오픈웨이트?
DeepSeek V4-Pro(피크) ¥9.0(~$1.26) ¥27.0(~$3.78) 아니오
DeepSeek V4-Pro(오프피크) ¥4.5(~$0.63) ¥13.5(~$1.89) 아니오
Qwen3.8-Max(국제 API) $2.00 $6.00 예(맞춤 라이선스)
OpenAI GPT-5.6 Luna $0.20 $1.20 아니오
Claude Opus 5(암시, 알리바바 비율) ~$5.00 ~$25.00 아니오

짧은 답은 아닙니다. 인상 후에도 DeepSeek V4-Pro 오프피크는 Claude Opus 5보다 훨씬 낮지만, 무조건 최저가는 아닙니다. 「중국 모델 = 가장 싼 모델」은 2025년과 2026년 초까지 통했습니다. 이제 안전한 가정이 아닙니다.

쟁점이거나 미확인인 것

  • 「1,100%」 헤드라인은 기술적으로 맞지만, 맥락 없이는 오도합니다. 적용 구간은 피크 시간 캐시 히트 입력, 원래 0에 가장 가깝던 행입니다. 실제 청구를 지배하는 출력은 350% 올랐습니다. 매체마다 다른 구간을 전체인 것처럼 인용합니다.
  • Qwen3.8-Max가 알리바바 자체 Zhenwu M890 칩과 「Pangu AL128」 슈퍼노드에서 돈다는 주장은 여러 중국 금융 매체가 완전 국산 실리콘 추론 스택의 증거로 보도했으나, 알리바바 자체 기술 문서나 제3자 벤치로는 독립 확인되지 않았습니다. 확인 전까지 벤더 인접, 미검증 보도로 둡니다.
  • GLM-5.3이 Cursor에서 「심각한 취약점」을 발견했다는 보고는 VentureBeat 보도와 지푸 자체 공개에 근거합니다. 구체 기술 세부는 공개되지 않았으므로, 벤더 출처이며 독립 감사되지 않은 보안 발견으로 읽어야 합니다.
  • 중국 상무부가 AI/반도체 기술에 대한 보복 수출 통제를 준비 중일 수 있다는 보도는 공식 발표가 아니라 미확인 미디어에 근거한 추측입니다. 확정 사실이 아니라 배경 맥락으로만 둡니다.

왜 중요한가: 동시에 달리는 두 가격 전쟁

지난 한 달 안팎, 중국 상위 랩은 국내 금융 매체가 「一周三更(일주일에 모델 업데이트 세 번)」이라고 부르기 시작한 속도로 대형 릴리스를 쏟았습니다. DeepSeek, 알리바바, 지푸에 더해, 그 앞에는 Moonshot의 Kimi K3(7월 16일 오픈웨이트, 2.8조 파라미터)와 MiniMax H3가 있습니다. 중국 보도는 대체로 중국 오픈웨이트 공개가 「AI 산업의 전 세계 재가격을 강제한다」고 읽습니다.

한편 미국 랩은 소비자 층에서 반대 수를 둡니다. OpenAI는 최저 구간을 80% 인하(7월 30일)한 뒤 일주일 만에 그 모델을 전 사용자 무료·무제한으로 돌렸고(8월 6–7일), 구글은 세 주 된 전작의 절반 가격으로 코딩 특화 모델을 냈습니다(8월 13일). 중국 랩이 플래그십을 오픈웨이트로 열고 연산이 부족한 상단에 계층형·더 높은 요금을 넣는 동안, 미국 랩은 소비자 끝에서 무료와 저가로 달립니다. 둘 다 실제 전략이며, 퍼널의 다른 구간을 최적화합니다.

지정학 층도 조심스럽게 이름을 붙일 필요가 있습니다. 7월 Moonshot Kimi K3 오픈웨이트는 이미 미국 안보 검토를 불렀고, 알리바바가 이 창에 2.4조 플래그십을 연 것을 일부 분석가는 규제 강화 전에 해외 마인드셰어와 「기술 대등」 서사를 고정하려는 수로 읽습니다. 확인된 사실이 아니라 정보에 근거한 해석입니다. 다만 영어권 테크 언론이 각 릴리스를 고립된 제품 뉴스로만 다루는 한, 잘 보이지 않는 맥락입니다.

인용 가능한 수치(게재 시점)

  • DeepSeek V4-Pro 피크 캐시 히트 입력: ¥0.025 → ¥0.30, 약 1,100%. 출력 ¥6.0 → ¥27.0, 350%.
  • Qwen3.8-2.4T-A95B: 총 2.4조 / 활성 950억, 기본 262,144 토큰, 맞춤 라이선스.
  • GLM-5.3 Terminal-Bench 3.0: 4.6% → 28.3%(같은 7,430억 기반, 사전학습 재실행 없음).
  • 환율 기준: 약 ¥7.15/$1. 헤비 사용 청구 상승은 제3자 모델 하나에서 약 1.8배(공식 수치 아님).

FAQ

요금 인상 후에도 DeepSeek는 GPT-5.6이나 Claude보다 저렴한가?

오프피크 요금은 여전히 Claude Opus 5보다 낮습니다. 다만 전체에서 가장 싼 선택지는 아닙니다. OpenAI GPT-5.6 Luna(100만 토큰당 $0.20/$1.20)와 알리바바 Qwen3.8-Max 국제 요금($2/$6)이 최소 한 축에서는 DeepSeek 신규 오프피크를 밑돕니다. 프론티어급으로는 여전히 상대적으로 저렴하지만, 무조건 최저가는 아닙니다.

알리바바 Qwen3.8-Max 오픈웨이트를 상업 제품에 무료로 쓸 수 있는가?

대부분의 개인 프로젝트와 사내 사용은 추가 라이선스 없이 가능합니다. 제약은 Model-as-a-Service 또는 AI Work Assistant 사업이 연속 12개월 매출 5,000만 달러를 넘는 경우에만 적용되며, 그 구간은 알리바바와 별도 상업 라이선스를 협상해야 합니다. 월간 활성 1억 이상 또는 월 매출 2,000만 달러 이상 제품은 모델명도 눈에 띄게 표시해야 합니다.

Qwen3.8-Max는 미국·EU·영국 사용자에게 금지되거나 제한되는가?

아닙니다. 온라인에 퍼진 지역 금지 주장은 사실이 아니며, 공개된 라이선스에는 지리적 제한이 없습니다. 제한은 서비스 매출에 묶인 수익 기준이지, 사용자나 운영자의 소재지가 아닙니다.

GLM-5.3과 GLM-5.2의 실제 차이는 무엇인가?

기반 모델은 같습니다. 둘 다 7,430억 파라미터 파운데이션을 씁니다. Terminal-Bench 3.0에서 약 6배 상승한 성능은 기반 모델을 다시 학습하지 않고 후훈련 강화 학습을 키운 결과입니다.

메타는 Muse Glimmer가 아니라 플래그십도 오픈소스할 것인가?

아직 아닙니다. Muse Glimmer는 300억 파라미터 증류 모델이며 메타의 실제 플래그십이 아닙니다. 마크 저커버그 CEO는 더 큰 비공개 모델 Muse Spark 1.2의 오픈웨이트를 곧 공개하겠다고 밝혔고, 실현되면 미국 플래그십급 최초 공개가 됩니다. 집필 시점에는 미공개이므로 확정이 아니라 선언으로 봐야 합니다.

요금, 라이선스, 벤치 수치는 게재 시점의 공개 정보를 반영합니다. 재게시 전에 최신 공식 요금과 라이선스를 확인하고, 위에서 미검증으로 표시한 항목(국산 칩 주장, Cursor 취약점 보고, 수출 통제 소문)은 독립 확인되지 않았음을 명시합니다.

공식 출처:

DeepSeek 공식 요금: Models & Pricing

알리바바 Qwen 공식 저장소: Hugging Face의 Qwen3.8-2.4T-A95B

Qwen3.8-Max License 본문(Hugging Face LICENSE)

지푸(Z.ai) 공식 GLM-5.3 기술 페이지

제3자 보도:

CNA / Reuters: DeepSeek raises API pricing for its V4 models

South China Morning Post의 Qwen 라이선스 보도

VentureBeat의 GLM-5.3·Muse Glimmer 보도

클라우드 API는 요금표에 「부하를 옮겨라」고 찍을 수 있습니다. 엔지니어링 팀은 에이전트, 평가, 롱컨텍스트 작업을 실물 머신에서 돌려야 합니다. 리셀러 요금은 다시 매겨지고, 2.4조 체크포인트는 노트북에 들어가지 않으며, 가상화 클라우드 인스턴스는 하이퍼바이저 오버헤드와 약한 Apple Silicon / iOS 툴체인 적합으로 세금을 물립니다. 손실 없는 네이티브 연산, 안정적인 iOS CI/CD, 통제된 물리 박스의 7×24 에이전트 자동화가 필요하면 ZUKCLOUD 베어메탈 Mac mini 클라우드 노드가 보통 더 맞습니다. 전용 Apple Silicon, 하이퍼바이저 세금 없음, 7×24 온라인, 일·주·월 과금. 요금 페이지에서 시작하거나 주문 페이지로 바로 갑니다.