In einem Fünf-Tage-Fenster haben Teams, die API-Token kaufen, Open Weights hosten oder ein Coding-Modell wählen, drei Bewegungen gesehen, die sich oberflächlich widersprechen. DeepSeek hat API-Preise in einzelnen Tarifzeilen um bis zu 1.100 % angehoben. Alibaba hat in derselben Woche ein Flaggschiff mit 2,4 Billionen Parametern als Open Weight veröffentlicht — zum ersten Mal auf Max-Stufe. Zhipu AI hat GLM-5.3 ausgeliefert und Coding-Benchmarks auf demselben Basismodell um rund das Sechsfache verbessert, ohne das Fundament neu zu trainieren. Dieser Text liefert die Zeitlinie, das Preisblatt, die drei Strategien, eine Sechs-Schritte-Neuberechnung und FAQ. Zusammen markieren sie eine Verschiebung: Chinas Labore konkurrieren um Preissetzungsmacht, nicht nur um den niedrigsten Listenpreis.
01 Zeitlinie: was wann passiert ist
Das Problem ist nicht „noch ein Modell-Release“. Es ist, dass Preis, Lizenz und der Leistungshebel in derselben Woche gekippt sind. Schlagzeilen-Multiplikatoren vermischen Tarifzeilen. Open Weights sind kein Freifahrtschein für den Vertrieb. Ein Post-Training auf unverändertem Fundament kann über Nacht springen. Rechnung, Compliance und Modellwahl müssen neu aufgesetzt werden:
- Offizieller Peak verliert gegen Wiederverkäufer: DeepSeeks eigener Peak-Satz ist nicht mehr der günstigste Weg, DeepSeek zu betreiben.
- Open Weights, eigene Lizenz: oberhalb einer Umsatzschwelle wird eine separate kommerzielle Freigabe verhandelt.
- Post-Training schlägt ein neues Fundament: GLM-5.3 zeigt, dass ein 743B-Basismodell nicht neu trainiert werden muss, um Coding-Scores zu heben.
- USA und China preisen gegenläufig: China öffnet Flaggschiff-Gewichte und staffelt nach oben; US-Labore gehen auf der Verbraucherschicht kostenlos und günstiger.
| Datum | Ereignis |
|---|---|
| 16. Juli 2026 | Moonshot AI veröffentlicht Kimi K3 (2,8T Parameter) als Open Weight; US-Sicherheitskreise reagieren mit Prüfung |
| 30. Juli 2026 | OpenAI senkt GPT-5.6 Luna, die günstigste Stufe, um 80 % |
| 2.–3. August 2026 | Alibaba kündigt Qwen3.8-Max an und schaltet das Modell als gehostete API frei |
| 6.–7. August 2026 | OpenAI macht Luna zum kostenlosen Standard mit unbegrenzten Textchats |
| 10. August 2026 | Meta veröffentlicht Muse Glimmer (30B, Apache 2.0) und kündigt Open Weights für das Flaggschiff Muse Spark 1.2 an |
| 12. August 2026 | Alibaba stellt Qwen3.8-2.4T-A95B als Open Weight auf Hugging Face/ModelScope; xAI liefert Grok 4.6 aus |
| 13. August 2026 | DeepSeek-V4-Pro geht in die GA und kündigt eine Preiserhöhung zum 17. August an; Google senkt den Preis von Gemini 3.7 Flash |
| 14. August 2026 | Zhipu liefert GLM-5.3 aus und nutzt das 743B-Fundament von GLM-5.2 weiter |
| 17. August 2026, 00:00 Peking-Zeit | DeepSeeks neue Preise gelten |
Im Überblick: Während chinesische Labore Preise angehoben und Flaggschiff-Gewichte geöffnet haben, haben US-Labore auf der Verbraucherschicht parallel gesenkt und kostenlos gestellt. Das sind zwei Seiten desselben Preiskampfs. Produktkontext: Qwen3.8-Max-Release, DeepSeek V4 GA und die GPT-5.6-Preissenkung.
02 Die Zahlen: Preise, Specs, Benchmarks
Zuerst das Blatt. Peak-Stunden sind 9–12 Uhr und 14–18 Uhr Peking-Zeit. „1.100 %“, „11x“ und „350 %“ sind alle korrekt — sie bezeichnen nur unterschiedliche Abrechnungszeilen:
| Abrechnungsposition | Alter Preis | Neu Off-Peak | Neu Peak | Peak-Anstieg |
|---|---|---|---|---|
| V4-Flash Cache-Hit (Input) | ¥0,02 | ¥0,05 | ¥0,10 | ~400 % |
| V4-Flash Cache-Miss (Input) | ¥1,0 | ¥1,5 | ¥3,0 | 200 % |
| V4-Flash Output | ¥2,0 | ¥4,5 | ¥9,0 | 350 % |
| V4-Pro Cache-Hit (Input) | ¥0,025 | ¥0,15 | ¥0,30 | ~1.100 % |
| V4-Pro Cache-Miss (Input) | ¥3,0 | ¥4,5 | ¥9,0 | 200 % |
| V4-Pro Output | ¥6,0 | ¥13,5 | ¥27,0 | 350 % |
Die Schlagzeile „1.100 %“ gilt für Peak-Cache-Hit-Input — die Zeile, die zuvor am nächsten bei null lag. Output, der die meisten realen Rechnungen dominiert, stieg um 350 %. Eine unabhängige Kostenmodellierung kommt bei einer realistischen Schwerlast (rund 84 Mio. Token/Monat, überwiegend Off-Peak, zur Hälfte Cache-Hits) auf einen Anstieg näher an 1,8x — spürbar, aber weit unter den schärfsten Headlines.
| Spec | Detail |
|---|---|
| Parameter | 2,4T gesamt, 95B aktiv je Token (MoE, 512 Experten, 10 geroutet + 1 geteilt) |
| Kontextfenster | 262.144 Token nativ (offener Checkpoint), erweiterbar auf ~1,01M; die gehostete Max-Variante startet mit 1M |
| Release-Takt | Preview 2. August → API live 3. August → Open Weights 12. August |
| API-Preis (international) | 2 $/M Input, 6 $/M Output |
| Lizenz | Nicht Apache 2.0 — eine eigene „Qwen3.8-Max License“ |
| Warum das zählt | Erstmals hat Alibaba ein Max-Stufen-Flaggschiff als Open Weight veröffentlicht; Qwen3.5/3.6/3.7 Max blieben API-only |
| Benchmark | GLM-5.2 | GLM-5.3 | Änderung |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6 % | 28,3 % | +23,7 Punkte |
| DeepSWE v1.1 | 46,2 % | 66,9 % | +20,7 Punkte |
| Agents' Last Exam (CLI) | 23,8 % | 28,5 % | +4,7 Punkte |
| CyberGym | 77,2 % | 84,5 % | +7,3 Punkte |
| AutomationBench | 26,2 % | 48,2 % | +22,0 Punkte |
Das sind Zhipus eigene Angaben — eine unabhängige Drittwiederholung liegt noch nicht vor. GLM-5.3 liegt auf Terminal-Bench 3.0 weiter hinter GPT-5.6 Sol (34,6 %) und Claude Fable 5 (33,7 %); es ist ein starkes Open-Weight-Ergebnis, kein uneingeschränkter Frontier-Sieg.
03 Drei Strategien, drei Logiken
DeepSeek: von der Flattarif- zur Tageszeitlogik — ein Kapazitätsproblem, keine Strategiekehrtwende
Die bequeme Lesart lautet: „Chinas günstigstes Modell ist endlich der Marge gewichen.“ Die Tarifstruktur spricht für das Gegenteil: ein Unternehmen macht Rechenengpässe erstmals auf dem Preisblatt sichtbar. Ein dauerhaft niedriger Flattarif funktionierte als Kundengewinnung, solange die GPU-Kapazität mitwuchs. Als die Nutzung exponentiell stieg und die Kapazität nicht, musste etwas explizit werden — und „flexiblere Lastverschiebung anregen“ ist Konzernsprache für „Peak-Compute ist knapp, bitte verlagern Sie die Last selbst“.
Ein Detail, das die internationale Berichterstattung weitgehend übersehen hat: zu Peak-Stunden liegt DeepSeeks offizielle API inzwischen über mehreren Drittanbietern (GMI Cloud, Novita und andere listen V4 Pro aktuell unter DeepSeeks neuem Peak-Satz). Die Annahme, „die offizielle API sei immer der günstigste Weg zu DeepSeek“, ist damit zum ersten Mal gebrochen.
Alibaba: Open Weights kaufen Ökosystem-Wohlwollen; eine eigene Lizenz schützt die Umsatzdecke
Die Open-Weight-Freigabe von Qwen3.8-Max ist keine schlichte Großzügigkeit. Alibaba hat zwei Dinge gleichzeitig getan: den vollständigen 2,4T-Checkpoint zum freien Download veröffentlicht und eine eigene Lizenz angehängt — nicht das permissive Apache 2.0 der kleineren Qwen-Modelle. Jedes „Model-as-a-Service“- oder „AI Work Assistant“-Geschäft mit mehr als 50 Millionen Dollar Umsatz in einem beliebigen 12-Monats-Zeitraum muss eine separate kommerzielle Lizenz verhandeln; Produkte mit über 100 Millionen monatlich aktiven Nutzern oder über 20 Millionen Dollar Monatsumsatz müssen den Modellnamen prominent anzeigen.
Die Logik: Gewichte verschenken, um Entwicklermindshare zu gewinnen (besonders international, wo „Modell aus China“ bei Enterprise-Einkäufern noch zögern lässt), und gleichzeitig Preishebel über die wenigen Firmen behalten, die darauf ein konkurrierendes Inferenzgeschäft bauen können. Das ist eine andere Wette als Metas Muse Glimmer unter uneingeschränktem Apache 2.0. Zur vorigen Open-Weight-Welle: Kimi-K3-Vollfreigabe.
Ein Gerücht, das explizit sterben sollte: Behauptungen, Alibabas Lizenz verbiete Downloads aus den USA, der EU, dem Vereinigten Königreich und Südkorea. Das ist falsch. Der veröffentlichte Lizenztext enthält keinerlei geografische oder territoriale Klausel — eine nützliche Erinnerung, in einem so schnellen Release-Zyklus die LICENSE-Datei zu prüfen, nicht den Ankündigungsthread.
GLM-5.3: kein neues Basismodell, nur ein größerer Post-Training-Einsatz
Die interessanteste Tatsache an GLM-5.3 ist nicht der Score, sondern die Methode: dasselbe 743B-Fundament wie GLM-5.2, kein erneutes Training, und ein Sprung um rund das Sechsfache auf Terminal-Bench 3.0 (4,6 % → 28,3 %) allein durch skalierte Reinforcement-Learning-Umgebungen im Post-Training. Während Pretraining-Skalierungsgesetze abnehmende Erträge zeigen, wird Post-Training-RL zu einem eigenen Leistungshebel mit deutlich niedrigerer Kostenschwelle als ein neues Fundament. Die Eintrittsbarriere sinkt damit spürbar — Labore ohne OpenAI-skalige Compute-Budgets können bei agentischen und Coding-Benchmarks trotzdem aufschließen.
# drei Labore, drei Züge, eine Woche Preissetzungsmacht
DeepSeek V4-Pro : flat günstig → Peak/Off-Peak (Kapazität sichtbar)
Qwen3.8-2.4T : erste Max-Gewichte + eigene Lizenz
GLM-5.3 : gleiches 743B-Fundament, nur Post-Training
Gerücht : Geo-Sperre US/EU/UK/KR — FALSCH, keine Territorialklausel
Hinweis: „chinesisches Modell = günstigstes“ ist keine sichere Annahme mehr
04 Sechs Schritte zur Neuberechnung der Modellrechnung
Labore können ein neues Preisblatt an einem Tag ausliefern. Engineering und Einkauf müssen Rechnung, Lizenz und Inferenzkasten trotzdem neu aufsetzen. Sechs Schritte, jeder an eine öffentliche Zahl oben gebunden:
- Zuerst das offizielle Blatt auf Ihre Zeitzone mappen. DeepSeek-Peak ist 9–12 Uhr und 14–18 Uhr Peking-Zeit (01:00–04:00 und 06:00–10:00 UTC). US- und europäische Geschäftszeiten fallen überwiegend auf Off-Peak; der chinesische Tag sitzt auf Peak. Dasselbe Blatt, andere Rechnung.
- Drei Abrechnungszeilen trennen. Nicht auf „1.100 %“ starren. Cache-Hit-Input stieg prozentual am stärksten und absolut in Yuan am wenigsten. Output (+350 %) und Cache-Miss-Input (+200 %) bewegen reale Rechnungen. Ein Drittmodell mit ~84 Mio. Token/Monat, überwiegend Off-Peak, zur Hälfte Cache-Hits, landet näher bei 1,8x.
- Die LICENSE-Datei lesen. Das Geo-Sperr-Gerücht ignorieren. Die Qwen3.8-Max License hat keine Territorialklausel. Die Auslöser sind ein Model-as-a-Service- / AI-Work-Assistant-Geschäft über 50 Mio. $ in beliebigen 12 Monaten oder 100 Mio. MAU / 20 Mio. $ Monatsumsatz für die prominente Modellnamensanzeige.
- „Größeres Fundament neu trainieren“ von der Standardliste streichen. GLM-5.3 hat das 743B-Fundament behalten und Post-Training-RL-Umgebungen skaliert. Vor „brauchen wir ein neues Fundament?“ zuerst fragen: „Drückt das Post-Train-Rezept noch eine Stufe heraus?“
- Über Anbieter hinweg preisen. „Chinesisches Modell = günstigstes“ ablegen. DeepSeek V4-Pro Off-Peak-Input liegt bei etwa 0,63 $/M — weiter klar unter Claude Opus 5 (~5 $ / ~25 $, impliziert aus Alibabas eigenem Vergleichsverhältnis) — aber Qwen3.8-Max international (2 $/6 $) und GPT-5.6 Luna (0,20 $/1,20 $) unterbieten es in mindestens einer Dimension.
- Den realen Inferenzkasten dimensionieren. Ein 2,4T-Checkpoint braucht selbst bei 4-Bit rund 1,2 TB VRAM. Ein Laptop hostet das nicht. Agenten, Evals und lange Horizonte brauchen echte Maschinen. Wer die Gewichte selbst hostet, verarbeitet Prompts häufig als personenbezogene Daten im Sinne der DSGVO; Standort der Inferenz und Auftragsverarbeitung gehören dann zur Architekturentscheidung, nicht nur die VRAM-Rechnung. Hängt der Workflow an Apple Silicon oder der iOS-Toolchain, den Hypervisor-Aufschlag messen; siehe die Bare-Metal-Architekturnotiz.
05 Direktvergleich, Streitpunkte, FAQ und Fazit
Ist DeepSeek noch das günstigste Frontier-Modell?
| Modell | Input (je 1 Mio. Token) | Output (je 1 Mio. Token) | Open Weights? |
|---|---|---|---|
| DeepSeek V4-Pro (Peak) | ¥9,0 (~1,26 $) | ¥27,0 (~3,78 $) | Nein |
| DeepSeek V4-Pro (Off-Peak) | ¥4,5 (~0,63 $) | ¥13,5 (~1,89 $) | Nein |
| Qwen3.8-Max (internationale API) | 2,00 $ | 6,00 $ | Ja (eigene Lizenz) |
| OpenAI GPT-5.6 Luna | 0,20 $ | 1,20 $ | Nein |
| Claude Opus 5 (impliziert, nach Alibabas Verhältnis) | ~5,00 $ | ~25,00 $ | Nein |
Kurze Antwort: nein. Auch nach der Erhöhung liegt der Off-Peak-Satz von DeepSeek V4-Pro weiter klar unter Claude Opus 5, ist aber nicht mehr das eindeutig günstigste Angebot. „Chinesisches Modell = günstigstes Modell“ galt den Großteil von 2025 und Anfang 2026. Das ist keine sichere Annahme mehr.
Was strittig oder unbestätigt ist
- Die Headline „1.100 %“ ist technisch korrekt, ohne Kontext aber irreführend. Sie gilt nur für Peak-Cache-Hit-Input, die Zeile, die zuvor am nächsten bei null lag. Output — die Kostenposition, die die meisten realen Rechnungen dominiert — stieg um 350 %. Verschiedene Medien haben unterschiedliche Zeilen zitiert, als wären sie die ganze Geschichte.
- Behauptungen, Qwen3.8-Max laufe auf Alibabas eigenen Zhenwu-M890-Chips (und „Pangu-AL128“-Superknoten), von mehreren chinesischen Finanzmedien als Beleg für einen vollständig inländischen Silizium-Inferenzstack berichtet, sind von Alibabas eigener technischer Dokumentation und von Drittbenchmarks nicht unabhängig bestätigt. Bis zur Bestätigung als anbieternah, unbestätigt behandeln.
- Zhipus Angabe, GLM-5.3 habe in Cursor eine „schwerwiegende Schwachstelle“ gefunden, stammt aus der Berichterstattung von VentureBeat und aus Zhipus eigener Mitteilung; konkrete technische Details sind nicht öffentlich, die Aussage daher als anbieterseitig, nicht unabhängig geprüft lesen.
- Berichte, Chinas Handelsministerium (MOFCOM) bereite möglicherweise Vergeltungs-Exportkontrollen für KI- und Halbleitertechnik vor, sind spekulativ und stützen sich auf unbestätigte Medienberichte, nicht auf eine amtliche Ankündigung. Als Hintergrundkontext behandeln, nicht als feststehende Tatsache.
Warum das zählt: zwei Preiskriege parallel
Ungefähr im vergangenen Monat haben Chinas führende Labore Releases in einem Takt ausgeliefert, den inländische Finanzmedien inzwischen „drei Modellupdates pro Woche“ (一周三更) nennen — DeepSeek, Alibaba und Zhipu, dazu zuvor Moonshots Kimi K3 (Open Weight am 16. Juli, 2,8T Parameter) und MiniMax H3. Die chinesische Berichterstattung rahmt das breit als Open-Weight-Releases, die „eine globale Neubepreisung der KI-Branche erzwingen“.
US-Labore fahren auf der Verbraucherschicht den Gegenkurs: OpenAI senkte die günstigste Stufe am 30. Juli um 80 % und machte das Modell eine Woche später (6.–7. August) für alle Nutzer kostenlos und unbegrenzt; Google lieferte am 13. August ein coding-fokussiertes Modell zum halben Preis des drei Wochen alten Vorgängers. Während chinesische Labore Flaggschiffe öffnen und am compute-knappen oberen Ende gestaffelte, höhere Preise einführen, rennen US-Labore am Verbraucherende Richtung kostenlos und günstig. Beides sind echte Strategien; sie optimieren nur unterschiedliche Trichterabschnitte.
Es gibt außerdem eine geopolitische Schicht, die vorsichtig benannt werden sollte. Moonshots Kimi-K3-Open-Weight-Freigabe im Juli hat bereits US-Sicherheitsprüfungen ausgelöst; dass Alibaba genau dieses Fenster wählt, um ein 2,4T-Flaggschiff zu öffnen, lesen manche Analysten als Versuch, internationalen Mindshare und eine „technologische Parität“-Erzählung festzuzurren, bevor regulatorische Verschärfungen greifen könnten. Das ist eine informierte Interpretation, keine bestätigte Tatsache — aber Teil des Kontexts, der unsichtbar bleibt, wenn man nur englischsprachige Tech-Presse liest, die diese Releases überwiegend als isolierte Produktnews statt als nationales Muster behandelt hat.
Zitierfähige Zahlen (Stand Veröffentlichung)
- DeepSeek V4-Pro Peak-Cache-Hit-Input: ¥0,025 → ¥0,30, ~1.100 %; Output ¥6,0 → ¥27,0, 350 %.
- Qwen3.8-2.4T-A95B: 2,4T gesamt / 95B aktiv, 262.144 native Token, eigene Lizenz.
- GLM-5.3 Terminal-Bench 3.0: 4,6 % → 28,3 % (gleiches 743B-Fundament, kein Pretraining-Rerun).
- Wechselkursreferenz: ~¥7,15/$1; Schwerlast-Rechnungsanstieg ~1,8x in einem Drittmodell (nicht offiziell).
FAQ
Ist DeepSeek nach der Preiserhöhung noch günstiger als GPT-5.6 oder Claude?
Der Off-Peak-Tarif liegt weiter unter Claude Opus 5, ist aber nicht mehr der günstigste Gesamtweg: GPT-5.6 Luna von OpenAI (0,20 $/1,20 $ je Million Token) und der internationale Qwen3.8-Max-Tarif von Alibaba (2 $/6 $) unterbieten DeepSeeks neue Off-Peak-Sätze in mindestens einer Dimension. DeepSeek bleibt für ein Frontier-Modell vergleichsweise günstig, ist aber nicht mehr eindeutig das billigste Angebot.
Darf ich die Open Weights von Qwen3.8-Max kostenlos in einem kommerziellen Produkt nutzen?
Ja, in den meisten Fällen: persönliche Projekte und interne Unternehmensnutzung bleiben unberührt. Die Zusatzlizenz greift nur, wenn Sie ein Model-as-a-Service- oder AI-Work-Assistant-Geschäft betreiben, das in einem beliebigen Zeitraum von 12 Monaten mehr als 50 Millionen Dollar Umsatz erzielt hat. Produkte mit über 100 Millionen monatlich aktiven Nutzern oder über 20 Millionen Dollar Monatsumsatz müssen den Modellnamen außerdem prominent anzeigen.
Ist Qwen3.8-Max für Nutzer in den USA, der EU oder dem Vereinigten Königreich gesperrt?
Nein. Die Behauptung kursierte online, ist aber falsch: der veröffentlichte Lizenztext enthält keinerlei geografische Beschränkung. Die Schwellen sind umsatzbezogen (abhängig vom Erlös Ihres Dienstes), nicht vom Standort von Betreiber oder Nutzern.
Was unterscheidet GLM-5.3 tatsächlich von GLM-5.2?
Auf Basismodell-Ebene nichts: beide nutzen dasselbe Fundament mit 743 Milliarden Parametern. Die Leistungsgewinne (rund das Sechsfache auf Terminal-Bench 3.0) stammen vollständig aus skalierter Verstärkung im Post-Training, ohne erneutes Training des Basismodells.
Wird Meta wirklich sein Flaggschiff-Modell öffnen — nicht nur das kleinere Muse Glimmer?
Noch nicht. Muse Glimmer ist ein destilliertes 30B-Modell, nicht Metas eigentliches Flaggschiff. CEO Mark Zuckerberg hat Open Weights für das größere, bisher geschlossene Muse Spark 1.2 für bald angekündigt; träfe das ein, wäre es das erste offen veröffentlichte US-Flaggschiff. Zum Zeitpunkt dieser Veröffentlichung ist das nicht geschehen — als Absicht behandeln, nicht als bestätigte Tatsache.
Preise, Lizenzbedingungen und Benchmark-Zahlen entsprechen öffentlich verfügbaren Angaben zum Veröffentlichungszeitpunkt. Vor einer Weiterveröffentlichung die aktuellen offiziellen Preise und Lizenzbedingungen prüfen und beachten, dass die oben als unbestätigt markierten Punkte (inländische Chip-Angaben, der Cursor-Schwachstellenbericht und Exportkontroll-Gerüchte) nicht unabhängig bestätigt sind:
Offizielle Quellen:
DeepSeek offizielle Preise: Models & Pricing
Alibaba-Qwen offizielles Repository: Qwen3.8-2.4T-A95B auf Hugging Face
Qwen3.8-Max-Lizenztext (Hugging-Face-LICENSE)
Zhipu (Z.ai) offizielle GLM-5.3-Technikseite
Drittberichterstattung:
CNA / Reuters: DeepSeek raises API pricing for its V4 models
South China Morning Post zur Qwen-Lizenz
VentureBeat zu GLM-5.3 und Muse Glimmer
Eine Cloud-API kann „Last verschieben“ auf ein Preisblatt drucken. Engineering-Teams müssen Agenten, Evals und Long-Context-Jobs trotzdem auf echten Maschinen fahren — Wiederverkäuferpreise werden neu gesetzt, ein 2,4T-Checkpoint passt nicht auf einen Laptop, und virtualisierte Cloud-Instanzen belasten weiter mit Hypervisor-Overhead und schwacher Passung zu Apple Silicon und iOS-Toolchain. Wer verlustfreie native Rechenleistung, stabile iOS-CI/CD und 7×24-Agent-Automatisierung in einem kontrollierten physischen Kasten braucht, ist mit ZUKCLOUD Bare-Metal Mac mini in der Regel besser bedient: dediziertes Apple Silicon, kein Hypervisor-Aufschlag, 7×24 online, Abrechnung nach Tag, Woche oder Monat. Start auf der Preisseite oder direkt auf der Bestellseite.