Startseite / Blog / Qwen3.8-Max
ENGINEERING BLOG · 2026.08.04

Qwen3.8-Max GA:
Arena Platz 5, 2,4T Parameter — Open Source nur auf dem Label

Am 3. August 2026 hat Alibaba sein Flaggschiff-LLM Qwen3.8-Max allgemein verfügbar gemacht (GA) und parallel den Agent-Dienst „Qwen Office“ gestartet. Kerndaten: 2,4 Billionen Gesamtparameter, 95 Milliarden aktiv, 1 Mio. Token Kontext. In der Arena Text Leaderboard (Snapshot 1. August) steht das Modell vorläufig auf Platz 5 (1.496 Punkte) — als einziges Nicht-Anthropic-Modell unter den Top 8. Dieser Artikel richtet sich an ML-Ingenieure, Architekten und Compliance-Verantwortliche und ordnet Qwen3.8-Max gegen Kimi K3 und DeepSeek V4 ein. Kernaussage: Die Leistungsdaten sind vielversprechend, stammen aber fast ausschließlich aus Alibaba-eigenen Tests; Gewichte und Lizenz fehlen noch — Produktionsmigration vor unabhängiger Verifikation ist riskant.

01

Der chinesische Frontier-LLM-Markt hat im Juli 2026 einen klaren Schwenk von reiner Skalierung zu Architektureffizienz vollzogen. Die folgende Chronologie ist für jede fundierte Bewertung unverzichtbar.

  • 16. Juli: Moonshot AI veröffentlicht Kimi K3 (2,8T Parameter, 16 von 896 Experten aktiv) mit Fokus auf unabhängige Benchmarks und technischen Report.
  • 19. Juli: Qwen3.8-Max als Preview zu 10 % des späteren Standardpreises — ohne aktive Parameterzahl, ohne Benchmark-Tabelle, mit Nutzungsbedingungen, die automatisierte Produktionsaufrufe verbieten.
  • 27. Juli: Kimi K3 liefert Open Weights auf Hugging Face inklusive Teilen der Serving-Infrastruktur.
  • 31. Juli: DeepSeek V4-Flash übertrifft V4-Pro auf neun agentischen und Coding-Benchmarks — ohne Parameterzuwachs.
  • 3. August: Qwen3.8-Max GA mit vollständiger Benchmark-Tabelle und Qwen Office. Alibaba-Aktien: Hongkong +7 %, USA +4,5 %.
  • ~10. August (angekündigt): Gewichte für Qwen3.8-Max und Qwen3.8-27B auf Hugging Face/ModelScope — Lizenz und festes Datum fehlen zum Stichtag 4. August.

Alibaba wählt damit bewusst die Route API zuerst, Gewichte später — im Gegensatz zu Kimi K3 und DeepSeek, die Transparenz als Wettbewerbsvorteil nutzen.

02

Qwen3.8-Max — Kerndaten (Stand August 2026)
Parameter Wert Quelle / Anmerkung
GA-Datum 3. August 2026 Alibaba Pressemitteilung
Gesamt / aktiv 2,4T / 95B Erst bei GA offengelegt (Preview: keine Angabe)
Kontextfenster 1 Mio. Token Text, Bild, Video
API-Preis $2 / $6 pro 1M Token (Ein/Aus) Deutlich unter Claude Opus 5 ($5/$25)
Arena Text Platz 5, 1.496 Pkt. „Preliminary“ — einziges Nicht-Anthropic in Top 8
Arena Vision Platz 2 Hinter Claude Fable 5
PaperBench 93,0 (+28,2) Alibaba-intern
SWE-bench Pro 67,7 Hinter Fable 5 (80,0)
Open Weights Nicht veröffentlicht „Open-Source“-Label auf qwen.ai aktiv

Platz 5 in der Arena ist bemerkenswert, trägt aber den Status „Preliminary“. Alle weiteren Leistungszahlen stammen aus Alibaba-eigenen Testframeworks — eine unabhängige Reproduktion durch Artificial Analysis oder das Arena-Team liegt zum GA-Stichtag nicht vor.

03

Qwen3.8-Max basiert auf sparse MoE mit Hybrid-Attention (Qwen3.5-Fundament). Die Inferenzkosten skalieren mit den 95 Milliarden aktiven Parametern, nicht mit 2,4 Billionen Gesamtparametern — das erklärt die aggressive API-Preisgestaltung.

Der Parameter reasoning_effort (low / medium / xhigh, Standard: xhigh) erlaubt einen expliziten Kosten-Leistungs-Trade-off — über enable_thinking oder das Anthropic-kompatible Feld reasoning.effort.

Die eigentliche Kontroverse betrifft jedoch die Informationsasymmetrie:

  • Label vor Artefakt: qwen.ai trägt seit dem GA-Tag „Open-Source“, ohne Repository, Lizenz oder Liefertermin.
  • Vendor-run Benchmarks: QwenSWEBench, RecreationBench, CoWorkBench — interne Suites ohne öffentliche Reproduzierbarkeit. Eine Fußnote suggeriert „Fallbacks“ bei Fable-5-Ergebnissen, ohne eigene Methodik offenzulegen.
  • Preview-Transparenzlücke: Keine aktive Parameterzahl, kein Model Card, keine Sicherheitsbewertung — unabhängige Evaluatoren rieten von Produktionsmigration ab.
  • Einziger unabhängiger Blindtest: 269-Dateien-Architekturaufgabe — Kimi K3: 83/100, Qwen3.8-Max-Preview: 80/100.

DSGVO-Relevanz: Wer die QwenCloud-API mit personenbezogenen Daten (Kundendaten, Code mit PII, interne Dokumente) nutzt, verarbeitet diese in Alibaba-Cloud-Regionen. Für EU-Unternehmen sind ein Auftragsverarbeitungsvertrag (AVV), dokumentierte Datenresidenz, Löschfristen und eine Transfer Impact Assessment (TIA) nach Schrems-II-Logik zwingend zu prüfen — unabhängig von den Benchmark-Zahlen. On-Premise-Validierung auf eigener Hardware (z. B. über lokale LLM-Deployments auf Mac mini M4) reduziert Übermittlungsrisiken während der Evaluierungsphase.

04

Frontier-Modelle im Vergleich (August 2026)
Modell Gesamt / aktiv Preis (Ein/Aus pro 1M) Gewichte Unabhängige Daten
Qwen3.8-Max 2,4T / 95B $2 / $6 Angekündigt Keine (Arena vorläufig)
Kimi K3 2,8T / ~50B $3 / $15 Veröffentlicht (27. Juli) Artificial Analysis ~57,11
DeepSeek V4-Flash 1,6T / 49B Nicht vollständig publiziert Veröffentlicht 9 Benchmarks > V4-Pro
Claude Fable 5 Nicht offengelegt $10 / $50 Geschlossen Arena Text #1
Empfehlung API-Kosten → Qwen. Transparenz/Self-Host → K3/DeepSeek. Max. Leistung → Claude

Sechs Schritte vor einer Produktionsentscheidung (Preise für eigene Inferenz-Infrastruktur: ZUKCLOUD Preisseite):

  1. Workload definieren: Coding-Agent, Multimodal-RAG oder Langzeit-Autonomie? Schwächen bei SWE-bench Pro (67,7) und HLE (43,6) gegen Anforderungen abwägen.
  2. API vs. Self-Host trennen: Vollmodell erfordert Multi-Node-Cluster. Realistische Alternative: Qwen3.8-27B oder quantisierte Modelle auf Apple Silicon.
  3. DSGVO-Checkliste durchgehen: AVV, Datenresidenz, Löschkonzept, TIA — bevor produktive Prompts mit PII an QwenCloud gehen.
  4. reasoning_effort budgetieren: xhigh als Standard ist teuer. Batch-Jobs auf medium/low setzen und Monatskosten modellieren.
  5. Unabhängige Benchmarks abwarten oder A/B fahren: Bis Artificial Analysis reproduziert, parallele Tests gegen Kimi K3/DeepSeek V4 auf eigenen Datensätzen.
  6. Lizenz nach Weight-Release prüfen: Sobald Hugging Face-Repository live ist, kommerzielle Nutzungsbedingungen und Weiterverteilungsrechte vor On-Premise-Planung validieren.

05

  • Parameter: 2,4T gesamt / 95B aktiv (sparse MoE)
  • Arena Text: Platz 5, 1.496 Punkte (Preliminary)
  • API: $2 Eingabe / $6 Ausgabe pro 1M Token
  • Blindtest: Kimi K3 83 vs. Qwen-Preview 80 (269 Dateien)
  • Börse: Alibaba HK +7 %, USA +4,5 % am GA-Tag
  • Gewichte: Nicht veröffentlicht (Stand 4. August 2026)
Ist Qwen3.8-Max bereits Open Source?

Nein. Die API ist über QwenCloud nutzbar, aber die Modellgewichte waren zum 4. August 2026 noch nicht auf Hugging Face oder ModelScope veröffentlicht. Das Open-Source-Label auf qwen.ai beschreibt eine Absicht, kein ausgeliefertes Artefakt.

Wie schneidet Qwen3.8-Max gegen Kimi K3 ab?

Kein autoritativer Head-to-Head vorhanden. Blindtest: K3 83/100, Qwen-Preview 80/100. K3 hat öffentliche Gewichte und Artificial-Analysis-Daten; Qwen3.8-Max bietet günstigere API-Preise und stärkere Multimodalität.

Brauche ich ein Rechenzentrum für 2,4 Billionen Parameter?

Für das Vollmodell ja — Multi-Node-Infrastruktur. Inferenzkosten orientieren sich an 95B aktiven Parametern. Für lokale Deployments ist Qwen3.8-27B oder quantisierte Varianten auf Mac mini realistischer.

Sind Alibabas Benchmarks verlässlich?

Als Herstellerangabe behandeln. PaperBench und RecreationBench sind intern. Unabhängige Reproduktionen fehlen zum GA-Zeitpunkt. Eigene A/B-Tests auf repräsentativen Workloads empfohlen.

Welche DSGVO-Risiken gibt es bei der API-Nutzung?

Prompts werden in Alibaba-Cloud-Regionen verarbeitet. Für personenbezogene Daten in der EU: AVV, Datenresidenz, Löschfristen und TIA erforderlich. On-Premise-Tests auf eigener Hardware reduzieren Übermittlungsrisiken während der Evaluierung.

Offizielle und unabhängige Quellen (Links vor Veröffentlichung erneut prüfen):

Qwen — Offizielle Produktseite

Arena.ai — Öffentliche Text- und Vision-Leaderboards

Alibaba Cloud Model Studio — API-Dokumentation

CNBC — Alibaba-Aktienreaktion auf Qwen3.8-Max

Reine Cloud-API-Abhängigkeit birgt drei strukturelle Nachteile: nicht verifizierbare Hersteller-Benchmarks, fehlende Gewichte für Compliance-Audits und unvorhersehbare Inferenzkosten bei xhigh-Reasoning. Für Teams, die 7×24-Agent-Automatisierung, stabile iOS-CI/CD und DSGVO-konforme Evaluierungsumgebungen kombinieren müssen, sind ZUKCLOUDs Bare-Metal-Mac-mini-Cloud-Knoten die überlegene Option: dedizierte Apple-Silicon-Hardware, volle Root-Rechte, keine Hypervisor-Einbußen, flexible Tages-/Wochen-/Monatsverträge. Starten Sie über die Bestellseite und lesen Sie das Bare-Metal-Architektur-Manifest. API für Produktion, Mac mini für Validierung und Edge — die Zweischicht-Strategie für 2026.