Am 16. Juli 2026 hat Moonshot AI (月之暗面) Kimi K3 ohne große Keynote freigeschaltet — nur ein Banner in der API-Doku, ein Tech-Blog und sofort nutzbare Endpunkte. Dieser Test richtet sich an ML-Ingenieure, CTOs und Agent-Entwickler, die wissen wollen, ob das Modell mit 2,8 Billionen Parametern und 1 Mio. Token Kontext produktionsreif ist. Sie erhalten: Architektur-Specs, Benchmark-Tabellen gegen Claude Fable 5 und GPT-5.6 Sol, eine Preis-Matrix, sechs konkrete Anbindungsschritte und den Zeitplan für den Open-Weights-Release am 27. Juli 2026.
01 Kimi K3 Spezifikationen: Warum 2,8T Parameter relevant sind
Kimi K3 ist derzeit das größte veröffentlichte Open-Source-LLM: 2,8 Billionen (2,8T) Parameter — rund 75 % mehr als DeepSeek V4 Pro (1,6T), 2,7× größer als Xiaomis Open-Source-Modell (1,02T) und mehr als siebenmal Ali (397B). Die Architektur ist ein sparsames MoE-System: 896 Experten, pro Forward-Pass werden 16 aktiviert (Sparsity 1,8 %). Dazu kommen 1.048.576 Token Kontext, native Bild- und Video-Verarbeitung sowie ein Fokus auf langlaufende Coding- und Wissensaufgaben.
| Parameter | Wert | Einordnung |
|---|---|---|
| Gesamtparameter | 2,8T | Größtes Open-Source-LLM weltweit |
| MoE-Konfiguration | 896 / 16 aktiv | Sparsity 1,8 % |
| Kontextfenster | 1.048.576 Token | 5× Claude Sonnet 5 (200K) |
| Multimodal | Ja (Bild/Video) | OmniDocBench 91,1 (Spitze) |
| API-Modell-ID | kimi-k3 | OpenAI-kompatibel |
| Open Weights | 27.07.2026 | Hugging Face — vollständige Gewichte |
Strategischer Kontext: Kimi dominierte in 9 der letzten 12 Monate die Open-Source-Größenklasse; der Launch fällt in die Nacht vor der WAIC 2026 (17.–20. Juli). Moonshots ARR überschritt im Juni 2026 300 Mio. USD; die 6. Finanzierungsrunde setzte die Bewertung auf 31,5 Mrd. USD (pre-money). API-Umsatz macht über 70 % aus; internationale zahlende Nutzer wuchsen um 400 %.
Entscheidungsschmerzen, die Specs allein nicht lösen:
- Cloud-Abhängigkeit bis 27.07.: Vor dem Gewichts-Drop hängt jede Produktions-Pipeline an Moonshots Infrastruktur — Latenz, Quotas und Preisänderungen liegen außerhalb Ihrer Kontrolle.
- DSGVO bei API-Nutzung: Prompts, Code und Dokumente verlassen Ihre Perimeter und werden in Moonshots Cloud verarbeitet. Für personenbezogene Daten brauchen Sie Auftragsverarbeitungsverträge, Datenminimierung und ggf. EU-Rechenzentren — prüfen Sie die aktuelle DPA auf platform.kimi.ai vor produktivem Einsatz.
- 1M Kontext ≠ kostenlos: Flat-Preise helfen, aber Agent-Workflows ohne persistente Dev-Umgebung scheitern an Wiederaufnahme und Toolchain-Integration.
- Self-Hosting-Schwelle: Produktions-Inferenz erfordert laut Hersteller 64+ Beschleuniger — für KMU und Einzelentwickler bleibt nur die API.
- Benchmark-Bias: Moonshot nutzt Kimi Code, Claude Claude Code, GPT Codex — unterschiedliche Harnesses; unabhängige Reproduktionen laufen noch.
02 Architektur: Kimi Delta Attention, AttnRes & Stable LatentMoE
K3 ist kein reines Parameter-Scaling. Im Vergleich zu den Modellen im OpenRouter-Juni-Ranking setzt Moonshot auf Effizienz bei langem Kontext und stabiles Training extremer MoE-Sparsity.
Kimi Delta Attention (KDA)
Standard-Transformer skaliert die Aufmerksamkeit quadratisch — bei 1M Token wird der KV-Cache zum Engpass. KDA mischt lineare und volle Attention in einem 3:1-Verhältnis:
- Drei lineare Schichten für lokale Struktur (günstig), eine volle Attention für globalen Informationsfluss;
- KV-Cache-Speicher: bis zu −75 %;
- Decoding bei 1M Token: bis zu 6,3× schneller;
- Übertrifft laut Moonshot reine Full-Attention-Baselines in kurzen, langen und RL-Skalierungs-Szenarien.
Attention Residuals (AttnRes)
- Klassische Residual-Verbindungen verdünnen frühe Repräsentationen in tiefen Schichten;
- AttnRes erlaubt selektives Abrufen hochwertiger früher Layer über die Tiefe hinweg;
- Trainings-Effizienz: ca. +25 %, Mehraufwand unter 2 %.
Stable LatentMoE
| Technik | Funktion |
|---|---|
| Quantile Balancing | Experten-Zuweisung direkt aus Router-Quantilen — ohne heuristische Hyperparameter |
| Per-Head Muon | Head-spezifische Optimierung für stabiles Großtraining |
| Sigmoid Tanh Unit (SiTU) | Verbesserte Aktivierungskontrolle |
| Gated MLA | Höhere Attention-Selektivität |
| Gesamteffekt | ~2,5× Skalierungseffizienz vs. Kimi K2 |
03 Benchmark-Matrix: Kimi K3 vs Claude Fable 5 vs GPT-5.6 Sol
Alle Werte stammen aus Moonshots Self-Report vom 16.07.2026. Lesen Sie ergänzend Claude Code skalieren für Repo-Level-Bugfix-Szenarien.
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| DeepSWE | 67,5 | 70,0 | 73,0 | 59,0 |
| Program Bench | 77,8 | 76,8 | 77,6 | 71,9 |
| Terminal Bench 2.1 | 88,3 | 84,6 | 88,8 | 84,6 |
| FrontierSWE | 81,2 | 86,6 | 71,3 | 66,7 |
| SWE Marathon | 42,0 | 35,0 | 39,0 | 40,0 |
| BrowseComp | 91,2 | 88,0 | 90,4 | 84,3 |
| Automation Bench | 30,8 | 29,1 | 29,7 | 27,2 |
| GPQA-Diamond | 93,5 | 92,6 | 94,1 | 91,0 |
| MMMU-Pro | 81,6 | 81,2 | 83,0 | 78,9 |
| OmniDocBench | 91,1 | 89,8 | 85,8 | 87,9 |
Datengetriebene Lesart: K3 führt bei SWE Marathon (42,0) — dem Benchmark für stundenlange Coding-Sessions. Program Bench (77,8) knapp vorne. FrontierSWE gewinnt Fable 5 (86,6). Im Artificial Analysis Intelligence Index v4.1 liegt K3 mit 57,1 auf Platz vier hinter Fable 5 (59,9) und GPT-5.6 Sol (58,9).
Hinweis: Self-Report mit unterschiedlichen Harnesses — unabhängige Reproduktionen ausstehend.
04 API-Preise & 6-Schritte-Anbindung
| Modell | Input | Output | Cache-Hit | Kontext |
|---|---|---|---|---|
| Kimi K3 | $3,00 | $15,00 | $0,30 | 1M |
| Claude Sonnet 5 | $3,00 | $15,00 | — | 200K |
| Claude Opus 4.8 | $5,00 | $25,00 | — | 200K |
| GPT-5.5 | $5,00 | $30,00 | — | 400K |
| DeepSeek V4 Pro | $1,74 | $3,48 | $0,145 | 128K |
| Kimi K2.6 | $0,95 | $4,00 | $0,16 | 256K |
K3 kostet wie Sonnet 5 ($3/$15), bietet aber 5× Kontext. Cache-Hits ab $0,30/M; Moonshot berichtet über 90 % Cache-Hit-Rate in Coding-Szenarien. China-Preise: ¥20 / ¥100 / ¥2 (Input/Output/Cache) pro M Token. Consumer: kostenlos auf kimi.com; Prepaid ab ¥199 (Rabatt bis 11.08.).
6 Anbindungsschritte:
- Moonshot-Konto anlegen: Registrierung auf platform.kimi.ai oder kimi.com — Google-Login möglich.
- API-Key erzeugen: Im Dashboard generieren und sicher speichern (einmalige Anzeige).
- Modell-ID setzen:
kimi-k3; OpenRouter:moonshotai/kimi-k3ohne Aufschlag. - OpenAI-kompatiblen Client konfigurieren:
base_url = https://api.moonshot.ai/v1. - Smoke-Test senden: Kurzer Prompt zur Latenz- und Quota-Prüfung.
- Cache-aware Workflow aktivieren: System-Prompts und Tool-Definitionen wiederverwenden für 90 %+ Cache-Hits.
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Analysiere diesen Code..."}]
)
print(response.choices[0].message.content)
05 Entscheidungsmatrix & Open Weights am 27. Juli
| Szenario | Empfehlung | Begründung |
|---|---|---|
| Langlaufende Coding-Tasks | Kimi K3 | SWE Marathon #1, längster Kontext |
| Repo-Level Bugfixes | Claude Fable 5 | FrontierSWE führend |
| Terminal-/Tool-Agenten | GPT-5.6 Sol | Terminal Bench 2.1 Spitze |
| Langdokumente + Multimodal | Kimi K3 | OmniDocBench 91,1, 1M Kontext |
| Kostenoptimierung | DeepSeek V4 Pro | Output $3,48/M |
| Self-Host ab 27.07. | Kimi K3 | Stärkste Open-Source-Gewichte bisher |
Moonshot bestätigt: Am 27. Juli 2026 erscheinen vollständige Gewichte auf Hugging Face — erstes Open-Source-Modell über 2T, neuer Fine-Tuning-Standard. Training mit MXFP4-Gewichten + MXFP8-Aktivierungen (quantization-aware). Erwartete Framework-Unterstützung: vLLM, SGLang; MXFP4/NVFP4-Quantisierungen folgen schnell.
Zeitachse: 17.–20.07. WAIC → 27.07. Open Weights.
06 Zitierbare Daten, Quellen & Produktions-Fazit
- Gesamtparameter: 2,8T — größtes Open-Source-LLM
- MoE: 896 Experten, 16 aktiv (1,8 % Sparsity)
- Kontext: 1.048.576 Token
- KDA: KV-Cache −75 %, Decoding bis +6,3× bei 1M Token
- AttnRes: Trainings-Effizienz +25 %, Overhead <2 %
- Skalierung vs. K2: ~2,5×
- API: $3 / $15 / $0,30 (Input/Output/Cache) pro M Token
- China: ¥20 / ¥100 / ¥2 pro M Token
- ARR (06/2026): >300 Mio. USD; Bewertung 31,5 Mrd. USD
- AA Index v4.1: 57,1 (Platz 4)
- Open Weights: 27.07.2026 (Hugging Face)
Quellen können sich ändern — nach dem Release erneut prüfen:
Offizielle Quellen:
Moonshot AI — Kimi K3 Tech-Blog
Kimi API Platform — Dokumentation & Preise
Drittanalyse:
Artificial Analysis — Intelligence Index v4.1
OpenRouter — moonshotai/kimi-k3
Kimi K3 setzt neue Open-Source-Maßstäbe — doch reine API-Nutzung birgt Latenz-, Quota- und DSGVO-Risiken bei personenbezogenen Daten; Self-Hosting vor dem 27.07. unmöglich, danach Supernode-Pflicht; geteilte Cloud-VMs für Xcode und Agent-Toolchains leiden unter Hypervisor-Overhead. Wer native Apple-Silicon-Leistung, 7×24-Betrieb und stabile iOS-CI/CD für Kimi Code oder Claude Code braucht, findet in ZUKCLOUD Bare-Metal-Mac-mini-Cloud-Nodes die kontrollierbare Basis: dedizierte Physik, kein Virtualisierungsverlust, flexible Tages-/Wochen-/Monatsbuchung. Preise, Bestellung — oder das Bare-Metal-Architektur-Manifest für Agent-Hosting-Logik.
07 FAQ
F: Ist Kimi K3 kostenlos?
A: Consumer-Nutzung auf kimi.com kostenlos (max Reasoning). API: $3/$15 pro M Token.
F: Lokales Deployment möglich?
A: Gewichte ab 27.07.2026 auf Hugging Face. Produktion: 64+ Beschleuniger nötig.
F: K3 oder DeepSeek V4 Pro?
A: K3: 2× Parameter, 5× Kontext, stärkere Coding-Benchmarks. DeepSeek: Output $3,48/M — siehe DeepSeek-Chip-Ökosystem.
F: Nutzen von 1M Token?
A: Ja für Repo-Analyse, Langdokumente, Agent-Memory. Flat-Preis + hohe Cache-Rate senken effektive Kosten.
F: Wann low/high Reasoning?
A: Moonshot kündigt low und high für spätere Updates an; aktuell nur max.