Startseite / Blog / Kimi K3
ENGINEERING BLOG · 2026.07.17

Kimi K3 im Test:
2,8 Billionen Parameter — das größte Open-Source-LLM

Am 16. Juli 2026 hat Moonshot AI (月之暗面) Kimi K3 ohne große Keynote freigeschaltet — nur ein Banner in der API-Doku, ein Tech-Blog und sofort nutzbare Endpunkte. Dieser Test richtet sich an ML-Ingenieure, CTOs und Agent-Entwickler, die wissen wollen, ob das Modell mit 2,8 Billionen Parametern und 1 Mio. Token Kontext produktionsreif ist. Sie erhalten: Architektur-Specs, Benchmark-Tabellen gegen Claude Fable 5 und GPT-5.6 Sol, eine Preis-Matrix, sechs konkrete Anbindungsschritte und den Zeitplan für den Open-Weights-Release am 27. Juli 2026.

01

Kimi K3 ist derzeit das größte veröffentlichte Open-Source-LLM: 2,8 Billionen (2,8T) Parameter — rund 75 % mehr als DeepSeek V4 Pro (1,6T), 2,7× größer als Xiaomis Open-Source-Modell (1,02T) und mehr als siebenmal Ali (397B). Die Architektur ist ein sparsames MoE-System: 896 Experten, pro Forward-Pass werden 16 aktiviert (Sparsity 1,8 %). Dazu kommen 1.048.576 Token Kontext, native Bild- und Video-Verarbeitung sowie ein Fokus auf langlaufende Coding- und Wissensaufgaben.

Kimi K3 Kerndaten (Stand 16.07.2026)
Parameter Wert Einordnung
Gesamtparameter2,8TGrößtes Open-Source-LLM weltweit
MoE-Konfiguration896 / 16 aktivSparsity 1,8 %
Kontextfenster1.048.576 Token5× Claude Sonnet 5 (200K)
MultimodalJa (Bild/Video)OmniDocBench 91,1 (Spitze)
API-Modell-IDkimi-k3OpenAI-kompatibel
Open Weights27.07.2026Hugging Face — vollständige Gewichte

Strategischer Kontext: Kimi dominierte in 9 der letzten 12 Monate die Open-Source-Größenklasse; der Launch fällt in die Nacht vor der WAIC 2026 (17.–20. Juli). Moonshots ARR überschritt im Juni 2026 300 Mio. USD; die 6. Finanzierungsrunde setzte die Bewertung auf 31,5 Mrd. USD (pre-money). API-Umsatz macht über 70 % aus; internationale zahlende Nutzer wuchsen um 400 %.

Entscheidungsschmerzen, die Specs allein nicht lösen:

  • Cloud-Abhängigkeit bis 27.07.: Vor dem Gewichts-Drop hängt jede Produktions-Pipeline an Moonshots Infrastruktur — Latenz, Quotas und Preisänderungen liegen außerhalb Ihrer Kontrolle.
  • DSGVO bei API-Nutzung: Prompts, Code und Dokumente verlassen Ihre Perimeter und werden in Moonshots Cloud verarbeitet. Für personenbezogene Daten brauchen Sie Auftragsverarbeitungsverträge, Datenminimierung und ggf. EU-Rechenzentren — prüfen Sie die aktuelle DPA auf platform.kimi.ai vor produktivem Einsatz.
  • 1M Kontext ≠ kostenlos: Flat-Preise helfen, aber Agent-Workflows ohne persistente Dev-Umgebung scheitern an Wiederaufnahme und Toolchain-Integration.
  • Self-Hosting-Schwelle: Produktions-Inferenz erfordert laut Hersteller 64+ Beschleuniger — für KMU und Einzelentwickler bleibt nur die API.
  • Benchmark-Bias: Moonshot nutzt Kimi Code, Claude Claude Code, GPT Codex — unterschiedliche Harnesses; unabhängige Reproduktionen laufen noch.

02

K3 ist kein reines Parameter-Scaling. Im Vergleich zu den Modellen im OpenRouter-Juni-Ranking setzt Moonshot auf Effizienz bei langem Kontext und stabiles Training extremer MoE-Sparsity.

Kimi Delta Attention (KDA)

Standard-Transformer skaliert die Aufmerksamkeit quadratisch — bei 1M Token wird der KV-Cache zum Engpass. KDA mischt lineare und volle Attention in einem 3:1-Verhältnis:

  • Drei lineare Schichten für lokale Struktur (günstig), eine volle Attention für globalen Informationsfluss;
  • KV-Cache-Speicher: bis zu −75 %;
  • Decoding bei 1M Token: bis zu 6,3× schneller;
  • Übertrifft laut Moonshot reine Full-Attention-Baselines in kurzen, langen und RL-Skalierungs-Szenarien.

Attention Residuals (AttnRes)

  • Klassische Residual-Verbindungen verdünnen frühe Repräsentationen in tiefen Schichten;
  • AttnRes erlaubt selektives Abrufen hochwertiger früher Layer über die Tiefe hinweg;
  • Trainings-Effizienz: ca. +25 %, Mehraufwand unter 2 %.

Stable LatentMoE

Stable LatentMoE — begleitende Techniken
Technik Funktion
Quantile BalancingExperten-Zuweisung direkt aus Router-Quantilen — ohne heuristische Hyperparameter
Per-Head MuonHead-spezifische Optimierung für stabiles Großtraining
Sigmoid Tanh Unit (SiTU)Verbesserte Aktivierungskontrolle
Gated MLAHöhere Attention-Selektivität
Gesamteffekt~2,5× Skalierungseffizienz vs. Kimi K2

03

Alle Werte stammen aus Moonshots Self-Report vom 16.07.2026. Lesen Sie ergänzend Claude Code skalieren für Repo-Level-Bugfix-Szenarien.

Kern-Benchmarks (Moonshot, 16.07.2026)
Benchmark Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8
DeepSWE67,570,073,059,0
Program Bench77,876,877,671,9
Terminal Bench 2.188,384,688,884,6
FrontierSWE81,286,671,366,7
SWE Marathon42,035,039,040,0
BrowseComp91,288,090,484,3
Automation Bench30,829,129,727,2
GPQA-Diamond93,592,694,191,0
MMMU-Pro81,681,283,078,9
OmniDocBench91,189,885,887,9

Datengetriebene Lesart: K3 führt bei SWE Marathon (42,0) — dem Benchmark für stundenlange Coding-Sessions. Program Bench (77,8) knapp vorne. FrontierSWE gewinnt Fable 5 (86,6). Im Artificial Analysis Intelligence Index v4.1 liegt K3 mit 57,1 auf Platz vier hinter Fable 5 (59,9) und GPT-5.6 Sol (58,9).

Hinweis: Self-Report mit unterschiedlichen Harnesses — unabhängige Reproduktionen ausstehend.

04

Preis- und Kontextvergleich (USD pro 1M Token)
Modell Input Output Cache-Hit Kontext
Kimi K3$3,00$15,00$0,301M
Claude Sonnet 5$3,00$15,00200K
Claude Opus 4.8$5,00$25,00200K
GPT-5.5$5,00$30,00400K
DeepSeek V4 Pro$1,74$3,48$0,145128K
Kimi K2.6$0,95$4,00$0,16256K

K3 kostet wie Sonnet 5 ($3/$15), bietet aber 5× Kontext. Cache-Hits ab $0,30/M; Moonshot berichtet über 90 % Cache-Hit-Rate in Coding-Szenarien. China-Preise: ¥20 / ¥100 / ¥2 (Input/Output/Cache) pro M Token. Consumer: kostenlos auf kimi.com; Prepaid ab ¥199 (Rabatt bis 11.08.).

6 Anbindungsschritte:

  1. Moonshot-Konto anlegen: Registrierung auf platform.kimi.ai oder kimi.com — Google-Login möglich.
  2. API-Key erzeugen: Im Dashboard generieren und sicher speichern (einmalige Anzeige).
  3. Modell-ID setzen: kimi-k3; OpenRouter: moonshotai/kimi-k3 ohne Aufschlag.
  4. OpenAI-kompatiblen Client konfigurieren: base_url = https://api.moonshot.ai/v1.
  5. Smoke-Test senden: Kurzer Prompt zur Latenz- und Quota-Prüfung.
  6. Cache-aware Workflow aktivieren: System-Prompts und Tool-Definitionen wiederverwenden für 90 %+ Cache-Hits.
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Analysiere diesen Code..."}]
)
print(response.choices[0].message.content)

05

Modellwahl nach Anwendungsfall
Szenario Empfehlung Begründung
Langlaufende Coding-TasksKimi K3SWE Marathon #1, längster Kontext
Repo-Level BugfixesClaude Fable 5FrontierSWE führend
Terminal-/Tool-AgentenGPT-5.6 SolTerminal Bench 2.1 Spitze
Langdokumente + MultimodalKimi K3OmniDocBench 91,1, 1M Kontext
KostenoptimierungDeepSeek V4 ProOutput $3,48/M
Self-Host ab 27.07.Kimi K3Stärkste Open-Source-Gewichte bisher

Moonshot bestätigt: Am 27. Juli 2026 erscheinen vollständige Gewichte auf Hugging Face — erstes Open-Source-Modell über 2T, neuer Fine-Tuning-Standard. Training mit MXFP4-Gewichten + MXFP8-Aktivierungen (quantization-aware). Erwartete Framework-Unterstützung: vLLM, SGLang; MXFP4/NVFP4-Quantisierungen folgen schnell.

Zeitachse: 17.–20.07. WAIC → 27.07. Open Weights.

06

  • Gesamtparameter: 2,8T — größtes Open-Source-LLM
  • MoE: 896 Experten, 16 aktiv (1,8 % Sparsity)
  • Kontext: 1.048.576 Token
  • KDA: KV-Cache −75 %, Decoding bis +6,3× bei 1M Token
  • AttnRes: Trainings-Effizienz +25 %, Overhead <2 %
  • Skalierung vs. K2: ~2,5×
  • API: $3 / $15 / $0,30 (Input/Output/Cache) pro M Token
  • China: ¥20 / ¥100 / ¥2 pro M Token
  • ARR (06/2026): >300 Mio. USD; Bewertung 31,5 Mrd. USD
  • AA Index v4.1: 57,1 (Platz 4)
  • Open Weights: 27.07.2026 (Hugging Face)

Quellen können sich ändern — nach dem Release erneut prüfen:

Offizielle Quellen:

Moonshot AI — Kimi K3 Tech-Blog

Kimi API Platform — Dokumentation & Preise

Drittanalyse:

Artificial Analysis — Intelligence Index v4.1

OpenRouter — moonshotai/kimi-k3

Kimi K3 setzt neue Open-Source-Maßstäbe — doch reine API-Nutzung birgt Latenz-, Quota- und DSGVO-Risiken bei personenbezogenen Daten; Self-Hosting vor dem 27.07. unmöglich, danach Supernode-Pflicht; geteilte Cloud-VMs für Xcode und Agent-Toolchains leiden unter Hypervisor-Overhead. Wer native Apple-Silicon-Leistung, 7×24-Betrieb und stabile iOS-CI/CD für Kimi Code oder Claude Code braucht, findet in ZUKCLOUD Bare-Metal-Mac-mini-Cloud-Nodes die kontrollierbare Basis: dedizierte Physik, kein Virtualisierungsverlust, flexible Tages-/Wochen-/Monatsbuchung. Preise, Bestellung — oder das Bare-Metal-Architektur-Manifest für Agent-Hosting-Logik.

07

F: Ist Kimi K3 kostenlos?
A: Consumer-Nutzung auf kimi.com kostenlos (max Reasoning). API: $3/$15 pro M Token.

F: Lokales Deployment möglich?
A: Gewichte ab 27.07.2026 auf Hugging Face. Produktion: 64+ Beschleuniger nötig.

F: K3 oder DeepSeek V4 Pro?
A: K3: 2× Parameter, 5× Kontext, stärkere Coding-Benchmarks. DeepSeek: Output $3,48/M — siehe DeepSeek-Chip-Ökosystem.

F: Nutzen von 1M Token?
A: Ja für Repo-Analyse, Langdokumente, Agent-Memory. Flat-Preis + hohe Cache-Rate senken effektive Kosten.

F: Wann low/high Reasoning?
A: Moonshot kündigt low und high für spätere Updates an; aktuell nur max.