Wer im Juli 2026 noch nach Benchmark-Charts von vor zwei Monaten ein LLM auswählt, liegt bereits hinterher. OpenRouter — der größte neutrale LLM-Routing-Marktplatz — veröffentlicht etwas Ehrlicheres als jede Anbieterankündigung: reales, bezahltes Produktions-Token-Volumen. Dieser Artikel wertet Daten bis 25. Juli 2026 aus: Xiaomis Mimo V2.5 an der Spitze, chinesische Labs überschreiten 46 % Marktanteil, und die Hantel-Verteilung zwischen Volumen- und Qualitätsführern. Fazit vorweg: Die entscheidende Frage ist nicht, wer diese Woche Nr. 1 ist, sondern auf welcher Seite der Hantel Ihre Workloads liegen.
01 Noch das Mentalmodell von 2025? Vier Auswahl-Fallstricke
Das Juli-Board bewegt sich schneller als die OpenRouter-Rankings vom Juni, mit härterem Wettbewerb innerhalb des chinesischen Lagers. Wer weiterhin „US-Big-Three = sichere Wahl“ als Default nutzt, zahlt diese versteckten Kosten:
- Volumen-Nr. 1 mit Qualitäts-Nr. 1 verwechseln: OpenRouter rankt Token-Nutzung, nicht Fähigkeit. Mimo V2.5 mit 1,4T Tokens/Tag heißt nicht, dass es für Ihre schwerste agentische Planung passt — Claude führt bei schwierigem Reasoning weiterhin die Ausgaben an.
- ~35-fache Preislücke ignorieren: DeepSeek V4 Flash kostet rund $0,05–0,14 pro Million Input-Tokens; GPT-5.5 liegt bei etwa $5,00. Das Leaderboard spiegelt Preissensibilität ebenso wie reine Fähigkeit wider.
- Nur Modell-Charts, nie App-Charts: Allein Hermes Agent hält ~45 % des erfassten App-Token-Anteils; Roleplay- und Companion-Apps bewegen ernsthaftes Volumen, das Enterprise-Berichterstattung kaum erwähnt.
- Single-Vendor-Lock-in: Der „Modell des Monats“-Titel rotiert — MiniMax M2.5 im Februar, MiMo-V2-Pro im April, Mimo V2.5 im Juli. Siehe unseren OpenRouter-Integrationsleitfaden für Fallback-Architektur.
In einem Satz: Fähigkeit und Popularität divergieren — chinesische Open-Weight-Modelle kaufen Volumen mit Preis; US-Closed-Frontier-Labs verteidigen Preismacht bei schweren Aufgaben.
02 OpenRouter Juli 2026: Top-Modelle und Anbieteranteile
Modell-Token-Zahlen unten Stand 25. Juli 2026 (Rankings ändern sich täglich — vor Zitaten unter openrouter.ai/rankings prüfen).
| Rang | Modell | Anbieter | Tages-Tokens | 30-Tage-Summe |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1.4T | 31.2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943.9B | 23.6T |
| 3 | Hy3 | Tencent | 590B | 23.4T |
| 4 | Nemotron 3 Ultra 550B (kostenlos) | NVIDIA | 428.6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413.7B | 11.6T |
| 6 | GLM 5.2 | Z.ai | 316.7B | 13.3T |
| 7 | MiniMax M3 | MiniMax | 262.5B | 15.1T |
| 8 | Step 3.7 Flash | StepFun | 204.8B | 5.9T |
| 9 | Kimi K3 | Moonshot AI | 157.6B | 1.6T (Neueinstieg) |
| 10 | Ling 3.0 Flash | InclusionAI | 128.3B | 417.3B |
| 11 | Gemini 3 Flash Preview | 106.3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99.5B | 3.6T |
Sieben der Top-10-Modellplätze gehören chinesischen Labs; die US-Seite wird hauptsächlich von Nemotron 3 Ultra, Claude und Gemini gehalten. DeepSeek bleibt stabiler Nr.-1-Anbieter nach Anteil (16–18 %), doch der monatliche Volumen-Champion rotiert innerhalb des chinesischen Lagers.
| Anbieter | Herkunft | Anteil (ca.) |
|---|---|---|
| DeepSeek | China | 16%–18% |
| Xiaomi | China | 8%–18% (Mimo V2.5-Spike) |
| Anthropic | USA | 10%–15% |
| Tencent | China | 8%–13% |
| USA | 8%–13% | |
| Z.ai | China | 4%–7% |
| OpenAI | USA | 6%–8% |
| Chinesische Labs gesamt | — | ~46% (vor einem Jahr <2%) |
| US-Big-Three gesamt | — | ~30%–36% (vor einem Jahr ~70%) |
| Modell | Input/M | Output/M | Positionierung |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0.05–0.14 | ~$0.24–0.28 | Bestes Preis-Leistungs-Verhältnis; Agentic Coding |
| Nemotron 3 Ultra | $0.42 (kostenlose Stufe) | $2.61 | US Open-Weight, NVIDIA-Stack |
| MiniMax M3 | $0.10 | $1.21 | Multimodal/Langkontext-Budget |
| GLM 5.2 | $0.45 | $3.31 | Opus-nahe Planung unter Open-Modellen |
| Kimi K3 | ~$3 | ~$15 | 1,4TB Open Weights, Closed-Tier-Fähigkeit |
| Claude Opus 5 | $5 (Fast $10) | $25 (Fast $50) | Closed Frontier; Top-Juli-Benchmarks |
03 LLM-Preis-Leistung: Nutzungsrang ist kein Qualitätssignal
Jede OpenRouter-Zusammenfassung sollte mit diesem Vorbehalt beginnen: Diese Rankings messen Token-Volumen, nicht Fähigkeit. Ein günstiges Modell hinter einer High-Traffic-Consumer-App kann ein stärkeres Modell überholen, das Teams für die härtesten 10 % der Arbeit reservieren.
Ausgaben nach Aufgabenkategorie erzählen eine andere Geschichte: Allgemeiner Chat 35,7 %, agentische Workflows 30,4 %, Code 26,5 %, Datenarbeit 7,5 %. Bei Klassifikation und schwerem Reasoning — Claude Sonnet 4.6 und Claude Opus 4.7 teilen sich je 13,5 % der Ausgaben, GPT-5.5 liegt mit 11,6 % auf Platz drei — die günstigen Open-Modelle aus den Volumen-Charts tauchen hier kaum auf.
Der Markt spaltet sich: Günstige chinesische Open-Weight-Modelle absorbieren volumenstarke, fehlertolerante Workloads (Chat, Kreativschreiben, Roleplay, Routine-Coding), während geschlossene Frontier-Modelle Preismacht bei schwerer, fehlerintoleranter Arbeit behalten. Anthropics Claude-Opus-5-Launch am 24. Juli — FrontierBench v0.1 mit 43,3 % vs. GPT-5.6 Sol mit 37,5 % bei Opus-Preisen $5/$25 pro Million Tokens — ist der klarste Beleg. Kontext: Claude Opus 5 und Kimi-K3-Kontroverse und Kimi-K3-Tiefenanalyse.
04 App-Leaderboard und 6-Schritte-Routing-Leitfaden
Das App-Leaderboard (openrouter.ai/apps) zeigt, wofür diese Modelle tatsächlich genutzt werden:
- Hermes Agent (Nous Researchs selbstverbessernder Agent) hält ~45 % des erfassten App-Token-Anteils;
- Coding-Agents füllen den Großteil der Top 10: Kilo Code (~13 %), OpenClaw (~9 %), Claude Code (~6 %), Cline (~1,7 %);
- Die Cline → Roo Code → Kilo Code-Fork-Kette zeigt: Der jüngste Fork hat die Vorfahren überholt — First-Mover-Vorteil in Open-Source-Dev-Tools hält nicht lange;
- Roleplay- und Companion-Apps (Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI) bewegen ernsthaftes Volumen — OpenRouter × a16z State of AI: Kreatives Roleplay macht über die Hälfte der Open-Model-Nutzung aus.
| Rang | App | Kategorie | Anteil |
|---|---|---|---|
| 1 | Hermes Agent | Persönlicher Agent / CLI | ~45% |
| 2 | Kilo Code | Coding-Agent | ~13% |
| 3 | OpenClaw | Allgemeiner Agent | ~9% |
| 4 | Claude Code | Coding-Agent | ~6% |
| 5 | Descript | Content-Produktion | ~4.5% |
| 6 | pi | Agent | ~3.3% |
| 7 | Lemonade | Companion / Gaming | ~2.1% |
| 8 | ISEKAI ZERO | Roleplay | ~2.0% |
| 9 | Janitor AI | Roleplay | ~1.8% |
| 10 | Cline | Coding-Agent (IDE) | ~1.7% |
Sechs Schritte für task-basiertes Routing aus dem Juli-Hantel-Muster:
- Aufgaben und Fehlertoleranz inventarisieren: Workloads in Chat/Kreativ, Agent-Orchestrierung, Code und schweres Reasoning aufteilen; akzeptable Fehlerraten und Latenz-Obergrenzen pro Stufe taggen.
- Auf Volumen- und Ausgaben-Charts validieren: High-Volume-Arbeit standardmäßig auf DeepSeek V4 Flash und GLM 5.2; Claude Opus 5 / GPT-5.6 für Schritte reservieren, wo günstigere Modelle tatsächlich scheitern.
- OpenRouter als Prototyping-Sandbox nutzen: Ein API-Key über Hunderte Modelle für schnelle A/B-Tests; Latenz und Qualität auf echten Tasks messen, nicht Leaderboard-Rang. Für EU-Unternehmen: Datenverarbeitung über US-Routing kann DSGVO-Auftragsverarbeitungspflichten auslösen — AV-Verträge und Datenfluss-Dokumentation prüfen.
- Hybrid-Routing zur Kostenreduktion: Coding-Flows auf DeepSeek V4 Flash starten, nur bei Fehlschlag eskalieren; siehe DeepSeek V4 GA Preise und Migrationsleitfaden.
- Anbieter-Sicherheit in die Scorecard aufnehmen: OpenAIs Sandbox-Escape-Offenlegung und der vorgeschlagene US „AI Kill Switch Act“ machen Sicherheitsbilanz zum formalen Auswahlkriterium — besonders für agentische Deployments mit personenbezogenen Daten unter DSGVO.
- Stabile Compute-Basis für Agent-Produktion vorbereiten: Lokale Claude Code / Cursor Agents plus Cloud-API-Calls brauchen 24/7-Uptime; Bare-Metal-Mac-mini vs. virtualisierte Stacks auf Hypervisor-Overhead und Metal-Toolchain-Kompatibilität prüfen.
05 August-Ausblick, zitierbare Daten und FAQ
August-Ausblick basierend auf Juli-Trajektorie:
- Chinesische Open-Weight-Gesamtanteile steigen wahrscheinlich Richtung oder über 50 %, sofern kein großer US-Anbieter Preise senkt;
- Der monatliche Volumen-Champion rotiert weiter — August-Release-Kadenz von Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax und Moonshot beobachten;
- Anthropic könnte eine günstigere volumenorientierte Stufe liefern; Opus 5 ist bereits ihr viertes Flaggschiff in unter zwei Monaten;
- Kimi K3s 1,4TB Weights dürften in 2–4 Wochen Community-Quantisierungen sehen;
- Sicherheit und Governance werden echte Auswahlkriterien — inklusive DSGVO-konformer Datenhaltung bei Enterprise-Beschaffung.
- Mimo V2.5 Tagesvolumen: ~1,4 Billionen Tokens/Tag am 25. Juli; 31,2T über 30 Tage.
- US-China-Preislücke: DeepSeek V4 Flash ~$0,05–0,14/M Input vs. GPT-5.5 ~$5/M — rund 35-fach.
- Chinesische Anteilsverschiebung: Von unter 2 % auf ~46 % in 12 Monaten — eine der steilsten Verschiebungen in der KI-Branche.
- Claude Opus 5 Benchmark: FrontierBench v0.1 bei 43,3 %; Preise $5/$25 pro Million Tokens (Fast $10/$50).
FAQ
Wonach sortiert OpenRouter?
Nach realem bezahltem Token-Volumen — Produktions-Routing-Entscheidungen, die Entwickler bezahlen — nicht nach Benchmarks.
Welches Modell führte OpenRouter im Juli 2026 an?
Xiaomis Mimo V2.5 mit rund 1,4 Billionen Tokens pro Tag am 25. Juli 2026.
Welchen Anteil haben chinesische Modelle auf OpenRouter?
Rund 46 % des erfassten Token-Volumens, vor einem Jahr unter 2 %.
Bedeutet hoher Nutzungsrang bessere Qualität?
Nicht unbedingt. Volumen-tolerante Arbeit auf günstige Open-Modelle routen; Premium-Closed-Modelle für schwere Aufgaben reservieren.
Primärquellen unten; Rankings ändern sich täglich — aktuelle Zahlen vor Zitaten prüfen.
OpenRouter offizielle Rankings
OpenRouter Blog: DeepSeek V4 Adoption
OpenRouter × a16z State of AI Report
Die Geschichte aus dem Juli: Fähigkeit und Popularität divergieren. Für Teams, die Claude Code, Kilo Code oder Custom Agents 24/7 betreiben, löst API-Routing allein nicht lokale Toolchain, Metal-Beschleunigung oder Uptime — virtualisierte Mac-Umgebungen bringen Hypervisor-Overhead und iOS-CI-Kompatibilitätsrisiken. Für Produktionsumgebungen, die native Compute ohne Overhead, stabiles iOS CI/CD und 24/7-KI-Agent-Automatisierung brauchen, sind ZUKCLOUD Bare-Metal-Mac-mini-Cloud-Nodes in der Regel die bessere Wahl: dedizierte Apple-Silicon-Hardware, kein Hypervisor-Steuer, Always-on, flexible Tages-/Wochen-/Monatsabrechnung. Siehe unser Bare-Metal-Architektur-Manifest.