Startseite / Blog / OpenRouter Rankings
ENGINEERING BLOG · 2026.07.27

OpenRouter-Rankings Juli 2026:
Wer gewinnt den KI-Modell-Traffic-Krieg?

Wer im Juli 2026 noch nach Benchmark-Charts von vor zwei Monaten ein LLM auswählt, liegt bereits hinterher. OpenRouter — der größte neutrale LLM-Routing-Marktplatz — veröffentlicht etwas Ehrlicheres als jede Anbieterankündigung: reales, bezahltes Produktions-Token-Volumen. Dieser Artikel wertet Daten bis 25. Juli 2026 aus: Xiaomis Mimo V2.5 an der Spitze, chinesische Labs überschreiten 46 % Marktanteil, und die Hantel-Verteilung zwischen Volumen- und Qualitätsführern. Fazit vorweg: Die entscheidende Frage ist nicht, wer diese Woche Nr. 1 ist, sondern auf welcher Seite der Hantel Ihre Workloads liegen.

01

Das Juli-Board bewegt sich schneller als die OpenRouter-Rankings vom Juni, mit härterem Wettbewerb innerhalb des chinesischen Lagers. Wer weiterhin „US-Big-Three = sichere Wahl“ als Default nutzt, zahlt diese versteckten Kosten:

  • Volumen-Nr. 1 mit Qualitäts-Nr. 1 verwechseln: OpenRouter rankt Token-Nutzung, nicht Fähigkeit. Mimo V2.5 mit 1,4T Tokens/Tag heißt nicht, dass es für Ihre schwerste agentische Planung passt — Claude führt bei schwierigem Reasoning weiterhin die Ausgaben an.
  • ~35-fache Preislücke ignorieren: DeepSeek V4 Flash kostet rund $0,05–0,14 pro Million Input-Tokens; GPT-5.5 liegt bei etwa $5,00. Das Leaderboard spiegelt Preissensibilität ebenso wie reine Fähigkeit wider.
  • Nur Modell-Charts, nie App-Charts: Allein Hermes Agent hält ~45 % des erfassten App-Token-Anteils; Roleplay- und Companion-Apps bewegen ernsthaftes Volumen, das Enterprise-Berichterstattung kaum erwähnt.
  • Single-Vendor-Lock-in: Der „Modell des Monats“-Titel rotiert — MiniMax M2.5 im Februar, MiMo-V2-Pro im April, Mimo V2.5 im Juli. Siehe unseren OpenRouter-Integrationsleitfaden für Fallback-Architektur.

In einem Satz: Fähigkeit und Popularität divergieren — chinesische Open-Weight-Modelle kaufen Volumen mit Preis; US-Closed-Frontier-Labs verteidigen Preismacht bei schweren Aufgaben.

02

Modell-Token-Zahlen unten Stand 25. Juli 2026 (Rankings ändern sich täglich — vor Zitaten unter openrouter.ai/rankings prüfen).

Top 12 Modelle nach täglichem Token-Volumen (2026-07-25)
Rang Modell Anbieter Tages-Tokens 30-Tage-Summe
1Mimo V2.5Xiaomi1.4T31.2T
2DeepSeek V4 FlashDeepSeek943.9B23.6T
3Hy3Tencent590B23.4T
4Nemotron 3 Ultra 550B (kostenlos)NVIDIA428.6B9T
5DeepSeek V4 ProDeepSeek413.7B11.6T
6GLM 5.2Z.ai316.7B13.3T
7MiniMax M3MiniMax262.5B15.1T
8Step 3.7 FlashStepFun204.8B5.9T
9Kimi K3Moonshot AI157.6B1.6T (Neueinstieg)
10Ling 3.0 FlashInclusionAI128.3B417.3B
11Gemini 3 Flash PreviewGoogle106.3B4T
12Claude Sonnet 5Anthropic99.5B3.6T

Sieben der Top-10-Modellplätze gehören chinesischen Labs; die US-Seite wird hauptsächlich von Nemotron 3 Ultra, Claude und Gemini gehalten. DeepSeek bleibt stabiler Nr.-1-Anbieter nach Anteil (16–18 %), doch der monatliche Volumen-Champion rotiert innerhalb des chinesischen Lagers.

Anbieter-Token-Anteile (7-Tage-Schätzungen, gerundet)
Anbieter Herkunft Anteil (ca.)
DeepSeekChina16%–18%
XiaomiChina8%–18% (Mimo V2.5-Spike)
AnthropicUSA10%–15%
TencentChina8%–13%
GoogleUSA8%–13%
Z.aiChina4%–7%
OpenAIUSA6%–8%
Chinesische Labs gesamt~46% (vor einem Jahr <2%)
US-Big-Three gesamt~30%–36% (vor einem Jahr ~70%)
Preise und Positionierung (Juli 2026)
Modell Input/M Output/M Positionierung
DeepSeek V4 Flash~$0.05–0.14~$0.24–0.28Bestes Preis-Leistungs-Verhältnis; Agentic Coding
Nemotron 3 Ultra$0.42 (kostenlose Stufe)$2.61US Open-Weight, NVIDIA-Stack
MiniMax M3$0.10$1.21Multimodal/Langkontext-Budget
GLM 5.2$0.45$3.31Opus-nahe Planung unter Open-Modellen
Kimi K3~$3~$151,4TB Open Weights, Closed-Tier-Fähigkeit
Claude Opus 5$5 (Fast $10)$25 (Fast $50)Closed Frontier; Top-Juli-Benchmarks

03

Jede OpenRouter-Zusammenfassung sollte mit diesem Vorbehalt beginnen: Diese Rankings messen Token-Volumen, nicht Fähigkeit. Ein günstiges Modell hinter einer High-Traffic-Consumer-App kann ein stärkeres Modell überholen, das Teams für die härtesten 10 % der Arbeit reservieren.

Ausgaben nach Aufgabenkategorie erzählen eine andere Geschichte: Allgemeiner Chat 35,7 %, agentische Workflows 30,4 %, Code 26,5 %, Datenarbeit 7,5 %. Bei Klassifikation und schwerem Reasoning — Claude Sonnet 4.6 und Claude Opus 4.7 teilen sich je 13,5 % der Ausgaben, GPT-5.5 liegt mit 11,6 % auf Platz drei — die günstigen Open-Modelle aus den Volumen-Charts tauchen hier kaum auf.

Der Markt spaltet sich: Günstige chinesische Open-Weight-Modelle absorbieren volumenstarke, fehlertolerante Workloads (Chat, Kreativschreiben, Roleplay, Routine-Coding), während geschlossene Frontier-Modelle Preismacht bei schwerer, fehlerintoleranter Arbeit behalten. Anthropics Claude-Opus-5-Launch am 24. Juli — FrontierBench v0.1 mit 43,3 % vs. GPT-5.6 Sol mit 37,5 % bei Opus-Preisen $5/$25 pro Million Tokens — ist der klarste Beleg. Kontext: Claude Opus 5 und Kimi-K3-Kontroverse und Kimi-K3-Tiefenanalyse.

04

Das App-Leaderboard (openrouter.ai/apps) zeigt, wofür diese Modelle tatsächlich genutzt werden:

  • Hermes Agent (Nous Researchs selbstverbessernder Agent) hält ~45 % des erfassten App-Token-Anteils;
  • Coding-Agents füllen den Großteil der Top 10: Kilo Code (~13 %), OpenClaw (~9 %), Claude Code (~6 %), Cline (~1,7 %);
  • Die Cline → Roo Code → Kilo Code-Fork-Kette zeigt: Der jüngste Fork hat die Vorfahren überholt — First-Mover-Vorteil in Open-Source-Dev-Tools hält nicht lange;
  • Roleplay- und Companion-Apps (Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI) bewegen ernsthaftes Volumen — OpenRouter × a16z State of AI: Kreatives Roleplay macht über die Hälfte der Open-Model-Nutzung aus.
Top 10 Apps nach Token-Anteil (ca.)
Rang App Kategorie Anteil
1Hermes AgentPersönlicher Agent / CLI~45%
2Kilo CodeCoding-Agent~13%
3OpenClawAllgemeiner Agent~9%
4Claude CodeCoding-Agent~6%
5DescriptContent-Produktion~4.5%
6piAgent~3.3%
7LemonadeCompanion / Gaming~2.1%
8ISEKAI ZERORoleplay~2.0%
9Janitor AIRoleplay~1.8%
10ClineCoding-Agent (IDE)~1.7%

Sechs Schritte für task-basiertes Routing aus dem Juli-Hantel-Muster:

  1. Aufgaben und Fehlertoleranz inventarisieren: Workloads in Chat/Kreativ, Agent-Orchestrierung, Code und schweres Reasoning aufteilen; akzeptable Fehlerraten und Latenz-Obergrenzen pro Stufe taggen.
  2. Auf Volumen- und Ausgaben-Charts validieren: High-Volume-Arbeit standardmäßig auf DeepSeek V4 Flash und GLM 5.2; Claude Opus 5 / GPT-5.6 für Schritte reservieren, wo günstigere Modelle tatsächlich scheitern.
  3. OpenRouter als Prototyping-Sandbox nutzen: Ein API-Key über Hunderte Modelle für schnelle A/B-Tests; Latenz und Qualität auf echten Tasks messen, nicht Leaderboard-Rang. Für EU-Unternehmen: Datenverarbeitung über US-Routing kann DSGVO-Auftragsverarbeitungspflichten auslösen — AV-Verträge und Datenfluss-Dokumentation prüfen.
  4. Hybrid-Routing zur Kostenreduktion: Coding-Flows auf DeepSeek V4 Flash starten, nur bei Fehlschlag eskalieren; siehe DeepSeek V4 GA Preise und Migrationsleitfaden.
  5. Anbieter-Sicherheit in die Scorecard aufnehmen: OpenAIs Sandbox-Escape-Offenlegung und der vorgeschlagene US „AI Kill Switch Act“ machen Sicherheitsbilanz zum formalen Auswahlkriterium — besonders für agentische Deployments mit personenbezogenen Daten unter DSGVO.
  6. Stabile Compute-Basis für Agent-Produktion vorbereiten: Lokale Claude Code / Cursor Agents plus Cloud-API-Calls brauchen 24/7-Uptime; Bare-Metal-Mac-mini vs. virtualisierte Stacks auf Hypervisor-Overhead und Metal-Toolchain-Kompatibilität prüfen.

05

August-Ausblick basierend auf Juli-Trajektorie:

  • Chinesische Open-Weight-Gesamtanteile steigen wahrscheinlich Richtung oder über 50 %, sofern kein großer US-Anbieter Preise senkt;
  • Der monatliche Volumen-Champion rotiert weiter — August-Release-Kadenz von Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax und Moonshot beobachten;
  • Anthropic könnte eine günstigere volumenorientierte Stufe liefern; Opus 5 ist bereits ihr viertes Flaggschiff in unter zwei Monaten;
  • Kimi K3s 1,4TB Weights dürften in 2–4 Wochen Community-Quantisierungen sehen;
  • Sicherheit und Governance werden echte Auswahlkriterien — inklusive DSGVO-konformer Datenhaltung bei Enterprise-Beschaffung.
  • Mimo V2.5 Tagesvolumen: ~1,4 Billionen Tokens/Tag am 25. Juli; 31,2T über 30 Tage.
  • US-China-Preislücke: DeepSeek V4 Flash ~$0,05–0,14/M Input vs. GPT-5.5 ~$5/M — rund 35-fach.
  • Chinesische Anteilsverschiebung: Von unter 2 % auf ~46 % in 12 Monaten — eine der steilsten Verschiebungen in der KI-Branche.
  • Claude Opus 5 Benchmark: FrontierBench v0.1 bei 43,3 %; Preise $5/$25 pro Million Tokens (Fast $10/$50).

FAQ

Wonach sortiert OpenRouter?

Nach realem bezahltem Token-Volumen — Produktions-Routing-Entscheidungen, die Entwickler bezahlen — nicht nach Benchmarks.

Welches Modell führte OpenRouter im Juli 2026 an?

Xiaomis Mimo V2.5 mit rund 1,4 Billionen Tokens pro Tag am 25. Juli 2026.

Welchen Anteil haben chinesische Modelle auf OpenRouter?

Rund 46 % des erfassten Token-Volumens, vor einem Jahr unter 2 %.

Bedeutet hoher Nutzungsrang bessere Qualität?

Nicht unbedingt. Volumen-tolerante Arbeit auf günstige Open-Modelle routen; Premium-Closed-Modelle für schwere Aufgaben reservieren.

Primärquellen unten; Rankings ändern sich täglich — aktuelle Zahlen vor Zitaten prüfen.

OpenRouter offizielle Rankings

OpenRouter Apps Leaderboard

OpenRouter Blog: DeepSeek V4 Adoption

OpenRouter × a16z State of AI Report

Die Geschichte aus dem Juli: Fähigkeit und Popularität divergieren. Für Teams, die Claude Code, Kilo Code oder Custom Agents 24/7 betreiben, löst API-Routing allein nicht lokale Toolchain, Metal-Beschleunigung oder Uptime — virtualisierte Mac-Umgebungen bringen Hypervisor-Overhead und iOS-CI-Kompatibilitätsrisiken. Für Produktionsumgebungen, die native Compute ohne Overhead, stabiles iOS CI/CD und 24/7-KI-Agent-Automatisierung brauchen, sind ZUKCLOUD Bare-Metal-Mac-mini-Cloud-Nodes in der Regel die bessere Wahl: dedizierte Apple-Silicon-Hardware, kein Hypervisor-Steuer, Always-on, flexible Tages-/Wochen-/Monatsabrechnung. Siehe unser Bare-Metal-Architektur-Manifest.