如果你是一名在 2026 年 7 月仍凭几个月前印象判断「哪个大模型最值得用」的 AI 开发者或技术决策者,OpenRouter 最新排行榜会迫使你刷新认知:它不测跑分、不看营销通稿,只看开发者真金白银把请求发到了谁家。本文基于 OpenRouter 截至 2026 年 7 月 25 日的数据,完整拆解 7 月三个关键变化——小米 Mimo V2.5 登顶、中国模型份额突破 46%、用量与能力分道扬镳的哑铃型市场——并给出 8 月趋势预测与分层路由实操建议。结论先行:最值钱的能力不是盯住「谁是第一」,而是建立自己的评测体系与任务分层路由策略。
01 还在用旧印象选模型?OpenRouter 排行榜解读前的四大痛点
七月榜单与6 月 OpenRouter 排行榜相比,名次波动更快、中国阵营内部竞争更激烈。若你仍按 2025 年「美国三巨头 = 默认选择」的心智做选型,会撞上以下隐性成本:
- 混淆「用量第一」与「质量第一」:OpenRouter 排的是 Token 用量,不是能力。Mimo V2.5 日用量 1.4T 不代表它适合你的复杂推理 Agent——Claude 系列在难任务消费份额仍居首。
- 忽视 35 倍价差的经济学:DeepSeek V4 Flash 输入约 $0.05–0.14/百万 Token,GPT-5.5 约 $5/百万 Token。理性开发者用脚投票,榜单反映的是价格敏感度,不完全是能力排序。
- 只看模型层、忽视应用层:Hermes Agent 单应用占约 45% 应用 Token;角色扮演类应用占据开源模型流量半壁江山,企业报道几乎看不到——若只读 B 端新闻,你会错过真实市场结构。
- 单模型绑定与路由缺失:「月度冠军」从 MiniMax M2.5 到 MiMo-V2-Pro 再到 Mimo V2.5 频繁易主;硬编码单一供应商等于主动积累技术债。可参考OpenRouter 多模型接入教程搭建 fallback 架构。
一句话:capability(能力)和 popularity(用量)正在分道扬镳——中国开源模型靠价格吃下跑量任务,美国闭源旗舰守着难任务的定价权。
02 OpenRouter 2026 年 7 月排行榜:模型 Top 12 与厂商份额
以下模型 Token 用量数据截至 2026 年 7 月 25 日(榜单每日变动,发布前请以 openrouter.ai/rankings 实时数据为准)。
| 排名 | 模型 | 厂商 | 单日 Token | 近 30 天累计 |
|---|---|---|---|---|
| 1 | Mimo V2.5 | 小米 | 1.4T | 31.2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943.9B | 23.6T |
| 3 | Hy3 | 腾讯 | 590B | 23.4T |
| 4 | Nemotron 3 Ultra 550B(免费) | NVIDIA | 428.6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413.7B | 11.6T |
| 6 | GLM 5.2 | 智谱 Z.ai | 316.7B | 13.3T |
| 7 | MiniMax M3 | MiniMax | 262.5B | 15.1T |
| 8 | Step 3.7 Flash | 阶跃星辰 | 204.8B | 5.9T |
| 9 | Kimi K3 | 月之暗面 | 157.6B | 1.6T(新上榜) |
| 10 | Ling 3.0 Flash | 蚂蚁 InclusionAI | 128.3B | 417.3B |
| 11 | Gemini 3 Flash Preview | 106.3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99.5B | 3.6T |
前十名中,中国厂商模型占据七席;美国阵营主要由 Nemotron 3 Ultra、Claude、Gemini 守住位置。DeepSeek 仍是单一厂商中份额最稳定的第一名(约 16%–18%),但「月度冠军模型」频繁易主——从今年 2 月 MiniMax M2.5、4 月 MiMo-V2-Pro 到 7 月 Mimo V2.5,中国阵营内部竞争同样激烈。
| 厂商 | 归属 | 份额(约) |
|---|---|---|
| DeepSeek | 中国 | 16%–18% |
| 小米 | 中国 | 8%–18%(Mimo V2.5 暴涨,波动最大) |
| Anthropic | 美国 | 10%–15% |
| 腾讯 | 中国 | 8%–13% |
| 美国 | 8%–13% | |
| 智谱 Z.ai | 中国 | 4%–7% |
| OpenAI | 美国 | 6%–8% |
| 中国厂商合计 | — | 约 46%(一年前 <2%) |
| 美国三巨头合计 | — | 约 30%–36%(一年前约 70%) |
| 模型 | 输入/M | 输出/M | 定位 |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0.05–0.14 | ~$0.24–0.28 | 性价比之王,Agentic Coding 首选 |
| Nemotron 3 Ultra | $0.42(另有免费版) | $2.61 | 美系全开源,NVIDIA 生态 |
| MiniMax M3 | $0.10 | $1.21 | 多模态/长上下文预算之选 |
| GLM 5.2 | $0.45 | $3.31 | 开源里类 Opus 规划质量 |
| Kimi K3 | ~$3 | ~$15 | 1.4TB 开源权重,闭源级能力 |
| Claude Opus 5 | $5(快速档 $10) | $25(快速档 $50) | 闭源旗舰,7 月最强基准分 |
03 大模型性价比对比:用量冠军≠质量冠军
必须泼一盆冷水:OpenRouter 排行榜排的是 Token 用量,不是模型质量。便宜又快的模型挂在高流量应用背后,就能轻松刷到前列——哪怕在复杂推理上表现平平。
按任务类型统计的「消费金额占比」呈现不同图景:通用对话 35.7%,Agent 工作流 30.4%,代码 26.5%,数据处理 7.5%。但若专门看「分类/复杂推理」这类难任务,画风立刻反转——Claude Sonnet 4.6 和 Claude Opus 4.7 以各 13.5% 消费份额并列第一,GPT-5.5 以 11.6% 排第三,总量榜单上霸屏的廉价开源模型在此维度几乎「查无此模型」。
市场正在自然分层:便宜的中国开源模型吃下海量、低门槛、可容错的跑量任务(闲聊、创意写作、角色扮演、简单编程辅助),闭源旗舰仍把持高价值、低容错的难任务定价权(复杂推理、企业级 Agent 规划、强一致性分类)。7 月 24 日 Anthropic 发布的 Claude Opus 5 是最好例证——FrontierBench v0.1 拿下 43.3%,反超 GPT-5.6 Sol 的 37.5%,价格维持 Opus 系列 $5/$25 每百万 Token。更多 Claude 生态背景见Claude Opus 5 与 Kimi K3 争议解读;Kimi K3 参数与基准见Kimi K3 深度评测。
04 应用层排行榜与 6 步大模型分层路由选型指南
应用层排行榜(openrouter.ai/apps)反映「这些大脑真正被用来做什么」:
- Hermes Agent(Nous Research 开源自我迭代智能体)以约 45% Token 份额一骑绝尘;
- 编程类 Agent 占榜单大半:Kilo Code(~13%)、OpenClaw(~9%)、Claude Code(~6%)、Cline(~1.7%)均在前十;
- Cline → Roo Code → Kilo Code 是同一代码血统的三次分叉,「孙子辈」Kilo Code 已反超祖辈,说明开源编程 Agent 护城河比想象中浅;
- 角色扮演/陪伴类(Janitor AI、ISEKAI ZERO、SillyTavern、HammerAI)合计占据开源模型流量可观比例——OpenRouter × a16z《State of AI》显示创意角色扮演贡献开源模型总用量一半以上。
| 排名 | 应用 | 类型 | 份额 |
|---|---|---|---|
| 1 | Hermes Agent | 个人智能体/CLI | ~45% |
| 2 | Kilo Code | 编程 Agent | ~13% |
| 3 | OpenClaw | 通用 Agent | ~9% |
| 4 | Claude Code | 编程 Agent | ~6% |
| 5 | Descript | 内容生产 | ~4.5% |
| 6 | pi | Agent | ~3.3% |
| 7 | Lemonade | 陪伴/游戏 | ~2.1% |
| 8 | ISEKAI ZERO | 角色扮演 | ~2.0% |
| 9 | Janitor AI | 角色扮演 | ~1.8% |
| 10 | Cline | 编程 Agent(IDE) | ~1.7% |
基于 7 月数据与哑铃型市场结构,建议按以下六步建立分层路由:
- 盘点任务类型与容错阈值:将工作流分为闲聊/创意、Agent 编排、代码、复杂推理四类,标注每类可接受的错误率与延迟上限。
- 对照用量榜与消费榜做双轨验证:跑量任务优先测试 DeepSeek V4 Flash、GLM 5.2;难任务保留 Claude Opus 5 / GPT-5.6 做峰值 fallback,勿用总量排名代替场景评测。
- 在 OpenRouter 搭建技术预研沙盒:单一 Key 横跨数百模型快速 A/B 对比;注意国内访问延迟约 180–250ms 且不支持国内发票,生产环境评估国内合规中转方案。
- 实施混合路由降本:编程类任务默认 DeepSeek V4 Flash,卡住步骤再升档至 Claude Opus 5;参考DeepSeek V4 满血版定价与迁移指南配置 API。
- 将厂商安全记录纳入评分卡:本周 OpenAI 未发布模型沙盒逃逸事件持续发酵,美国国会已提出「AI 终止开关法案」——企业 Agent 场景须做权限收敛与供应商安全审计。
- 为 Agent 生产化准备稳定算力底座:本地 Claude Code / Cursor Agent 与云端 API 调用需 7×24 环境;评估 Mac mini 裸金属 vs 虚拟化方案的 Hypervisor 损耗与 Metal 编译链兼容性。
05 8 月趋势预测、可引用数据与 FAQ
8 月趋势预测(基于 7 月走势):
- 中国开源模型合计份额大概率继续爬升,年内有望突破 50%,除非美国厂商重大降价;
- 「月度冠军模型」宝座继续易主,留意各家 8 月迭代节奏;
- Anthropic 可能推出更平价型号抢占用量份额,Opus 5 已是两个月内第四款旗舰;
- Kimi K3 的 1.4TB 权重预计 2–4 周内出现社区量化版本,中小团队届时才真正能用上;
- 安全与合规成为新选型变量,企业采购中「厂商安全声誉」权重将明显上升。
- Mimo V2.5 日用量:约 1.4 万亿 Token/天,7 月 25 日榜单第一;近 30 天累计 31.2T。
- 中美价差:DeepSeek V4 Flash 输入约 $0.05–0.14/M vs GPT-5.5 约 $5/M,价差约 35 倍。
- 中国厂商份额迁移:从一年前 <2% 升至约 46%,是过去 12 个月 AI 行业最陡峭的份额迁移曲线之一。
- Claude Opus 5 基准:FrontierBench v0.1 得分 43.3%,定价 $5/$25 每百万 Token(快速档 $10/$50)。
常见问题 FAQ
OpenRouter 排行榜是按什么排序的?
按真实付费 Token 用量排序,反映开发者真金白银的路由选择,而非基准测试分数。
2026 年 7 月 OpenRouter 用量第一的模型是哪个?
截至 2026 年 7 月 25 日,小米 Mimo V2.5 以约 1.4 万亿 Token/天位居第一。
中国模型在 OpenRouter 上占多少份额?
综合多方 7 天口径,中国厂商合计约占 46% Token 份额,一年前不到 2%。
用量高的模型一定质量更好吗?
不一定。建议按任务类型分层路由:跑量走低价开源,难任务走闭源旗舰。
以下为主要参考来源;榜单每日变动,发布前请以官方页面实时数据为准。
OpenRouter Blog:DeepSeek V4 Adoption
OpenRouter × a16z State of AI 报告
7 月这份榜单最值得记住的是:能力与用量正在分道扬镳。对需要 7×24 运行 Claude Code、Kilo Code 或自建 Agent 的生产团队而言,纯 API 路由无法解决本地编译链、Metal 加速与稳定在线问题——虚拟化 Mac 存在 Hypervisor 损耗与 iOS CI 兼容风险。对于需要零损耗原生算力、稳定 iOS CI/CD 与 AI Agent 7×24 自动化的生产环境,ZUKCLOUD 的裸金属 Mac mini 云端节点通常是更优解:独占 Apple Silicon 物理机、无 Hypervisor 损耗、7×24 在线、按天/周/月弹性下单。更多架构论证见裸金属架构宣言。