把「做得到」变成「用得起」:中国大模型登顶 OpenRouter 全球调用榜
- +1 你赞过了
OpenRouter 的月度调用榜出现了一个醒目的结果:前七名全部来自中国模型,小米 MiMo-V2.5 登顶。先看榜单,截至 2026 年 8 月 12 日,OpenRouter LLM Leaderboard 在本月大模型调用量显示:小米 MiMo-V2.5 以 32.8T tokens 居首,DeepSeek V4 Flash 0423 以 26.4T 位列第二,腾讯 Hy3 以 20.1T 排名第三。前七名均为中国模型,前十名中有八个来自中国。按截图所示的十个条目相加,中国模型合计 143.17T tokens,约占前十总量 162.57T 的 88.1%。

OpenRouter LLM Leaderboard “This Month”榜单截图。截图时间:2026 年 8 月 12 日;来源:OpenRouter Rankings。
榜单上最显眼的其实是小米:它在 8 月的月度榜排第一,单周调用量增长了 66%。
这个“突然”背后有明确的原因——2026 年 5 月 27 日宣布对 MiMo-V2.5 系列 API 永久降价,最高降幅达到 99%。小米官方海外按量计费页面,输入约 0.0028 美元/百万 tokens、输出约 0.28美元/百万 tokens,大约是 Claude 的 1/5、GPT 的 1/6,不同渠道、模型型号和折扣活动的价格可能不同。

MiMo-V2.5模型国内定价

MiMo-V2.5 模型海外定价
所以“排在榜首”到底意味着什么?它不等于性能全球第一,不等于“C 端用户最多”,也不等于“小米生态内置 AI 最强”。
同一周榜单前七全是国产(DeepSeek 三席、腾讯混元两席、智谱 GLM),本质是国产开源权重组在“便宜长上下文 Agent 基建”这块把海外闭源挤下去了,而小米是里面定价最狠+Agent 定位最准的那个。
增长更猛的是腾讯 Hy3:它 7 月 6 日刚开源,在 OpenRouter 上直接免费(免费期到 7 月 21 日),普通 Hy3 API 则是单独计价的模型服务调用量涨了 999% 以上,目前有九折优惠:输入0.126美元/百万tokens。

价格下调与调用量上升在时间上相邻,价格很可能是推动因素之一,但不能据此把增长全部归因于降价。
模型版本发布、平台推荐、路由变化、免费端点和应用接入,都可能同时影响榜单表现。更稳妥的说法是:在OpenRouter 这种切换成本较低的模型路由平台上,较低的 token 单价为开发者扩大调用提供了条件。
Hugging Face 的数据也提供了另一个观察角度。其《2026 年春季开源生态报告》显示,在过去一年里,中国模型占平台下载量的 41%,并超过美国;配图所示的 2025 年 2 月至 2026 年 2 月统计期内,中国模型下载量为 6.63 亿次,美国为 5.95 亿次。

Hugging Face《State of Open Source on Hugging Face: Spring 2026》地区下载量图。统计区间:2025 年 2 月至 2026 年 2 月;来源:Hugging Face。
OpenRouter 看的是平台内的 token 调用,Hugging Face 看的是模型下载、复用和二次开发,两者并不是同一个指标,但放在一起看,能看到同一个变化:中国模型在不同开发者生态中都获得了较高的关注和使用活动,但这并不自动证明它们已经全面替代海外模型。
指标变了:大家更在意“能不能用”
过去评估大模型,大家习惯看参数规模、Benchmark 得分,以及数学和代码题的排名。这些指标能说明模型的能力上限,却回答不了企业最关心的另一组问题。
一个电商团队要从几百条用户差评里找出产品问题;一个市场团队要把十几个竞品网站和销售反馈整理成周报;一个工程师希望 AI 先读完故障日志,再给出修复建议。对他们来说,模型在榜单上多拿两分并不重要,重要的是能不能接进现有流程、响应够不够快、一天的成本能不能接受,以及出了错之后能不能追溯和复核。
所以,调用量不是模型能力的总分,却回答了一个更实际的问题:有没有人愿意在这个平台上持续调用它。这仍然不是“工作是否真正完成”的证明,但至少把评估视角从单次回答质量,推进到了可获得性、成本和流程接入。
Hugging Face 的情况也说明了这一点。平台上的模型数量很多,但下载量高度集中:前 200 个模型只占模型总数约 0.01%,却贡献了 49.6% 的下载量,这说明少数模型在平台生态中获得了更高的可见度和使用需求。
这并不等于中国模型已经全面领先,但至少说明,它们已经成了不少团队日常工作中的现实选项。
为什么有人选中国模型:不只是便宜
最直接的答案是价格,尤其对需要大量调用的开发者和应用团队来说。真正让企业愿意持续用下去的,通常是开放权重、推理成本、工具适配和能力匹配等条件叠加的结果。
开放权重给了团队更多部署和改造空间,可以根据自己的数据边界进行微调、量化、私有化或混合部署。但开放权重不自动等于商业许可,也不自动解决硬件适配、运维、数据治理和安全审计问题。对需要数据不出域的企业来说,它更可能是一个重要前提。
GPT、Claude、Gemini 等国外头部模型目前主要以 API 或云服务的方式提供,企业通常需要通过云端完成调用;国内部分模型则提供开放权重版本,可以部署在企业自己的服务器、私有云或本地算力中心。
这样一来,客户资料、内部文档和研发数据可以留在企业内部,模型也能按照企业自己的数据和流程进行调整。对金融、医疗、制造、政务等重视数据安全和本地化部署的行业来说,这种方式更容易贴合实际要求。
第二个因素是推理成本。帮忙改一版策划,贵一点问题不大;但让模型每天处理几千条客服消息、读取上百万字文档,再串起多个 Agent 步骤,价格很快就会从次要因素变成主要障碍。
即使近期部分版本进行了价格调整,DeepSeek 的成本优势仍然明显。
按 DeepSeek 官方最新定价,按照DeepSeek-V4-Pro的输出价格高峰时段 3.96 美元/百万 tokens;缓存命中输入价格0.044 美元/百万 tokens。OpenAI 官方 API 价格页列出的 GPT-5.6 Sol 短上下文标准输出价格为 30 美元/百万 tokens,缓存输入价格为 0.50 美元/百万 tokens。 按输出价格计算,前者约为后者的 7.6—15.2 倍。
缓存命中输入方面,GPT-5.6 Sol 约为 3.37 元/百万 tokens,DeepSeek 约为 0.15—0.30 元。这里比较的是官方 API 的 token 单价,不是完整任务成本;实际账单还会受到峰谷时段、输入量、缓存命中率、上下文长度、服务等级和路由方式影响。

DeepSeek-V4 API最新定价

OpenAI 官方GPT-5.6 API 计价
第三个因素是能力匹配。很多公司的日常任务——客服、营销文案、办公文档、知识库检索、数据清洗、代码辅助——需要的不是分数最高的模型,而是可靠、够快、能嵌入现有流程的模型。
从价格、开放权重和 Agent 适配等特征看,中国模型更容易进入一部分高频工程化场景。
真正落地,不是再开一个聊天框
调用量大,不等于工作已经做完了。在不少团队里,AI 仍然主要以聊天窗口的方式被使用。有人拿它写文案,有人让它总结会议,有人用它查资料。用的人可能不少,但资料散在各处,谁用过什么模型、花了多少额度、结论能不能追溯,往往没人说得清楚。
AI 工作台试图解决的,是把模型接进文件、知识库和工作流,让使用过程留下记录,也能被管理。
以腾讯 WorkBuddy 为例,其官方页面将产品定位为全场景 AI 工作台,并展示了专家、技能、连接器和自动化等入口,支持与 Jira、Google Drive、GitHub、Notion、Slack 等工具连接。 这些是产品公开展示的能力,不等于所有企业都已经获得同样的部署效果。


以每周竞品报告为例。过去,一个人要打开十几个网站,从网盘翻历史报告,再去问销售同事最近的客户反馈,最后把所有信息手动汇总到表格里。
在工作台里,这个流程可以变成:接入已经授权的资料源;用轻量模型去重、提取价格和功能点;再由更强的模型比较差异、生成周报初稿;最后由人确认关键结论。
AI 没有替人做决策,但把查找、搬运和格式化这些最耗时的环节接了过去。这里的关键不是“模型自动完成一切”,而是任务被拆成了可以授权、执行、检查和追溯的步骤。
这也带出一个容易被忽略的事实:不是所有任务都值得调用最强模型。
更合理的做法,是按任务复杂度分层:简单问答、短回复和格式化交给轻量模型;日常写作、摘要和规划使用通用模型;跨文件分析、长上下文和多步骤任务再调用更强的模型;代码生成、调试和重构则交给更适合开发的模型。
这和团队分工很像:整理资料不需要每次都请最资深的人,真正复杂的判断才需要专家介入。
对国产模型来说,这意味着 DeepSeek、Hy3、GLM 等不必由一家模型包揽所有环节。在合规、稳定和可用的前提下,它们可以分别承担批量清洗、信息抽取、初稿生成、复杂分析或代码生成。工作台的价值,就在于企业可以按任务换模型,而不是被某一个模型锁定。

Work Buddy的模型选择
竞争链路在拉长:从生态扩散到底层算力
前文数据能够说明模型在某些平台和开放生态中获得了调用、下载与衍生关注,但并不直接等同于企业生产部署,也不直接指向某一国产算力平台。下面讨论的是:当其中一部分需求进入长期工作流后,可能对稳定性、并发、网络和算力扩容提出什么要求。
模型进入工作流之后,竞争就不再只是单次回答谁更准确,而是沿着一条更长的链路展开:开发者能不能把模型接进应用,团队能不能稳定、低成本地重复调用,底层算力又能不能把这些调用承接下来。
开发者会围绕一个模型积累提示词库、工具调用链、评测集和微调数据;模型厂商则要持续跟进兼容性、推理稳定性、更新频率和社区生态。一次发布会上的领先可以带来关注,但能不能留下用户,靠的是后续每一步:改得动、用得顺、接得进项目。模型的优势一旦沉淀为生态资产,就会进一步变成持续的调用需求。
Hugging Face 的数据提供了一个参照。平台图表显示,阿里巴巴(含 Qwen)的衍生模型约为 11.5 万个,Google 约 7.2 万个,Meta 约 4.6 万个;Hugging Face 春季报告则称,Qwen 家族的衍生模型超过 11.3 万个,所有带 Qwen 标签的模型超过 20 万个。衍生模型数量不等于商业收入,但它能说明一种扩散效应:Qwen 生态中存在大量下游构建活动,而不是直接证明这些衍生模型都已经带来商业收入或稳定生产流量。

当其中一部分调用从零散尝试变成每天运行的工作流,竞争才会继续向下传导到算力底座。
调用量、下载量和衍生应用并不会自动落到同一套硬件上,但长期生产性调用和本地部署会提出一些具体问题:模型能不能稳定提供服务,长上下文和多步骤 Agent 能不能持续运行,高峰期会不会掉速,企业能不能按可接受的成本扩容。
算力不是与模型、工作台并列的另一种模式,而是把“有人愿意用”变成“更多人可以长期用”的承接能力。训练需要规模,推理更看重并发、时延、显存、网络和调度;真正支撑企业工作流的,也不是某一块芯片的峰值参数,而是计算、存储、网络、加速器和软件工具链能不能协同工作。
以中科曙光提供的 6 万卡科学智能计算集群系统为例,4月在在郑州国家超算互联网核心节点投入使用。官方报道提到,该集群采用自主可控核心芯片,并强调了高速互连、存算协同、灵活调度和稳定运行等能力。
它说明的是:面向科学智能等大规模任务,国产算力正在尝试从单点设备供应走向集群级系统组织。

如果说 6 万卡 AI4S 集群体现的是大规模基础设施的真机验证,那么华为昇腾 950 超节点展示的就是面向大模型训练和高并发推理的系统级组织能力。2026 年 7 月 17 日,昇腾 950 超节点(Atlas 950 SuperPoD)在世界人工智能大会首次线下展出,采用 1024 卡集群,面向万亿级大模型训练与高并发推理;华为官方同时披露,昇腾 384 超节点已商用落地 750 多套,覆盖 20 多个行业,CANN 开源社区月活跃开发者超过 3500 人。

前一个案例回答的是“能不能把规模做上去”,后一个案例进一步展示“能不能把系统接起来”。二者可以作为系统协同和规模化基础设施的案例。证明模型应用越深入,算力竞争越可能从芯片峰值性能转向系统协同、软件生态和长期服务能力。
国产算力要补的,不只是硬件供给,也包括把硬件、网络、软件和服务组织成一套企业可以长期使用的基础设施。
结语:
因此,中国模型的“登顶”不应只理解为 token 调用量上的领先,更应理解为一次关于可用性和产业化的考验:能否从榜单上的热度走进普通团队的日常工作,能否从一次性的尝试变成稳定、可复用、可核算的生产流程。
只有当模型在真实任务中的成功率、留存率、人工复核率和单位成本都经得起验证,AI 才可能从“会说话的工具”变成真正把工作做完、也让更多人用得起的生产力。
最新资讯
热门视频
新品评测
X
微博认证登录
QQ账号登录
微信账号登录