当调用量成为“第一”,你的论文敢这么写吗
OpenRouter 上周(7月20日-7月26日)全球调用量排名:小米 MiMo-V2.5 以 约 1.2 亿次 调用位居第一,DeepSeek V4 Flash 约 9800 万次第二,腾讯 HY3 约 7500 万次第三,智谱 GLM-4 约 6200 万次第四,字节豆包约 5100 万次第五。这个榜单让很多人意外,因为小米并非传统大模型玩家,而它的模型拿下了“全球第一”。
作为一个天天和强化学习、模型评估打交道的在读博士,我第一反应不是兴奋,而是警惕。我们实验室刚被导师要求“试一下”用 MiMo 做基座模型,但查了一圈,发现它连基本的模型卡都没有,论文也找不到。这让我想起一些顶会论文里只放一个指标最高就 claim SOTA 的做法——数据好看,但经不起推敲。
两条路线:小米的“生态调用” vs DeepSeek 的“硬核开源”
我们不妨把小米 MiMo-V2.5 和 DeepSeek V4 Flash 做一组对比,看看这个“第一”到底是什么性质。
| 维度 | 小米 MiMo-V2.5 | DeepSeek V4 Flash |
|---|---|---|
| 模型规模 | 未公开,推测 7B-13B | 67B MoE(开源) |
| 开源/闭源 | 闭源,仅通过 API 提供 | 完全开源(MIT) |
| 论文/技术报告 | 无 | 有详细技术报告 |
| 主要应用场景 | 小米设备内置、小爱同学 | 通用对话、编程、推理 |
| 单次调用成本 | 免费(目前) | 极低(免费额度+按量付费) |
| 调用量来源 | 米家生态、小米手机预装 | 开发者社区、商业用户 |
从这个表格可以看到,小米的调用量主要来自生态内流量。只要你用小米手机,唤醒小爱同学,就可能触发 MiMo。这相当于把几亿存量用户直接转化为调用量。而 DeepSeek 的调用量是实打实的开发者主动调用,且模型开源,社区可以自部署,不会全走 OpenRouter 网关。
我在实验室用 DeepSeek V4 Flash 做推理任务,它能在数学推理上接近 GPT-4,而 MiMo 我试了一下,简单的逻辑题就出现了幻觉。这让我怀疑:调用量第一,是否等于模型能力第一?
数据背后的“侥幸”因素
OpenRouter 的排名机制是“聚合调用量”,它更像一个 API 中转站。小米可能做了几件事让数据飙升:
- 免费策略:MiMo API 目前完全免费,而且没有调用频率限制。这直接吸引了大量低质量爬虫、自动测试脚本涌入。我在 GitHub 上看到有人写脚本用 MiMo 批量生成文本,一天跑几十万次。
- 壁垒式集成:小米手机系统内置的小爱同学默认使用 MiMo 模型,用户每次天气查询、闹钟设置都算一次调用。这就像微信小程序的日活——用户被动产生数据,不是主动选择。
- 时间窗口:上周正好是小米发布会后一周,大量用户更新系统、尝鲜新功能,导致调用量短期冲高。而 DeepSeek 并没有类似的事件驱动。
从强化学习角度看,这就像一个 agent 在训练时只优化了“steps per episode”指标,但忽略了 reward 信号。调用量高,不代表模型输出质量高,更不代表推理效率高。我们评估一个模型,应该看的是它的 reward 曲线,而不是它的 episode 长度。
我们该怎么看这个“第一”
我不是否定小米的工程能力。能在端侧部署一个 7B 级模型,并且做到低延迟,这本身需要优秀的量化、剪枝、蒸馏技术。但“全球第一”这个说法,容易误导
物界前沿