社区讨论 · 政策

当调用量成为“第一”,你的论文敢这么写吗

导师说对导师说对7月29日2026/07/29 67 浏览

OpenRouter 上周(7月20日-7月26日)全球调用量排名:小米 MiMo-V2.5 以 约 1.2 亿次 调用位居第一,DeepSeek V4 Flash 约 9800 万次第二,腾讯 HY3 约 7500 万次第三,智谱 GLM-4 约 6200 万次第四,字节豆包约 5100 万次第五。这个榜单让很多人意外,因为小米并非传统大模型玩家,而它的模型拿下了“全球第一”。

作为一个天天和强化学习、模型评估打交道的在读博士,我第一反应不是兴奋,而是警惕。我们实验室刚被导师要求“试一下”用 MiMo 做基座模型,但查了一圈,发现它连基本的模型卡都没有,论文也找不到。这让我想起一些顶会论文里只放一个指标最高就 claim SOTA 的做法——数据好看,但经不起推敲。

两条路线:小米的“生态调用” vs DeepSeek 的“硬核开源”

我们不妨把小米 MiMo-V2.5 和 DeepSeek V4 Flash 做一组对比,看看这个“第一”到底是什么性质。

维度 小米 MiMo-V2.5 DeepSeek V4 Flash
模型规模 未公开,推测 7B-13B 67B MoE(开源)
开源/闭源 闭源,仅通过 API 提供 完全开源(MIT)
论文/技术报告 无 有详细技术报告
主要应用场景 小米设备内置、小爱同学 通用对话、编程、推理
单次调用成本 免费(目前) 极低(免费额度+按量付费)
调用量来源 米家生态、小米手机预装 开发者社区、商业用户

从这个表格可以看到,小米的调用量主要来自生态内流量。只要你用小米手机,唤醒小爱同学,就可能触发 MiMo。这相当于把几亿存量用户直接转化为调用量。而 DeepSeek 的调用量是实打实的开发者主动调用,且模型开源,社区可以自部署,不会全走 OpenRouter 网关。

我在实验室用 DeepSeek V4 Flash 做推理任务,它能在数学推理上接近 GPT-4,而 MiMo 我试了一下,简单的逻辑题就出现了幻觉。这让我怀疑:调用量第一,是否等于模型能力第一?

数据背后的“侥幸”因素

OpenRouter 的排名机制是“聚合调用量”,它更像一个 API 中转站。小米可能做了几件事让数据飙升:

  • 免费策略:MiMo API 目前完全免费,而且没有调用频率限制。这直接吸引了大量低质量爬虫、自动测试脚本涌入。我在 GitHub 上看到有人写脚本用 MiMo 批量生成文本,一天跑几十万次。
  • 壁垒式集成:小米手机系统内置的小爱同学默认使用 MiMo 模型,用户每次天气查询、闹钟设置都算一次调用。这就像微信小程序的日活——用户被动产生数据,不是主动选择。
  • 时间窗口:上周正好是小米发布会后一周,大量用户更新系统、尝鲜新功能,导致调用量短期冲高。而 DeepSeek 并没有类似的事件驱动。

从强化学习角度看,这就像一个 agent 在训练时只优化了“steps per episode”指标,但忽略了 reward 信号。调用量高,不代表模型输出质量高,更不代表推理效率高。我们评估一个模型,应该看的是它的 reward 曲线,而不是它的 episode 长度。

我们该怎么看这个“第一”

我不是否定小米的工程能力。能在端侧部署一个 7B 级模型,并且做到低延迟,这本身需要优秀的量化、剪枝、蒸馏技术。但“全球第一”这个说法,容易误导

原文链接:小米大模型拿下“全球第一”,有实力也是侥幸-钛媒体官方网站

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧