
MiniCPM5-2B 让端侧 AI 从“能跑”到“好用”,但真正的战场不在榜单上
面壁智能的 MiniCPM5-2B 在 AA-Index 榜单上拿了个 4B 以下第一,17 分。这个分数放在整个端侧模型圈里不算亮眼,但在 2B 参数这个量级,它确实做到了“小身材,大能量”。
做产品的人最怕什么?怕参数漂亮,落地一塌糊涂。MiniCPM5-2B 这次让我稍微放心了一点——它不只是跑分高,还完成了多款芯片的适配。这句话比 17 分更重要。
在最新的 Artificial Analysis(AA)榜单评测中,MiniCPM5-2B 以 17 分的成绩占据榜单
芯片适配意味着什么?意味着面壁智能在认真考虑“安装门槛”。我过去在小米 IoT 平台做智能音箱的语音模型选型时,最头疼的不是模型精度,而是模型能不能在现有的低功耗芯片上跑起来。高通、联发科、瑞芯微,每家芯片的算力、内存、带宽都不一样。很多模型在服务器上跑得很好,一移植到端侧就卡顿、发热、掉帧。MiniCPM5-2B 这次主动适配多款芯片,说明它把“落地”作为了设计目标,而不是把“刷榜”作为终点。
从产品经理的角度,端侧模型的核心价值有三个:隐私、延迟、离线可用。MiniCPM5-2B 的 2B 参数规模,理论上可以做到在手机、智能音箱、甚至家电上本地运行,不需要联网就能完成语音识别、意图理解、简单对话。这对智能家居来说是一个重要的转折点。
过去我们在智能家居里做语音交互,大多数方案都是“端侧唤醒 + 云端处理”。用户说一句“开灯”,语音经过本地唤醒词检测后,音频数据上传到云端,分析完再下发指令。这个链路延迟在 300ms 到 1s 之间,网络不好时更久。而且云端处理意味着用户语音数据会被上传,隐私问题一直是个隐患。如果 MiniCPM5-2B 这样的端侧模型能直接在本地完成语义理解,延迟可以降到 100ms 以内,响应速度接近人类对话的自然节奏,用户才会觉得“这个设备是懂我的”。
但我也要泼一盆冷水。榜单上的 17 分,是 AA-Index 的综合评分。AA-Index 的评测维度包括知识问答、推理、数学、编码等。这些能力在端侧场景中真的都需要吗?做智能家居,用户问“洗衣机还剩多少时间”这种事实性问题,和问“为什么空调不制冷了”这种需要推理的问题,对模型的能力要求完全不同。MiniCPM5-2B 既然拿了 4B 以下第一,说明它通用能力很强,但产品落地时可能不需要这么强的通用性,反而需要针对特定场景做剪枝和优化。
面壁智能这次发布,真正的看点不是分数,而是它选择了“端侧”这个赛道,并且把适配看作第一优先级。这和很多大模型厂商“先做大模型,再考虑端侧”的思路不同。面壁从第一天就把“端侧”作为目标,这让它的模型在功耗、内存、推理速度上更有针对性。
[!tip] 一个 2B 参数的模型如果能跑在 2W 功耗的芯片上,它对智能家居的改造潜力,远大于一个 7B 参数但只能跑在服务器上的模型。
不过,端侧模型的商业化仍然面临一个老问题:开发者生态。模型再好,如果开发者不愿意用它来开发应用,或者工具链不够完善,就只是实验室里的展品。面壁智能联合 OpenBMB 发布,OpenBMB 是一个开源社区,这有助于降低开发者的使用门槛。但开源模型的维护成本很高,需要持续的社区贡献和文档更新,否则很容易变成“发布即巅峰”。
我作为一个产品经理,现在最关心的是:MiniCPM5-2B 会不会有官方的端侧推理框架?比如像 OpenAI 的 whisper 那样有 C++ 实现,或者像 Google 的 MediaPipe 那样有移动端 SDK。如果面壁能提供一套完整的端到端部署工具,从模型压缩到芯片适配到应用接口,那么它才能真正改变智能家居的交互体验。
最后留一个开放性问题:当 2B 参数的端侧模型就能在智能音箱上完成本地对话,我们还需要云端的 GPT-4o 吗?或者说,用户愿意为“离线智能”多付多少钱?
原文链接:https://www.ithome.com/0/978/796.htm
物界前沿