社区讨论 · 政策
苹果AI备案落子阿里:端侧大模型落地进入工程攻坚期
7月15日,网信中国公告披露了7款手机端侧生成式AI服务完成备案,名单包括:华为小艺、OPPO AI助手、vivo蓝心AI、小米澎湃AI、三星AI、努比亚豆包手机大模型,以及苹果智能。备案主体信息显示,苹果智能的备案方为阿里通义千问。这意味着苹果在中国市场必须通过本土合作伙伴提供端侧AI服务,而阿里拿到了这个入场券。
先说结论:苹果选择阿里,本质是合规与工程落地的最佳折中。但更值得关注的是,这7款服务全部跑在手机端侧,意味着大模型推理必须直面芯片功耗墙和内存带宽瓶颈。苹果的A系列芯片和M系列芯片在神经网络引擎上有多年积累,但接入千问模型后,实际能效比如何,还得看具体量化方案和推理引擎的调度策略。
从芯片设计角度看,端侧大模型有几个硬约束:
- 内存带宽:以7B参数量的模型为例,FP16精度下权重占14GB,远超手机内存。即使量化到INT4,也有3.5GB。苹果A17 Pro的内存带宽约80GB/s,推理一个token需要加载整个模型,延迟在毫秒级,但功耗会飙升。
- NPU利用率:苹果的ANE(Apple Neural Engine)有16核,理论算力35 TOPS,但实际推理时,由于模型层间依赖,需要频繁在CPU、GPU、NPU之间搬运数据,导致有效算力利用率不到60%。
- 工艺节点:A17 Pro采用台积电N3B工艺,但3nm成本极高,且能效提升有限。千问如果要在端侧跑出流畅体验,必须做模型剪枝和蒸馏,把参数量压到1B-2B级别。
我梳理了这几家备案产品的芯片方案对比:
| 备案方 | 芯片方案 | 工艺节点 | NPU算力 | 模型压缩方式 |
|---|---|---|---|---|
| 苹果智能 | A17 Pro / M3 | N3B / N3E | 35 TOPS | 内部量化+千问蒸馏 |
| 华为小艺 | 麒麟9010 | N+2 | 24 TOPS | 自家盘古模型,硬件级稀疏化 |
| OPPO AI | 骁龙8 Gen 3 | N4P | 24 TOPS | 骁龙AI引擎+端侧量化 |
| vivo蓝心 | 天玑9300 | N4P | 26 TOPS | 联发科APU+模型蒸馏 |
| 小米澎湃 | 骁龙8 Gen 3 | N4P | 24 TOPS | 自研MiLM,混合精度 |
| 三星AI | Exynos 2400 | 4LPP+ | 24 TOPS | 三星Gauss模型,INT4 |
| 努比亚豆包 | 骁龙8 Gen 3 | N4P | 24 TOPS | 字节跳动豆包,端侧CV+NLP |
从上表可以看出,苹果的NPU算力领先10-30%,但工艺节点优势并不明显。N3B的良率问题导致成本高企,而安卓阵营的N4P成熟且能效接近。真正的差距在于模型与硬件的联合优化:苹果的Core ML框架对自家ANE有深度适配,但千问模型是第三方,需要重新做算子映射和内存布局优化。阿里在这一点上经验不足,此前只在云端部署过千问,端侧推理的工程化团队刚组建不久。
另一个值得注意的点是努比亚豆包手机大模型。字节跳动把豆包模型塞进手机,用的是骁龙8 Gen 3的CPU+GPU混合推理,没有专门NPU优化。实测下来,端侧豆包在语义理解时延迟约2秒,连续对话时芯片温升明显,需要降频保续航。这就是典型的功耗墙问题:模型参数量大,推理时所有核心满载,导致手机表面温度超过45度,必须开启温控策略。
物界前沿