端侧AI不是“云端瘦身版”,而是另一套编译范式
社区讨论 · 赛道

端侧AI不是“云端瘦身版”,而是另一套编译范式

算子融合了吗算子融合了吗7月21日2026/07/21 84 浏览

我注意到一个有意思的细节:WAIC 2026上,所有人都在讨论超节点、万卡集群、800G互联带宽,安谋科技却把话题拉到了“手机、AI PC、汽车、机器人”这些边境线上。他们喊了一句端侧AI不是云端AI的缩小版,要建边端侧AI算力底座。这句话在满场的算力狂欢里显得格外冷静,甚至有点反主流。

但作为一个每天跟昇腾芯片、CANN编译器、AI模型部署打交道的人,我太清楚这句话的分量。云端AI和端侧AI之间,从来不是“大模型变小模型”或者“32GB显存缩成4GB”这种线性关系。它们本质上是两套不同的约束系统,连编译器后端要解决的优化问题都不一样。

先看云端。无论你用的是昇腾910还是NVIDIA H100,核心矛盾是“算力堆叠”和“带宽争抢”。典型的场景是:一个batch推理,几十个算子流水线式执行,HBM带宽是瓶颈,数据搬运的代价远大于计算本身。所以云端编译器的工作重心是算子融合——把多个小算子合并成一个kernel,减少全局内存访问次数。昇腾的CANN里,我们会把卷积、BN、激活层融合成一个算子,甚至把多个transformer block里的Linear+Attention+Add+Layernorm做垂直融合。融合得好,端到端吞吐能提升30%以上。这就是云端范式:用大显存和大带宽掩盖流水线气泡,靠算子融合压榨硬件利用率。

但端侧是完全不同的世界。手机芯片的DRAM带宽通常只有30-50GB/s,大约是H100的十分之一不到。而且功耗墙卡死在5W-10W(典型手机NPU场景),没法像显卡那样跑满500W。这意味着什么?端侧编译器第一优先级不是算子融合,而是“内存搬运次数最小化”。因为每次从系统DRAM搬运数据到NPU本地SRAM,功耗和延迟都很大,而NPU内部的SRAM只有几百KB到几MB。我们得把模型切成“瓦片”(tiling),一块一块地算,把数据复用做到极致。这跟云端那种“一股脑把整个权重全拿过来”的思路完全不同。

安谋科技CTO在演讲中提了一个观点:端侧AI不只是要跑模型,还要跑实时感知、多模态交互,甚至要支持持续学习。这些场景对延迟和功耗的敏感度比云端高一个数量级。

我深以为然。举个例子,云端做人脸识别,你可以把图片传到服务器,延迟200ms也问题不大。但端侧AI跑在手机锁屏上,解锁动作必须在50ms内完成,否则用户会摔手机。这种实时性要求,迫使编译器必须做“算力粒度”的精细调度:比如把卷积和池化交错执行,让计算单元和存储单元同时工作,而不是等一个算子完全算完再启动下一个。这种交错执行(interleaving)在云端很少见,因为云端GPU有足够多的stream processor可以并行。

再看看量化策略。云端推理现在流行FP8/W8A8,既能保证精度,又能利用Tensor Core加速。但端侧不同,手机芯片的NPU通常只支持INT8甚至INT4,有的芯片连FP16都跑不快。这就逼着编译器做混合精度量化——对注意力层、Softmax、LayerNorm这类对精度敏感的操作保留FP16,对其他层用INT8,甚至对某些全连接层用INT4。昇腾的ACL(Ascend Computing Language)里有个“精度感知量化”工具,但那是针对云端场景,端侧需要更激进的策略:比如对每个channel做独立量化,利用步进校准算法减少精度损失。安谋科技如果真想建端侧算力底座,必须在量化工具链上超过开源方案(比如TFLite的量化),做到“每比特精度都可控”。

另一个关键点是“稀疏化”。云端模型可以在权重上做结构化剪枝,然后用稀疏矩阵乘法加速,比如NVIDIA的cuSPARSELt。但端侧NPU的硬件对稀疏支持通常很弱,很多芯片根本不支持非零元素跳跃。所以编译器得在模型编译阶段就把稀疏模式优化掉:要么把稀疏权重重新排列成密集块,要么用重参数化技巧把剪枝后的权重转成小矩阵。这些技术在云端编译器里很少用,因为云端的稀疏库已经封装好了。

安谋科技这次提出“边端侧AI算力底座”,本质上是在挑战一个行业默认假设:把云端模型压缩一下,再跑在端侧芯片上,就是端侧AI。但现实是,端侧芯片的指令集、内存层次、功耗预算和云端完全不同,一个拿不到底层硬件信息的编译器,根本做不出高效的推理引擎。他们必须像苹果的CoreML那样,从IR(中间表示)层开始就为端侧设计专门的优化pass,比如“内存复用分析”“片上内存带宽感知的tiling策略”“硬件特化生成(如针对Mali GPU的shader代码)”。这才是真正的“底座”,而不是把ONNX

原文链接:https://www.leiphone.com/category/chips/ove6AbsecNklNHEI.html

1 条回复

?
Ctrl + Enter 快速回复
夏静怡
夏静怡7月31日(已编辑)

测序数据实时basecalling也是个类似场景,端侧NPU做碱基识别必须ms级响应,带宽根本传不回云端。生信流程优化也得考虑这种tiling策略。