M50 Inside:端侧千亿参数推理的工程化,还是新的功耗墙游戏?
在WAIC 2026张江展区,我亲眼看到后摩智能的演示:一台手掌大小的设备,驱动着千亿参数大模型,实时生成PPT,还驱动了一个全息数字人持续对话。旁边展台的人还在讨论云端大模型API调用成本,这边已经把模型塞进本地终端了。作为在展锐做过5G基带功耗优化的工程师,我第一反应不是兴奋,而是怀疑——这个“手掌大小”的盒子,功耗测了没有?散热方案是什么?量产良率如何?
后摩智能的M50 Inside方案,本质上是把端侧AI推理从“跑模型”推进到“跑大模型”的阶段。但工程落地从来不是单纯堆算力,功耗墙、散热、封装、生态,每一个都是硬骨头。
工艺节点与功耗墙:M50的架构选择
后摩智能宣称M50采用“创新存算一体架构”,但具体工艺节点没有公开。从产品形态看,手掌大小、无主动散热风扇的形态,意味着TDP(热设计功耗)必须控制在5W以内,甚至更低。这是端侧AI推理的硬约束。
对比现有方案:
- 高通骁龙8 Gen 3的NPU跑大模型时,整机功耗约8-12W,需要手机均热板和石墨烯散热
- 苹果M4芯片的Neural Engine,功耗约6-8W,依赖iPad或MacBook的金属机身散热
- 后摩M50在手掌大小设备内实现千亿参数推理,功耗必须低于5W
存算一体架构的核心优势是减少数据搬运,从而降低功耗。但问题是,存算一体在成熟工艺节点(如28nm)下,单位面积算力密度远低于先进制程的专用NPU。后摩若要达到千亿参数推理的吞吐量,很可能需要采用先进制程(如7nm或5nm)来弥补密度差距,同时利用存算一体降低单次操作的能耗。
[!tip] 关键判断
存算一体不是万能的。在5W功耗约束下,M50大概率采用了“存算一体+近存计算”的混合架构,核心逻辑用先进制程,存储单元用成熟工艺做3D堆叠。这需要极高的封装良率。
散热与封装:手掌大小的热设计挑战
展会上看到的是工程样机,运行全息数字人时,机身表面温度如何?我摸了另一家展商类似的设备,60秒后外壳明显发烫。后摩的演示可能做了散热优化,或者只运行了短时间Demo。
手掌大小设备的散热解决方案:
- 被动散热:依赖金属外壳自然对流,热阻约3-5℃/W,5W功耗下温升15-25℃,尚可接受
- 主动散热:微型风扇或压电风扇,增加噪音和故障点,不适合消费级
- 均热板+石墨烯:厚度受限,手掌大小设备内部空间极其有限
后摩M50 Inside方案如果采用金属外壳一体化设计,需要将芯片热阻控制在1℃/W以内,这意味着芯片封装必须采用双面散热或嵌入式热沉。这种封装技术目前只有高端服务器芯片(如SK hynix的HBM4)才大规模使用,良率成本极高。
另一个关键点是供电效率。端侧设备通常用电池或USB-C供电,5V/3A的输入已经是极限。主芯片需要多级电压转换,每一级效率损失都会转化为热量。5W功耗下,电源转换效率99%才损失0.05W,但实际DC-DC转换器效率约95%,损失0.25W,加上其他外围电路,整机散热预算就会被压缩。
生态与软硬协同:真正的坑在软件栈
后摩智能的M50 Inside方案能否落地,取决于它的软件栈能否让开发者轻松迁移模型。千亿参数大模型在端侧推理,需要模型量化(INT4/INT8)、剪枝、蒸馏等一系列优化,而后摩的存算一体架构对模型结构有特殊要求——比如稀疏性支持、数据流映射。
目前端侧推理的生态现状:
- 英伟达TensorRT:支持所有主流架构,闭环完善
- 高通SNPE/QNN:适配骁龙平台,但开发工具链尚可
- 苹果CoreML:仅限自家生态,封闭但高效
- 后摩M50:必须自研编译器、算子库,与PyTorch/TensorFlow深度集成
一个50人的芯片团队,软件团队至少要30人才能覆盖模型适配、工具链开发、客户支持。后摩智能作为初创公司,软件投入是巨大挑战。展会上演示的PPT生成和数字人,很可能是深度定制的模型,尚未泛化到第三方应用。客户能否用M50运行自己的业务模型,才是真正考验。
趋势预测:端侧大模型推理将在2027-2028年进入实用阶段,但后摩需要解决封装和生态两个短板
M50 Inside方案展示了正确的方向:端侧AI不能只靠云端降本,必须做到本地化、低功耗、实时响应。但工程化落地需要时间。
我的判断:
- 2026年:后摩M50量产版本会采用混合封装,TDP控制在5W内,但售价可能高达200美元以上,无法进入消费级
- 2027年:存算一体芯片在先进制程(3nm)下实现
物界前沿