一张自拍加一段录音,就能生成数字分身?这背后的功耗墙远比想象中高
零。这是谷歌那套数字分身方案在移动端能跑通的帧率,如果你没有一颗专门的NPU。一张自拍和一段录音,看似简单的输入,背后是Gemini Omni模型的多模态对齐、实时推理渲染和语音合成,这三者叠加的算力需求,以7nm工艺节点估算,至少需要20TOPS的整数算力,而当前主流手机SoC的NPU能效比,在5W功耗下只能勉强提供10TOPS。
短期看,谷歌Vids的数字分身功能,本质上是把AIGC领域的分身概念从实验室拉到了消费级应用。关键不是它能生成多像,而是它能不能在用户设备上实时跑起来。Gemini Omni的加入,意味着模型不再只是文本到视频,而是语音、视觉、文本三模态的同步推理。这对带宽和内存带宽提出了极高要求。一张1080P视频的生成,需要模型在几百毫秒内完成40帧以上的画面推理,同时合成语音波形。以当前LPDDR5的带宽,单帧数据搬运时间就超过10ms,更不用说计算延迟。所以,我判断谷歌大概率会采用云端推理+端侧预览的模式,而不是真正的本地实时生成。这带来的直接问题是,用户隐私和响应延迟会成为一个明显的功耗墙——云端推理的功耗虽不计入手机,但网络传输和本地解码的功耗,反而可能超过端侧推理的10%。
长期看,这个功能真正有意义的地方,是它倒逼芯片设计方向。数字分身的两大痛点,一是面部表情的实时渲染,二是语音的实时合成,两者都需要低延迟、高吞吐的AI推理。传统GPU路线在渲染上有优势,但功耗随分辨率指数级增长。而专用NPU架构,如果设计成针对Transformer的稀疏计算单元,并引入多模态数据流处理,就能在3W功耗内实现20TOPS的端侧推理。这恰恰是展锐等基带芯片厂商可以切入的方向。5G基带的高带宽能力,如果能与端侧NPU融合,实现云边协同的低延迟推理,就能把数字分身这类应用从“体验尝鲜”变成“日常可用”。但前提是,苹果的A17仿生和联发科的天玑9300已经开始在核心区域集成独立的AI引擎,如果谷歌的Gemini Omni模型能耗比不进一步优化,数字分身就永远只能是“科技秀”。
所以,我的建议很直接:如果你想用这个功能拍点东西,先别急。等它真正落地在端侧,至少需要等到2025年,当下一代3nm制程的SoC大规模商用,且NPU能效比达到30TOPS/W量级,数字分身才有可能从“1分钟生成”的演示变成“实时对话”的体验。在此之前,你拍到的数字分身,大概率是云端服务器给你远程渲染的,那个延迟会让你觉得是在跟海外主机玩联机游戏。
物界前沿