异构数据融合的编译器视角:具身智能的算力瓶颈不在模型,在数据通路
社区讨论 · 赛道

异构数据融合的编译器视角:具身智能的算力瓶颈不在模型,在数据通路

算子融合了吗算子融合了吗7月27日2026/07/27 67 浏览

具身智能的“ChatGPT时刻”迟迟不来,技术圈争论焦点从模型规模转向了数据来源。方汉提到的“算账逻辑”和异构数据,恰恰戳中了当前AI Infra层最痛的环节——数据通路不是算力瓶颈,而是IO瓶颈。作为做昇腾AI编译器的人,我每天打交道的就是如何在有限的内存带宽里塞进更多有效计算。

世界模型的核心矛盾在于,它同时需要处理视觉、触觉、力反馈、语言指令等多模态数据。这些数据在物理意义上是异构的:图像是高带宽的像素流,文本是稀疏的token序列,触觉是低频但高精度的传感器信号。如果用一个统一的网络去合并,数据预处理阶段就会产生大量冗余的访存和DMA操作。方汉说的“算账逻辑”,本质上是在问:你为每一笔数据预算是多少。这个问题在编译器层面很好翻译——就是数据复用率和访存带宽的比值。

我在昇腾上做过几个具身模型的算子融合实验。发现80%的计算时间花在数据搬运上,而不是真正的计算。比如一个简单的视觉-语言对齐模块,需要先对图像做特征提取,再对文本做embedding,最后做cross-attention。如果每个模块独立分配内存,每次前向传播都要重新从全局显存读入,带宽利用率不到20%。业界常说的“内存带宽瓶颈”,在这里具象化为:你没有办法在同一个计算图上同时调度图像张量和文本张量,因为它们属于不同的数据域。

方汉强调异构数据比合成数据更关键,这和技术路线选择有关。合成数据虽然量大,但生成过程本身需要大量计算,且分布与真实物理世界之间存在偏差。具身智能的落地场景是工厂、家庭、医院,这些环境里的数据天然是异构且非结构化的。编译器要做的是设计一套IR,能够同时表达不同数据类型的存储格式和计算依赖。比如,把图像数据从NHWC转成NCHW时,能否直接与触觉数据的时间戳对齐做融合,减少一次全局内存回写。

目前的主流框架(PyTorch、JAX)对异构数据流的支持并不好。它们更擅长处理同构的、规整的batch数据。具身智能要求的是不规则、稀疏、流式处理。这恰恰是华为昇腾编译器可以发力的地方——在算子融合之外,做数据域的融合调度。比如,把视觉特征提取的Kernel与触觉信号的预处理Kernel放到同一个Stream里,利用共享的片上内存(L1/SRAM)完成中间结果传递,避免经过DDR。

方汉的“算账逻辑”如果落到编译器层面,就是一套自动化的成本模型:给定一个异构数据流图,自动决定哪些算子融合、哪些数据DMA可以提前预取、哪些内存可以复用。具身智能的“ChatGPT时刻”不需要等一个更大的模型,需要等的是能把异构数据喂进计算单元的IR优化空间。

原文链接:https://www.tmtpost.com/8080833.html

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧