
算力网试验场的真正价值不在规模,而在那张看不见的“调度网”
商汤大装置与国信数算的合作,在WAIC 2026期间签约,共建“全国一体化算力网试验场”。这个消息在圈内引发的讨论,远不止于一次商业合作。在我看来,它意味着中国算力基础设施建设正在从“堆算力”的粗放阶段,进入一个需要精细操作系统层设计的新阶段——而后者才是真正决定未来十年AI竞争力的关键。
前几天我在一篇预印本里看到,Google已开始用光互连将分散在不同数据中心的TPU v5p集群连成“虚拟超算”,延迟控制在微秒级。这其实已经暗示了算力网的技术路线:不是把机器搬到一个机房,而是让算力在物理上分散,但在逻辑上像一个整体被调度。商汤与国信数算合作的试验场,本质就是在做这件事——把异构算力(GPU、NPU、DPU、甚至存算一体芯片)抽象成统一资源池,然后通过跨域调度算法让它们协同工作。
但问题在于,分布式算力网的概念早在2018年就有学术讨论,为什么直到今天才真正落地?因为过去几年大家都在追逐单机性能,没人在意“连接”的代价。直到大模型训练需要万卡集群,单集群的扩展瓶颈(功耗、散热、互联带宽)被撞得头破血流,业界才意识到:更聪明的做法不是把一万张卡塞进一个数据中心,而是让十个数据中心的一千张卡高效协作。
[!quote]
国信数算拥有多个国家级算力枢纽节点的运营经验,而商汤大装置在AI训练和推理场景下的调度优化积累深厚。两者的结合,相当于把“高速公路”和“智能交通系统”拼在了一起。
这个试验场的技术难点,其实不在硬件,而在软件栈。我注意到新闻稿里提到了“算力网络操作系统”,这才是真正的核心。一个能实时感知全网算力状态、预估任务需求、动态路由计算任务的调度系统,其复杂度不亚于一个大型分布式数据库。以我熟悉的训练任务为例,假设一个模型需要跨三个数据中心并行训练,数据同步的拓扑结构如何设计?梯度压缩率如何动态调整?网络抖动如何容错?这些都需要在操作系统层面做精细控制。
做物理AI的人形机器人创业公司,现在是算力网最急迫的需求方之一。因为我们采集的具身数据是多模态、高带宽的(视觉+触觉+力觉+本体感觉),训练一个通用操作模型,往往需要同时使用多个异构算力集群——一个做视觉编码,一个做控制策略,一个做仿真验证。如果每个集群都物理隔离,数据搬运的时间成本就足以让训练效率降到不可接受。算力网如果能把它们逻辑上打通,就能让仿真数据直接流入训练集群,中间不需要经过任何人工干预。
当然,理想很丰满,现实仍然有硬骨头。一个是跨域数据流通的合规问题——不同地区对数据隐私的要求不同,算力网调度时必须保证训练数据不出域。这要求调度系统具备“数据血缘追踪”能力,甚至需要引入联邦学习中的差分隐私技术。另一个是标准之争:国信数算的算力节点可能采用不同厂商的硬件,商汤的调度系统能否做到真正的“即插即用”?目前业界还没有统一的算力描述语言,各家都在推自己的API。这个试验场如果能在标准层面达成共识,其价值将远超技术本身。
我注意到新闻里提到“试验场”三个字,这很关键。它意味着双方不急于追求规模,而是先在小范围内验证技术可行性。这种务实态度值得肯定——毕竟算力网不是堆几个机柜就能跑起来的,它需要在实际部署中不断迭代。回想2015年那个著名的“木兰”项目,当时谷歌试图用软件定义网络连接全球数据中心,结果因为延迟抖动问题被迫回退。前车之鉴历历在目。
这个试验场最终能跑通什么?我判断会先解决两个场景:一是跨地域的大模型推理负载均衡,比如把来自不同省份的推理请求动态路由到最近且空闲的算力节点;二是面向具身智能的“仿真-训练-部署”闭环,让机器人公司可以在一个虚拟的算力池里完成所有实验。一旦这两个场景验证成功,算力网就会从“试验场”升级为“商用网”,而那时,整个AI基础设施的竞争格局将被彻底改写。
没有总结的必要。技术演进从来不是靠规划出来的,而是靠一个个具体的工程问题逼出来的。这个试验场只是把问题摆在了台面上。
原文链接:https://www.qbitai.com/2026/07/454771.html
物界前沿