光算力:AI基础设施的“热力学第二定律”时刻
社区讨论 · 政策

光算力:AI基础设施的“热力学第二定律”时刻

BCG老叶BCG老叶7月27日2026/07/26 64 浏览

如果把AI算力的演进比作一条河流,摩尔定律曾是我们确信的河道——每18个月翻倍,宽且深。但如今,河道正在变窄,物理极限就像河床上的岩石,暴露在越来越浅的水面。曦智科技沈亦晨在WAIC 2026上提出的“光将驱动AI基础设施变革”,本质上是在说:我们需要一条新的河流,而光,就是那条尚未被充分挖掘的地下暗河。

从“光进铜退”到“光算力”,这个跃迁远比字面意义上的连接介质替换复杂得多。它触及的是AI基础设施最深层的矛盾:当数据量的增长速度远超晶体管开关速度的提升,我们究竟是在用算力解决问题,还是在用算力制造新的问题——互连瓶颈。

从“算力”到“互连力”:核心矛盾转移

过去十年,AI从业者习惯于将“算力”等同于FLOPS(每秒浮点运算次数)。但当我们进入万卡、十万卡集群时代,一个残酷的现实浮现:芯片内部的算力晶体管密度仍在提升(尽管放缓),但芯片之间的数据搬运速度已经远远滞后。 这就像市中心建了100层高的大楼,但通往大楼的马路只有两车道——拥堵发生在路上,而非楼内。

根据行业数据,在超大规模AI训练中,数据在芯片间、服务器间、机柜间的传输延迟,已经占到总训练时间的30%-50%。更致命的是,电互连的带宽密度和能效正在逼近物理极限——铜线的信号衰减、发热、串扰让速率每提升一代,成本和功耗呈指数增长。这不仅是技术瓶颈,更是经济账:当算力集群的50%功耗用于连接而非计算,AI的“边际效益”正在快速递减。

沈亦晨提到的“物理极限”,热力学第二定律式的不可逆性。光互连的好处早已被理论验证:带宽密度高一个数量级,能耗低至电互连的十分之一,且不受电磁干扰。但为什么迟迟没有大规模落地?因为光不是“插入即用”的替代品,它需要从封装、架构到系统软件的全栈重构。


光算力的三个维度:技术、产业、生态

从战略顾问的视角,拆解这个变革需要三个维度:

技术维度:从“光互连”到“光计算”的阶梯

目前最现实的路径是“光互连”先行——用光模块和硅光子技术替代短距离电互连(如机柜内、芯片间)。这类似于互联网从“铜线到光纤”的升级,商业模式清晰,产业链成熟度较高(Lumentum、Coherent等已量产)。但更激进的是“光计算”本身——用光子来完成张量乘法等核心运算。这需要全新的器件设计(如MZI阵列、微环谐振器),精确度、集成度、良率仍然是巨大挑战。

[!info] 一个关键判断:光互连将在未来2-3年内成为AI集群的标配,而光计算可能需要5-10年才能进入商用。这两者并非替代,而是互补——光互连解决“带宽墙”,光计算解决“功耗墙”。

产业维度:对标海外,中国的机会与陷阱

海外已有代表性玩家:Lightmatter用硅光子做AI推理加速器,融资超1.5亿美元,已经与Cisco合作;Ayar Labs专注于chiplet间的光互连,获Intel、AMD投资。它们的特点是从“芯粒级”切入,而非直接挑战NVIDIA的GPU霸权。

中国在这一赛道的优势在于:光模块产量全球第一,光子学器件制造能力(如InP、SiPh)有基础。 曦智科技作为国内最早布局光算力的公司之一,已经积累了从芯片设计到系统集成的经验。但风险同样明显:光算力是一个强依赖生态的技术——你需要与主流AI框架(PyTorch、TensorFlow)、编译器(XLA、TVM)、甚至CUDA生态兼容。如果光算力芯片无法跑通主流的Transformer模型,它就永远是一个漂亮的实验室原型。

生态维度:谁在定义“光”的接口标准?

任何基础设施变革,最终都落在标准上。电互连有PCIe、NVLink、Ethernet,光互连目前有谁?硅

原文链接:https://www.tmtpost.com/8078233.html

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧