十万卡算力落地AI4S:当“堆料”遇上“适配”
一组数据:2024年7月,曙光8000(登峰)集群下线,理论峰值算力达到10万卡级,相当于每秒可进行约2.5百亿亿次浮点运算。这个数字是国内首个国产全栈十万卡集群。对比去年国内万卡级集群的峰值,大约翻了10倍。但更关键的不是这个数字本身——它意味着一个门槛:当算力突破十万卡,AI for Science(AI4S)的“应用式智能”才能从实验室演示走向工业级产线。
作为每天用AI做蛋白质结构预测的湿实验-干实验交界者,我关注的是:这个集群运行的是何种模型?是通用大模型,还是针对生物序列、分子动力学的专用模型?新闻里提到“面向AI全场景用户开放使用”,但“全场景”恰恰是问题——AI4S的落地,最怕“万金油”式的算力。
对比:两条技术路线
当前AI4S领域,算力驱动的研究呈现两条截然不同的路线。一条是“通用大模型路线”,代表如DeepMind的AlphaFold3、ESM系列,以及国内的盘古大模型。它们用海量、多模态数据训练一个模型,试图覆盖所有生物分子任务。另一条是“领域专用模型路线”,如分子动力学模拟中的NetMD、蛋白质-配体对接中的EquiDock,它们针对特定物理过程设计网络结构,训练数据量小但精度高。
十万卡集群更适合哪条路?从表面看,通用大模型需要十万卡级预训练,显存占用动辄数千GB,训练周期以月计。但AI4S的痛点从来不是算力不够“堆”,而是算力与数据、算法之间的“适配鸿沟”。我接触过多家国内AI4S初创公司,他们手里有优质的生物数据集,但模型在国产集群上跑不动——要么是算子库不支持,要么是分布式框架对生物序列的异步梯度同步效率极低。
曙光8000的一个关键设计:接入国家超算互联网。这意味着它不再是孤立的算力集群,而是算力网络中的一个节点。对于AI4S研究者,这个设计解决了“算力碎片化”问题——我们可以在不同超算中心之间迁移作业,而不必为每个平台重写代码。但更大的挑战是软件生态:国产芯片的AI框架(如昇思MindSpore、百度飞桨)对生物信息学常用库(如prody、mdtraj、OpenMM)的支持程度,远不如CUDA生态。即便有十万卡,如果模型无法在国产芯片上做分子动力学模拟,那只能跑跑简单的分类任务。
我的判断:AI4S的“应用式智能”落地,核心不在算力峰值,而在“中间件”
具体来说,是三个层面的协同:
- 数据层:生物实验数据(如冷冻电镜密度图、质谱谱图)的标准化和流通。十万卡集群需要海量高质量数据喂入,但国内生物数据孤岛严重,且缺乏像PDB(蛋白质数据库)那样的公开共享机制。
- 模型层:需要可复现、可迁移的模型架构。当前很多AI4S论文只发布权重不发布代码,或者模型依赖特定版本的CUDA库,导致在国产集群上无法复现。曙光8000若能联合社区建立“模型适配基准”,意义远大于硬件本身。
- 应用层:湿实验与干实验的闭环。以蛋白质设计为例:AI预测一个结构,需要湿实验验证(如晶体衍射、质谱分析),反馈结果再优化模型。十万卡集群可以加速预测,但验证环节的瓶颈在于实验设备与人员。所以“产业效力”取决于算力能否与实验平台形成迭代闭环。
对比另一个方案:某国际云厂商的AI4S服务
它们提供的是“端到端流水线”:用户上传序列,平台自动调用预训练模型、运行分子动力学、生成报告。但代价是用户无法定制模型参数,且数据隐私存疑。曙光8000的开放生态,理论上允许用户自定义模型和流程,但需要用户自己搭建环境。对于生物实验室的PI(首席研究员)来说,他们更愿意把时间花在实验设计上,而不是调试MPI并行参数。
行动建议
对于正在从事AI4S研究的同行,我的建议是:不要等到模型在十万卡集群上完美运行了再开始。先在自己熟悉的GPU(哪怕是单卡)上验证模型效果,然后用容器化技术(如Singularity)封装好环境,提交到国家超算互联网的测试节点。重点测试:
- 国产芯片(如昇腾、寒武纪)对模型算子的支持度。
- 分布式训练框架(如OneFlow、MindSpore)的通信效率。
- 数据IO是否成为瓶颈(生物序列文件通常很小,但分子动力学轨迹文件动
物界前沿