AI没有泡沫,但内存和电力会先卡脖子
我注意到一个有意思的细节:当威刚董事长陈立白说“2030年以后再来讨论AI泡沫”时,他其实是在用内存厂商的视角看AI。这让我想起去年在实验室用AlphaFold2跑一个大型蛋白复合物预测时,128GB的显存被吃满,整台服务器功耗飙到800W,机房空调直接报警。从那以后,我每次优化模型都会下意识问一句:这个任务的内存和电力预算够吗?
陈立白的核心判断——全球AI算力、内存及电力需求远超市场想象——在生物信息学领域已经得到验证。蛋白质结构预测从2018年CASP13的AlphaFold到现在的AlphaFold3,单次推理的显存需求翻了近10倍。更关键的是,这种增长不是平缓的,而是随着模型规模和数据量的膨胀呈现出超线性趋势。我们组最近在尝试用扩散模型生成全新蛋白质骨架,单次训练需要一块A100连续跑两周,电费比试剂费还贵。这还只是学术圈的小规模实验,换成工业级的训练集群,内存和电力消耗简直是指数级。
算力投资快于应用?这是生物信息学的常态
市场担忧云端服务商算力投资速度快于实际应用落地,这种担忧在生物信息学领域尤其常见。每当我们把AI预测的结构拿去给湿实验团队验证,对方总会说:“你们跑出来的模型,我们做一两年实验都不一定能验证。”干湿实验之间的gap确实存在,但这不是泡沫的征兆,而是技术路线图上的固有节奏。
陈立白说“现阶段讨论AI泡沫言之过早”,我深表认同。以蛋白质结构预测为例,从2020年AlphaFold2发布到2023年DeepMind开放几乎所有已知蛋白的结构预测,这三年间学界和工业界一直在消化算力产出:药物设计公司用这些结构做虚拟筛选,酶工程实验室用它们设计新酶,合成生物学团队用它们指导蛋白改造。每一次算力突破,都会催生一批新的应用场景,而这些场景反过来又要求更大的算力。这种正反馈循环至少在未来5-10年内不会中断,因为我们对生物系统的理解还远未到达瓶颈。
换句话说,AI在生物领域的应用不是“先造算力再找应用”,而是“算力每提升一个数量级,就能解锁一批之前无法解决的问题”。现在的问题不是算力过剩,而是算力远远不够。比如单细胞转录组与蛋白质结构的联合建模,或者动态蛋白质构象的分子模拟,这些任务需要的计算量是现有规模的百倍以上。
内存和电力:被低估的硬约束
陈立白特别强调“未来十年最短缺的资源是内存和电力”,这句话精准切中了AI基础设施的命门。我们做蛋白质结构预测的人最清楚:模型参数体量增长快于GPU显存增长,这导致我们不得不频繁使用模型并行和数据并行,而跨节点通信又带来新的延迟和功耗。最近英伟达的H200用141GB HBM3e显存,但距离训练一个万亿参数的全原子蛋白质力场模型还差两个数量级。
更隐蔽的问题在于电力。训练一个类似GPT-4级别的模型需要消耗相当于一个中型城市日用电量的能源。而在生物信息学中,我们不仅仅需要训练,还需要海量的推理——比如大规模虚拟筛选,可能要评估10亿个分子与蛋白质的结合能力。如果每个分子推理需要0.1秒,那10亿次就是1亿秒,约3.17年,按单卡功耗400W算,总电费超过100万美元。这种计算成本在学术项目中已经显得捉襟见肘,未来只会更严峻。
陈立白作为内存厂商的掌舵人,看到的是HBM和DDR5的产能瓶颈;而作为电力基础设施的观察者,他看到的是AI数据中心对电网的冲击。这两者都不是短期能通过算法优化解决的,必须依赖半导体工艺进步和新型能源供给。这恰好解释了为什么内存和电力会成为AI发展的真正约束——它们不像算力那样可以通过堆硬件快速扩展,它们的物理极限更接近天花板。
趋势预测:2030年前,AI发展将经历“内存-电力双瓶颈期”
未来五到七年,AI产业的增长曲线不会因为泡沫破裂而拐头,但会因为内存和电力供给不足而出现阶段性放缓。具体来说,2025-2027年,主流AI模型会从“堆参数”转向“优化内存效率”,比如低精度训练、混合专家模型、稀疏激活等。2028-2030年,新型存储技术(如HBM4、存算一体)和分布式能源方案(如核电、液冷数据中心)会开始商用,但成本依然高昂。
对于生物信息学领域,这个趋势意味着我们将不得不更认真地对待“计算资源预算”这个概念。以前我们想跑什么就跑什么,以后需要像做实验设计一样,先做功耗和内存的可行性分析。这未必是坏事,它会倒逼出更高效的算法和更聪明的工作流。比如,用扩散模型做蛋白质设计时,可以先用小模型做粗筛,再用大模型做精修,而不是一上来就砸全量算力。
陈立白的观点提醒我们:AI泡沫的讨论可以推迟,但内存和电力的现实不会推迟。对于每一个在AI领域深耕的人,尤其是我们这些做生命科学交叉的,现在就应该开始思考如何用更少的资源做更多的事。这不是悲观,而是对物理规律的敬畏。
物界前沿