上周在图书馆刷LeetCode,我正为一题矩阵乘法的优化卡了半小时。突然手机弹出一条新闻推送——AI内存V-Die方案,侧立放置DRAM,吞吐540 token
先说清楚这个V-Die是什么。传统HBM(高带宽内存)是把DRAM芯片堆叠在逻辑芯片上,通过硅通孔(TSV)垂直连接,带宽高但散热压力大,因为热量都堆在中间。而V-Die方案把DRAM侧立放置,像书架上的书一样竖着插在芯片旁边,再用一种叫MOSAIC的互连结构把信号和电源引出来。这样做的直接好处是散热路径变短,带宽也能更高。新闻里提到的540 tokens/s是推理场景下的吞吐,对比HBM4的约296 tokens/s,提升了82.43%。这个数字让我想起自己写过的一个小语言模型推理demo,在CPU上跑得慢得让人心碎,换成GPU才勉强到个位数token每秒。所以540 tokens/s是什么概念?大概能支撑一个中等规模的对话模型实时响应了。
仔细想想,这个提升并不意外。HBM4虽然带宽翻倍,但它的物理架构决定了散热和信号完整性是瓶颈。DRAM堆叠层数越多,热量越难散出去,温度一高,频率就得降,带宽打折扣。V-Die把DRAM侧立,等于把原来垂直方向的散热问题变成了水平方向,芯片表面积更大,容易加散热片或者直接风冷。而且MOSAIC互连用了一种类似“桥接”的方式,信号路径更短,延迟更低。这让我联想到面试常被问的“内存墙”问题——算法越来越快,但数据搬移速度跟不上。V-Die试图从物理层面绕过这堵墙,而不是单纯靠堆叠。
不过,作为一个准备面试的学生,我更关心的是这个方案对AI训练和推理的实际影响。训练时,大模型要频繁读写参数,HBM带宽直接决定训练速度。V-Die的540 tokens/s是推理吞吐,但理论上训练场景也能受益,因为带宽提升后,梯度更新和参数同步都能更快。但新闻里只提了推理,可能因为训练场景更复杂,涉及多卡通信和负载均衡,单一内存方案的提升会被其他瓶颈稀释。我一个做CV的同学跟我吐槽过,他在训练ViT模型时,数据加载经常卡在内存搬运上,GPU利用率只有60%左右。如果V-Die能普及,说不定能把这个利用率拉到90%以上。
另一个让我好奇的点是,这个方案和HBM4是竞争还是互补。新闻里说V-Die比HBM4高82.43%,但实际应用时,HBM4已经量产,V-Die还在论文阶段。研究团队在IEEE/JSAP会议上展示的应该只是原型,离商业化还有距离。而且HBM4的生态已经成熟,三星、SK海力士、美光都在推,成本优势明显。V-Die需要重新设计封装和主板布局,初始成本可能很高。但长远看,如果AI芯片的功耗继续飙升,散热问题会成为更大的限制,HBM4的堆叠上限可能就在16层左右,而V-Die理论上可以堆更多层而不担心散热。所以我觉得,未来几年内,HBM4会继续主导主流市场,而V-Die会先在高端定制芯片或科研领域试水,比如那些需要极致推理吞吐的云端推理服务器。
我注意到新闻里还提到了MOSAIC,但没细说。查了一下,MOSAIC是一种基于硅中介层的互连技术,可以把多个DRAM die和逻辑die通过高密度互连集成在一起,类似一个“内存网络”。V-Die和MOSAIC可能是组合方案——V-Die负责物理形态,MOSAIC负责电气连接。这种组合让芯片设计更灵活,比如你可以把不同容量的DRAM配在一起,或者混搭不同工艺的颗粒。这让我想起面试时被问过“异构内存系统”,当时我答得磕磕绊绊,只说了个NUMA的概念。现在看,V-Die+MOSAIC就是硬件层面的异构内存实践,未来可能催生新的编程模型,比如让开发者显式管理内存放置位置,以换取带宽收益。
最后说说趋势预测。我个人的判断是,未来2到3年内,V-Die或类似侧立DRAM方案会出现在数据中心AI加速器的参考设计中
原文链接:AI 内存 V-Die 方案亮相:侧立放置 DRAM 吞吐 540 tokens/s,较 HBM4 高 82.43% - IT之家
物界前沿