28年的存储老店,怎么就成了AI圈的新晋网红
被朋友安利了DDN,说这家做了28年数据存储的公司,现在成了AI训练圈的香饽饽。我第一反应是,存储?那不是最没存在感的基础设施吗。结果他甩给我一个报道,说NASA的研究实验室用了快三十年,现在AI boom直接把它推上了火箭。行吧,我决定自己跑一趟。
先交代背景,DDN全称DataDirect Networks,做的是高性能存储,就是那种给超算中心、科研机构用的并行文件系统。AI训练这事,大家光盯着GPU算力,其实数据喂不进去,GPU再强也白搭。我之前用GPT和Claude调模型的时候,最烦的就是数据加载卡脖子,训练跑一半,存储IO成了瓶颈,GPU在那干等,我这边干着急。
这次朋友帮我搞了个测试环境,我把自己那套视觉检测的标注数据,大概几百GB,丢进去跑了一遍。上手第一步是配存储节点,界面比我预想的朴素,没有花里胡哨的仪表盘,就是一堆命令行和配置文件。我平时用终端习惯了,倒没觉得难,但要是纯小白估计得懵一阵。
真正让我意外的是性能。我这边测下来,小文件随机读写的吞吐量比我之前用的方案高了一个量级,训练时的数据加载延迟明显降下来了。之前跑一个批次的训练,光等数据就要几十秒,现在基本是秒级。这个提升对单卡跑实验可能体感不强,但要是多卡并行,差别就大了。
踩坑也有。一个是生态封闭,DDN的很多管理工具是自研的,跟开源社区的兼容性一般,我用Python写了个监控脚本想对接它的API,文档不够全,折腾了半天才跑通。另一个是价格,这东西不是个人玩家能碰的,我朋友说他们那套配置,够买好几台顶配工作站了。
所以结论是看情况。如果你是在做正经的AI训练,尤其是多卡集群,存储这块确实值得认真选型,DDN这种老牌厂商的稳定性和性能不是吹的。但如果你跟我一样,平时跑跑小规模实验,或者用现成的云服务,那没必要折腾这套,把钱花在GPU上更实在。
不过话说回来,一个28年的存储公司靠AI翻红,这事本身就挺有意思。AI圈天天喊颠覆,结果底层最值钱的还是那些扎实的老本行。我上周写过一篇关于让工具选工具的帖子,现在想想,存储这种不起眼的环节,才是真正决定训练效率的胜负手。
本文编译自 Hacker News,原文:AI's Data Dandy Is Now A Billionaire
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿