矿场机柜改AI推理,别只看便宜
社区讨论 · 赛道

矿场机柜改AI推理,别只看便宜

折蛋白的折蛋白的9月2日2026/09/02 64 浏览

周末折腾了一下矿场退役机柜改AI推理节点,踩了不少坑。所谓AI推理节点,就是专门跑模型预测的服务器。如果只是小实验室想省点钱跑蛋白质结构预测,不太值;如果手里正好有稳定电力、机房和会修服务器的人,这套思路可以抄。真正值钱的是电力、冷却和稳定交付能力。

报道里说德州不少比特币矿工转向AI数据中心,Hut 8 拿了债务融资去扩AI设施,Core Scientific 在 Denton 也放弃挖矿计划,改做AI。听起来像换块牌子就能开张,可我这边上架三台退役机柜才发现,能不能跑起来只是第一步,能不能天天跑才是麻烦。

我们组用了不到一个月的GPU集群,最近把几台矿场淘汰的服务器机柜接进网络,准备跑AlphaFold3。GPU集群就是一堆显卡服务器一起算。

AlphaFold3是蛋白质结构预测模型,喂给它氨基酸序列,它尽量猜出蛋白在空间里怎么折叠。干实验和湿实验之间那道gap,很多时候就卡在这里。预测结果看着漂亮,后面还要实验验证。

开机前我觉得挺省。机柜、光纤、配电都现成,比从零搭机房快。结果第一天就卡住。旧机器BIOS里电源策略还停在挖矿模式,显卡识别不稳定。跑 nvidia-smi,也就是看显卡状态的命令,时有时无。换线、刷固件、重配网卡,折腾到晚上。权限配置也不能省,一个服务账号能改模型缓存目录,误删半截缓存后任务全停。这个模型在生物数据上的表现还没看,先被运维教育了一遍。

散热是第二个坑。矿机以前主要给机器本身吹风,AI推理跑满时,服务器和网络设备一起发热。报道里说AI数据中心需要更先进的冷却方案,芯片级液冷,也就是用液体贴着芯片散热,还要额外风冷。冗余要求也更严,意思是坏了也不能停。我这边没液冷,只有风道,跑长任务降频明显。最惊喜的是吞吐。短序列批量推理时,几台机器并发起来,比笔记本加云端接口稳。不过输出格式必须稳定,否则不如手写。我们最后强制固定字段格式,我用了3周的字段校验这次跑了一遍才敢接流程。

这套思路适合有电、有机房、有人修机器的人,不适合个人玩家、小课题组、指望捡便宜算力的人。矿场转型听起来是算力平权,实际更像把一堆说不清的运维麻烦搬回家。下周准备单独测一下断电重启后的恢复时间。


📌 本文编译自 Hacker News,原文是 https://americanbuildout.com/goodbye-bitcoin-hello-ai-data-center/

版权归原作者所有,本文为基于公开报道的编译与独立分析。

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧