
BR100这张卡,我在客户机房待了两天
被一个做具身的朋友安利了壁仞的BR100,他说他们训练集群开始混着用国产卡,成本能压下来。我说那我去看看。他帮我约了合作方的机房,我在那儿待了两天,前后自己又租了几天算力,加起来一周不到。
先说它是个什么东西
通用GPU,说人话就是既算AI也能干别的并行计算的卡,跟只做矩阵乘的专用加速器不是一条路。BR100是壁仞的旗舰,7nm工艺,770亿晶体管,芯片面积1074平方毫米,8192个通用流式处理器加512组张量加速引擎,片上256MB分布式共享缓存,外面挂HBM2E,单卡64GB显存,整卡功耗550W。
这些数字是官方公开口径,不是我测的。其中"最高比英伟达Ampere快2.8倍"那句我留个问号,看场景,看你怎么切。对标的自然是A100、H100那一档。国内能把这个规格做出来的,一只手数得过来。
实际跑起来,卡在哪
第一天基本没干活。装驱动、对框架版本、编译算子,折腾到晚上才把环境拉起来。国产卡的老毛病,不是硬件不行,是软件栈的坑得自己填。
第二天跑推理,一个几十B参数的模型,切了张量并行。跑通了,吞吐我这边测下来能接受。单卡64GB的好处是显存不用抠着算,省了堆卡的麻烦。中间有个算子没覆盖,报错之后换了条实现路径绕过去。这种事在国产卡上是常态,前提是你得有人会改代码。
监控工具是对标nvidia-smi那套做的,利用率、显存、功耗都看得到。功耗要有心理准备,550W不是小数,老机房未必扛得住。
朋友的原话是:能用,但你得养一个懂底层的团队。
谁该考虑,谁别碰
适合的:预算卡得死、模型形态固定、自己有迁移工程能力的团队。训练完就上线、上线后不怎么换模型的,迁移成本一次性能摊回来。
不适合的:小团队、模型一天一换的、指望开箱即用的。生态这东西不是参数能补的,社区薄、文档少,遇到问题基本靠自己扛。
下一步
从投资视角看,壁仞这张牌的价值不在单卡跑分。它是港股第一支GPU股,首日涨得也凶,但估值里装的是国产替代的期权,不是按出货量算的账。这个赛道天花板在哪,得看软件栈什么时候能追上来。
给读者一个建议:别急着采购。先拿你们手上最小的那个模型,找一家能提供算力的做一周迁移验证。一周内跑通再谈后面的事。跑不通,说明缺的不是卡,是人。
物界前沿