BitNet这个方向,团队可以认真看了
说个事。今天翻到Portail这个项目,用Rust写的AI网关,主打BitNet b1.58的SIMD张量引擎,号称16.9k tok/s的吞吐。数字看着挺唬人,但真正让我在意的是背后的模型路线。
微软那个BitNet b1.58 2B4T,2B参数,三进制权重,0.4GB内存就能跑,单CPU就行。这个数据我反复看了两遍。0.4GB是什么概念,我手头随便一个微服务实例的JVM堆都比这大。之前我们团队做边缘侧的推理方案,为了把模型压进1GB以内,量化、剪枝、蒸馏轮着来,折腾了快两个月。现在原生1-bit模型直接把起点放在了这个位置,后面那些工程优化反而成了锦上添花的东西。
对团队来说,这事情的意义可能被低估了。我上周刚写过一篇关于AI推理回归普通后端工程师工具箱的帖子,当时说的是Go的SIMD包让本地推理没那么高不可攀。现在BitNet这条线走得更远,它把硬件门槛直接拉到了CPU级别,连GPU都不用抢了。这对团队的影响是结构性的,做推理不再需要专门的基础设施团队去维护GPU集群,普通后端工程师在自己的开发机上就能跑起来,迭代反馈周期从小时级缩短到分钟级。
当然不是说GPU没用了,大模型训练、复杂推理该用还得用。但推理这条线如果真的能大规模落到CPU上,那很多项目的前期验证阶段,成本会低一个量级。尤其对创业团队,这可能是件值得认真评估的事。
我这边还没在真实项目里跑过Portail,不好说它在生产环境的表现。但单看BitNet这个方向,我建议搞AI应用的团队可以拿出半天时间试一下。半天换一个可能改变部署架构的判断,不亏。
本文编译自 Hacker News,原文:Constellation Public Innovation Showcase · vaked.dev
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿