Token刺客背后的算力经济学:为什么我们需要的不是更多芯片,而是更好的“算力路由器”
社区讨论 · 政策

Token刺客背后的算力经济学:为什么我们需要的不是更多芯片,而是更好的“算力路由器”

墨墨墨墨7月21日2026/07/21 65 浏览

当大模型公司为每百万Token支付数美元推理成本时,有多少人想过,这笔钱里有多少是在为英伟达的生态税买单?

三年前“百模大战”的喧嚣早已褪去,但一个更本质的问题浮出水面:英伟达GPU一卡难求的同时,大批国产AI芯片却在数据中心里吃灰。这不是产能问题,而是系统性的生态错配——模型训练者无法低成本地迁移到非英伟达硬件,而硬件厂商又无法提供足够成熟的软件栈。夏立雪在WAIC 2026上提到的“Token刺客”,正是这种错配的最终表现:用户为算力支付了远超实际计算成本的价格,而国产芯片的潜力被锁死在兼容性牢笼里。

从“卖芯片”到“开算力店”:一个模式拐点

无问芯穹的答案不是再做一个英伟达,而是做“算力中间层”。夏立雪团队提出的“开店、建中心”,本质上是从硬件销售转向算力服务。这不是简单的商业模式变化,而是技术栈的重构——他们试图在模型框架和底层硬件之间,建立一层通用的运行时,让同一个模型可以在不同芯片上获得接近原生性能的推理效率。

这种思路与Triton、TVM等开源编译器一脉相承,但差异在于:无问芯穹的目标是商业化的“算力路由器”,而非纯学术工具。当用户面对“用英伟达贵但省心,用国产卡便宜但费劲”的两难时,中间层的作用就是让“费劲”变得透明,从而打破“Token刺客”的定价权。

技术关键:解耦模型与硬件的“胶水层”

实现这一目标,需要解决三大核心问题:

  • 算子自动映射:不同芯片的指令集、缓存架构差异巨大,手工编写高性能算子成本极高。无问芯穹的做法是构建一个“算子中间表示”,让编译器自动生成适配不同后端的代码。这需要大量芯片微架构特征的刻画,也是团队十余年积累的核心壁垒。
  • 动态编译与调度:大模型推理是动态的,batch size、序列长度、KV cache命中率都在变化。静态编译无法最优,必须结合运行时profile做即时调优。这类似于CPU的乱序执行,但规模大得多。
  • 内存与带宽管理:国产芯片在显存带宽上普遍落后于英伟达H100/B200,需要通过计算-通信重叠、流水线并行等技巧隐藏延迟。无问芯穹的“中心”模式,可以利用多卡、多节点协同,以集群优势弥补单卡弱势。

[!info] 一个关键判断:未来两年,AI芯片的竞争将从“谁算力更强”转向“谁更容易被集成”。软件栈的成熟度,将决定硬件厂商的生死。

商业逻辑:“Token刺客”的终结者

如果仅从技术角度看,无问芯穹的方案与华为昇腾的CANN、壁仞的BIRENSUITE等国产芯片自带的软件栈有重叠。但夏立雪的差异化在于“中立性”——不绑定任何一家硬件厂商,而是作为平台服务商,聚合多家芯片资源。这对用户意味着:

  • 降低迁移成本:不需要为更换芯片而重新优化模型,只需在无问芯穹的平台上配置一次,即可在多个算力池间切换。
  • 对抗锁定效应:英伟达的CUDA生态是最大的锁定,而中间层可以成为“反锁定”的缓冲带。用户的数据和模型不依赖任何特定芯片,算力本身变成可替换的商品。
  • 按需弹性扩缩:类似云计算,但更细粒度——按Token计费,而非按卡时。这直接回应了“Token刺客”问题:用户只为实际

原文链接:https://www.leiphone.com/category/industrynews/O4z1YxdXtRVscE16.html

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧