把模型刻进硅片,这就是硬核黑客的终极形态
上周末我在一个边缘计算黑客松上,看到有人用 FPGA 跑 llama.cpp。聊起来他说,这玩意儿还是太软,每个矩阵乘法都要走一遍指令流水线,浪费至少两个数量级的能效。我当时回了一句:那你不如直接流片,把权重焊死在硅片上。他愣了两秒,说这得多少钱。现在 Alphabet 告诉我们,他们已经在干了。
Frozen v2,代号很直白:冻结。不是冻结训练权重,而是冻结整个神经网络的物理拓扑。把 Gemini 的核心架构——不是某个 checkpoint,而是计算图、激活函数、注意力机制的布线——直接转成门级电路,蚀刻进 ASIC。这已经不是传统意义上的 AI 芯片,这是一颗封装了模型的硅片。
对比一下两条路线就很清楚了。
路线 A:通用 GPU/TPU。 NVIDIA 的 H100 能跑任何模型,ResNet、Transformer、MoE,只要你能写出 CUDA 和 TensorRT。Google 的 TPU v5p 同理,虽然矩阵乘法单元做了优化,但还是一个可编程处理器。灵活性高,但代价是大量的控制逻辑、缓存、指令调度器,这些都在白吃功耗。你跑一个 7B 模型,芯片上只有 30% 的电真正在做矩阵乘法,剩下 70% 在搬运数据、等待指令、处理分支预测。
路线 B:Frozen v2。 把计算图展开成流水线,每一层就是一个物理硬件模块。QKV 投影直接走专用乘法阵列,注意力头之间的数据流不走任何共享总线,走的是定制布线。没有指令,没有缓存一致性协议,没有分支预测。所有东西都是确定性的,时钟周期直接对齐计算量。跑 7B 模型,推理延迟理论上可以做到接近零控制开销,功耗降低至少一个数量级。
但代价是什么?不可重编程。Frozen v2 只能跑 Gemini,而且必须是特定版本的 Gemini 架构。模型结构一改,这芯片就废了。Alphabet 显然算过这笔账:他们内部推 Gemini 的迭代节奏,三年内架构不会大改。而且 Gemini 本身多模态,文本、图像、视频、音频,这个架构已经足够通用,值得专门造一颗 ASIC。
技术实现上,这件事难度极高。Gemini 不是单一模型,是一族模型,包含不同尺寸的 MoE 子网络。Frozen v2 要怎么处理专家路由?如果路由逻辑也固化在硅片上,那专家数量、专家选择策略就都锁死了。我猜他们会把路由逻辑做成一个小的可配置查找表,或者干脆把 MoE 展开成固定组合——每个 token 经过所有专家的一个子集,然后硬线加权。这样虽然牺牲了路由的灵活性,但换来了极致的确定性延迟。
另外,显存问题怎么解决?Gemini 的参数规模在万亿级别,不可能全部塞进片上 SRAM。Frozen v2 肯定需要外挂 HBM 堆叠,但内存带宽和片上计算单元之间的连接是定制的,不再走标准 PCIe 或 CXL 通道。这就像把一颗 4090 和它的内存焊在主板上,焊死,不可更换。但推理时数据流是预知的,可以做到计算和内存访问完全流水线,近乎零等待。
配图
从黑客松的角度看,这事让我兴奋的点在于:实体化的低延迟。想象一下,一个 Frozen v2 模组,USB 供电,单芯片就能跑 Gemini 推理,延迟 5 毫秒以内。你不用再纠结云端 API 调用开销,不用考虑 GPU 显存不够切分模型。这玩意就是一颗 AI 协处理器,插上就能用。虽然普通人买不到,但 Alphabet 内部基础设施会先用上,然后极有可能以 Cloud TPU 形式对外提供,但 API 底层已经是固化芯片。Cloud 延迟从 50ms 砍到 5ms,对实时语音、自动驾驶、机器人控制是质变。
当然,竞争对手也看到了这条路。传言 Amazon 在做 Trainium 下一代,也是固化模型架构。NVIDIA 则反过来,用更灵活的架构(Blackwell)配合更聪明的编译器,试图在通用性和效率之间取得平衡。而 Alphabet 直接梭哈专用化,赌 Gemini 架构会持续统治。
最后说个现实的问题:48 小时能做出 Frozen v2 的 demo 吗? 不能。流片周期至少 6 个月,一次成本几千万美元。但如果你在黑客松上想模拟这个思路,可以用 FPGA 把 Gemini 的某个子层(比如一个注意力头)硬编码成定制逻辑,跑在 200MHz 的定制时钟上,然后对比通用 CPU 实现的延迟。这个 demo 我打算下周开始做,技术栈选 Verilator + 一块便宜的 Xilinx FPGA。到时候把结果发出来,看看能不能做到 10 倍能效提升。
物界前沿