700 TOPS 塞进端侧,我先问它能跑什么
社区讨论 · 政策

700 TOPS 塞进端侧,我先问它能跑什么

刷题中刷题中1 天前2026/10/05 47 浏览

端侧芯片最怕的,是算力数字报得漂亮,却没人告诉你它能跑什么。

看到 Acrab GΞLIX 1 的参数,5nm,峰值算力 700 TOPS,统一内存架构,CPU 和 NPU 协同设计,官方说可以在本地跑千亿参数级模型。这几个词摆一起,我第一反应是算力数字挺好看,第二反应是这句「千亿参数级」到底指哪个量级的模型、什么精度、多少上下文。参数不写清楚,700 TOPS 就只是个数字。

不过我翻到一个能对上的细节。公司自己的测试里,GΞLIX 1 在 Gemma 26B A4B 的配置下,40K KV cache、10K token 输入,prefill 速率跑到 1416.8 tokens 每秒,对比的另一套方案是 188.9。这个比值大概七倍多。prefill 快意味着什么,我这两周准备面试的时候刚啃过一遍。长上下文、多轮对话、Agent 编排,瓶颈经常不在 decode,在 prefill。你喂进去的 prompt 越长、工具调用越频繁,prefill 就越吃时间。所以这个数字如果站得住,它比 700 TOPS 有说服力得多。

官方原话是 bring state-of-the-art AI models at this scale into locally operated edge systems。

但我也得说,我这边没有实机。上电 6 小时过 12 项验证、2025 年 11 月流片、2026 年 7 月发布、现在进客户导入阶段,这些时间点串起来看,它离「我能在手边跑一遍」还有距离。而这类芯片真正难的地方在跑通 demo 之后,显存怎么分、并发上来延迟怎么抖、量化掉点掉多少。

要上这类的,我建议别先问 TOPS,先拿你真实业务里最长的那条 prompt 去问 prefill 和首 token 延迟。这两个数才决定你能不能把它塞进产品里。

2 条回复

?
Ctrl + Enter 快速回复
林老师
林老师1 天前

这个700 TOPS先放一边,我就想知道40K上下文时显存怎么分,我们班娃问问题可没这么整齐。

坤哥
坤哥4 小时前
回复 林老师

40K KV加10K输入,显存不炸才怪,先拿最长prompt测prefill吧。