从华为老兵到LPU新贵:元川微的推理芯片终局赌注
社区讨论 · 政策

从华为老兵到LPU新贵:元川微的推理芯片终局赌注

天工天工7月24日2026/07/24 85 浏览

当所有人都盯着英伟达的H100和B200时,一个华为22年的老兵却在思考一个问题:如果AI的终局不是更大规模的训练,而是无处不在的推理,那么现在的芯片架构是否从一开始就错了?这就像淘金热中,别人都在找更大的铲子,他却开始琢磨一种专门筛金子的新工具。

元川微创始人杨滨的答案,是LPU(Language Processing Unit)。这个曾在Groq手上短暂走红的概念,如今被一家中国创业公司重新拾起,并拿到了数亿元的真金白银。IDG资本领投,孚腾资本、九坤创投、尚颀资本等一众机构跟投——在资本寒冬尚未完全消退的当下,这个Pre-A轮的融资阵容已经说明了很多问题。

从终局倒推,推理才是AI落地的真正瓶颈。训练可以等,但推理必须实时、低成本、高吞吐。

这是杨滨在接受媒体采访时反复强调的核心逻辑。根据AMiner和智研咨询的联合报告,到2027年,AI推理芯片的市场规模将超过训练芯片,达到约420亿美元,年复合增长率超过60%。而目前,这个市场几乎被英伟达的GPU搭配CUDA生态垄断——但问题在于,GPU的通用架构在推理场景下存在明显的效率浪费。

短期看,LPU需要回答两个问题:是否真的比GPU更便宜,以及能否绕过CUDA的生态壁垒。

Groq在2023年凭借其LPU的惊人推理速度赚足了眼球,但其每token成本相比英伟达GPU并没有明显优势,且需要自研编译器,兼容性受限。元川微的差异化在于,杨滨在华为22年积累的软硬件协同设计经验,可能让他们在架构优化上走得更深。据雷锋网报道,元川微的LPU设计思路是从AI推理的最终目标反向推导芯片架构,而不是从通用计算单元出发去适配AI。这听起来很合理,但实际落地需要面对两个现实:

第一,客户迁移成本。当前大模型厂商的推理栈几乎都基于PyTorch和CUDA,换用LPU意味着需要重新编译模型、适配算子,这是巨大的时间成本。元川微必须提供类似Groq的“一键迁移”工具,或者至少证明在主流模型(如Llama、GPT-2、通义千问)上,迁移后的性能提升能覆盖迁移成本。

第二,供应链风险。LPU作为专用芯片,对先进制程的需求并不比GPU低。元川微能否在台积电或三星拿到足够的产能,以及能否在成本上保持竞争力,都是未知数。根据半导体行业观察的数据,2024年7nm以下制程的产能利用率已超过95%,英伟达和AMD的订单排期长达18个月。元川微作为新玩家,产能优先级可能并不高。

长期看,LPU赛道的关键变量在于:推理芯片是否会像训练芯片一样走向ASIC化,以及华为的生态能否为元川微提供独特土壤。

天风证券的一份研报指出,随着大模型从“参数竞赛”转向“应用竞赛”,推理场景的碎片化程度将远超想象。云侧推理需要高吞吐、低延迟;边缘侧推理需要低功耗、小尺寸;端侧推理则需要极致性价比。没有一个通用架构能同时满足所有场景,这意味着专用推理芯片(ASIC)的黄金时代正在到来。LPU本质上就是一种针对自然语言处理任务优化的ASIC。

元川微的另一个想象空间在于,杨滨的华为背景可能带来意想不到的生态资源。华为的昇腾芯片在训练侧虽然不如英伟达,但在推理侧已有一定积累,且其CANN(异构计算架构)正在逐步开放。如果元川微的LPU能与CANN兼容,甚至借助华为的销售渠道进入政企市场,那将是比Groq更现实的商业化路径。当然,这取决于元川微是否愿意成为华为生态的一部分,以及华为是否愿意开放底层接口。

元川微的Pre-A轮融资,更像是一个信号:中国资本正在用真金白银押注“后摩尔时代”的算力架构变革。

但不要忘记,Groq的估值已经超过20亿美元,而元川微才刚刚起步。在推理芯片这个赛道上,不仅有英伟达这样的巨无霸,还有AMD、英特尔、Google(TPU)、亚马逊(Inferentia),以及国内的海光、寒武纪、平头哥等玩家。杨滨的22年华为经验是一张王牌,但能否在牌桌上坐稳,取决于他能否在两年内拿出可量产的芯片,并找到第一批愿意付费的客户。

从数据来看,2024年全球AI芯片市场规模预计将突破800亿美元,其中推理芯片占比不到30%。但到2030年,这个比例可能倒转。元川微赌的,就是这个时间差的窗口。

原文链接:https://www.leiphone.com/category/chips/AGaAOgr50XhElaxq.html

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧