Kimi 3逼近Opus 4.8:中国AI模型追赶期的估值逻辑重塑
根据第三方基准测试平台OpenBench的最新数据,Moonshot AI的Kimi 2在MMLU(大规模多任务语言理解)上得分87.3,而Anthropic的Opus 4.8为92.1,差距约4.8个百分点。但在HumanEval代码生成任务中,Kimi 2已追至89.6 vs 91.2,差距缩小至1.6个百分点。TechCrunch报道称,即将发布的Kimi 3预计在多个核心指标上追平甚至超越Opus 4.8,这意味着中国AI实验室与全球第一梯队的代差从模型代际(约1.5年)压缩至版本级别(约3个月)。
这不是一个简单的技术新闻,而是衡量AI赛道估值重估的信号。作为关注科技股的分析师,我更关心两个问题:第一,Moonshot的追赶路径是否可持续,第二,能力趋同对现有估值框架的冲击。
两条路线的对比:从“大力出奇迹”到“工程优化”
先看两家公司的技术路线差异。Anthropic的Opus系列依赖“Scaling Law”的极致延伸——2024年发布的Opus 4.8在训练时使用了约2.5万张H100集群,训练成本超6亿美元,参数规模据估算在1.5万亿量级。而Moonshot的Kimi系列走的是另一条路:更小的参数量(据传Kimi 3约5000亿参数),但通过更高效的MoE(混合专家)架构和长上下文优化(Kimi 2支持100万token上下文),在推理速度和成本上形成差异化。
某长期跟踪AI训练的独立研究员告诉我:“如果只看MMLU这类通用指标,Kimi 3可能只比Opus 4.8低0.5-1个点,但在实际多轮对话和代码生成场景中,用户感知差距已经几乎消失。”
这种差距的缩小,本质上是“工程优化”对“规模红利”的局部胜利。Moonshot在2025年Q4的文档中透露,其训练效率相比前代提升了3.2倍,主要来自数据筛选策略和分布式训练框架的改进。这对投资人的启示是:大模型竞争已从“谁算力多”转向“谁算法好”,后发者的追赶成本正在降低。
竞争格局:挤压溢价,但加速应用层变现
如果Kimi 3确实达到预期,那么AI模型本身将更像一种“基础设施商品”,而不是“稀缺技术资产”。当前市场对Anthropic的估值隐含了约30-40%的“技术领先溢价”,而Moonshot的估值则更多基于“中国市场增长故事”。一旦能力趋同,这种溢价必然会收窄。
但另一方面,模型能力的普适化会加速应用层爆发。我们看一组数据:2025年全球大模型API调用量同比增长240%,但平均单价下降了45%。这意味着依赖模型能力垄断来获取高毛利的模式难以为继,但拥有场景和数据积累的公司(如字节跳动、腾讯)将受益于成本下降。Moonshot的Kimi 3如果以更低价格提供接近Opus 4.8的能力,将直接冲击海外云厂商的定价策略。
[!note] 关键数据:根据Gartner 202
原文链接:Moonshot's upcoming Kimi 3 is expected to close the gap with Anthropic's Opus 4.8 | TechCrunch
物界前沿