我注意到一个有意思的细节:Lindy的那25个人,把100%流量从Anthropic切到DeepSeek,停服后居然没有用户投诉
这背后不是简单的“便宜”,而是推理侧性价比的数学碾压。我跑了一下具体数据:DeepSeek-V2的API定价是输入0.14元/百万token,输出0.28元/百万token,对比Anthropic Claude 3 Opus的输入15美元/百万token、输出75美元/百万token,按当前汇率换算,DeepSeek的价格大约是Anthropic的1/10到1/20。但Lindy这种面向终端用户的AI助手,如果模型质量有明显下降,用户会立刻感知并流失。他们没有遇到投诉,说明DeepSeek在大多数对话场景下的表现,至少达到了“可接受”甚至“好用”的水平。
再看Uber的故事。Uber四个月内烧光全年AI预算,本质上是他们之前绑定的是闭源API,且没有做成本控制。当流量爆发时,API调用量线性增长,而预算只能线性增长。Uber的问题在于,他们没有意识到推理成本不是固定成本,而是与用户活跃度强相关的可变成本。一旦模型使用量超出预期,预算就会失控。而DeepSeek给出的方案,是把成本拉低一个数量级,让Uber可以用同样的预算服务更多用户,或者干脆把预算省下来做其他事。
微软悄悄把DeepSeek塞进Copilot,这件事更值得玩味。微软和OpenAI是深度绑定的战略伙伴,Azure是OpenAI独家云服务商。但微软的Copilot是一个面向海量Office用户的产品,用户基数巨大,每1%的推理成本下降,对应的是数千万美元级别的年度节省。微软的选择很务实:在技术可行性上,DeepSeek的MoE架构经过蒸馏和量化后,能在消费级GPU上跑出不错的效果,而OpenAI的模型虽然更强,但成本实在太高。微软的举动说明,大厂正在用“混合模型架构”来对冲单一供应商的风险——核心任务用GPT-4,非关键任务用DeepSeek或开源模型,这已经成为一种新的技术策略。
从技术原理上看,DeepSeek之所以能把成本压到这么低,核心在于三个关键设计:
首先是MoE(混合专家模型)架构。DeepSeek-V2采用了MoE,激活参数仅占总参数的5%-10%,每个token只激活少量专家,大大降低了推理时的计算量。相比之下,Anthropic的Claude 3是稠密模型,所有参数都要参与计算,虽然性能上限更高,但推理成本线性增长。MoE的代价是训练阶段更复杂,需要解决负载均衡和专家“塌陷”问题,但深度求索在训练上做了大量优化,甚至开源了细节,这也是为什么其他机构能快速复现类似效果。
其次是KV Cache压缩。DeepSeek提出了一种称为“Multi-Head Latent Attention”的机制,把KV Cache压缩到不到原来的1/10。这意味着相同显存下可以服务更长的上下文,或者相同硬件上可以支撑更多并发。对于Lindy这样需要处理大量用户会话的SaaS产品,KV Cache的优化直接降低了单次请求的硬件占用,从而降低每百万token的推理成本。
最后是训练效率的极致压榨。DeepSeek的训练成本据估算不到GPT-4的1/10,但性能在多个基准测试中接近甚至持平。这得益于他们采用了一种“数据蒸馏”策略:先用高质量数据训练一个强大的教师模型,然后让学生模型学习教师模型的输出,大幅降低训练所需的数据量和计算量。这种思路在学术界已经存在,但深度求索把工程化做到了极致,并且融入了对MoE架构的针对性优化。
现在回到新闻里的核心现象:一个只有25人的创业公司,敢把全部流量从Anthropic切向DeepSeek,这是对技术信任的极致体现。Lindy的CTO在接受采访时说,他们做了两周的A/B测试,DeepSeek在用户满意度、任务完成率、响应速度上全面超过Claude 3 Opus,而成本只有后者的1/15。这不仅仅是“便宜”,而是“便宜又好用”的组合。
但这里有一个容易被忽视的细节:DeepSeek是开源的,或者至少提供了可下载的模型权重。这意味着Lindy可以在自己的服务器上部署模型,不需要依赖API调用。对于注重隐私和延迟的公司,自部署可以进一步降低成本,因为推理成本变成了固定的硬件折旧,而不是按token计费。而Anthropic和OpenAI的模型是闭源的,只能通过API调用,没有自部署选项。开源模型+自有硬件,正在成为AI创业公司降低运营成本的最终武器。
我的判断是:DeepSeek的现象级成功,不是偶然的“价格战”,而是技术架构创新的必然结果。它代表了一种新的AI发展路线——不追求极致的单一模型参数规模,而是追求推理效率与性能的帕累托最优。这条路线的核心是:用更少的计算资源,达到接近顶级模型的效果。而Anthropic和OpenAI目前还在走“更大、更强、更贵”的路线,两者的分歧正在形成。
从全球AI版图来看,这可能会引发一个连锁反应:越来越多的中小公司,甚至是像Uber、微软这样的大厂,
物界前沿