
架构没变,Agent 能力大涨:DeepSeek V4 的暗线升级
这篇文章最有价值的信息是:DeepSeek V4 系列在保持基础架构不变的前提下,Agent 能力出现了质的飞跃。这意味着模型能力的提升不依赖底层架构重构,而是通过训练数据、推理策略和微调 pipeline 的精细化调整实现。对于 AI 行业来说,这比发布一个新架构更值得关注——它验证了“软件定义模型”这条路径的可行性。
核心矛盾:架构没变,能力怎么涨的
说实话,我听到这个消息的第一反应是怀疑。DeepSeek V3 的架构我记得是 MoE 混合专家,参数规模大,分布式训练效率高。V4 系列如果架构没变,相当于用同一套引擎跑出了不一样的性能曲线。这有违直觉。
从技术角度看,模型能力提升通常有三个杠杆:架构、数据、训练策略。架构不动,意味着计算图、层数、注意力机制这些硬件级别的设计没变。那剩下的就是数据的质量和密度,以及训练时的损失函数、微调策略。Agent 能力大涨,大概率是数据侧和推理侧的联合优化。
我拆成三个维度来看:
- 数据维度:不再只是堆量,而是做“任务密度高的数据样本”。比如把多步推理、工具调用、长上下文记忆这些场景做成高权重的训练数据,让模型在 Agent 任务上看到更多“好例子”。
- 训练策略维度:强化学习(RL)对齐做得更精细,针对 Agent 行为的 reward model 可能重新设计了。或者用了多轮交互的 RLHF,让模型在对话中学会“什么时候该调用工具,什么时候该追问”。
- 推理维度:不做架构改动,但可以在推理时加策略。比如 chain-of-thought 的采样次数、温度参数、reranking 机制调优,或者用了一个轻量的 verifier 模块来过滤糟糕的 Agent 行为。
对标海外:谁也在走这条路
翻一下行业,OpenAI 的 GPT-4o 在架构上也没大改,但 Agent 能力比 GPT-4 强很多。他们用的是 post-training 阶段的强化学习和系统 prompt 进化。Anthropic 的 Claude 3.5 Sonnet 也类似,架构从 3 到 3.5 没变,但 agent 能力(尤其是代码 agent)涨了一大截。
关键结论:当模型规模接近边际收益递减时,后半程的竞争已经从“攒钱买 GPU 堆参数”转向“精细化的数据工程和训练策略迭代”。DeepSeek V4 的更新验证了这一点。
再看一个反面案例:Meta 的 Llama 3 系列,架构从 3 到 3.1 做了不少调整(比如增加 token 数、改注意力机制),但 Agent 能力提升不如预期。这说明架构改动不一定带来 Agent 能力提升,反而可能引入新的不稳定因素。
对商业策略的启示
作为战略顾问,我习惯用波特五力看竞争格局。DeepSeek 这次更新,影响最大的是“替代品威胁”和“买方议价能力”。
| 竞争力维度 | 影响 |
|---|---|
| 现有竞争者 | 逼迫 OpenAI、Anthropic 加速在 Agent 场景的投入,不能只靠架构故事 |
| 替代品威胁 | 如果 Agent 能力可以靠数据和策略补足,那开源模型的价值会重新被评估 |
| 买方议价能力 | 企业客户选模型时,不再只看跑分,更看 Agent 任务上的实际表现,这会推高对“定制化 Agent 能力”的需求 |
从成本角度看,不做架构改动意味着训练成本没变,但推理成本可能因为 Agent 场景的复杂调用而上升。DeepSeek 需要平衡:是给 Agent 能力加一个“推理预算”上限,还是让用户自行承担。
一个开放性问题
如果架构不再是瓶颈,那下一个瓶颈是什么?我认为是数据质量的上限。高质量 Agent 行为数据需要人工标注或模拟环境生成,标注成本高,模拟环境又有偏差。当所有公司都开始卷数据策略时,谁能在数据闭环上跑得更快,谁就能建立真正的护城河。问题是:DeepSeek 能保持这种“架构不动、能力涨”的节奏多久,还是会很快碰到底层架构的天花板?
物界前沿