架构没变,Agent 能力大涨:DeepSeek V4 的暗线升级
社区讨论 · 政策

架构没变,Agent 能力大涨:DeepSeek V4 的暗线升级

BCG老叶BCG老叶7月31日2026/07/31 64 浏览

这篇文章最有价值的信息是:DeepSeek V4 系列在保持基础架构不变的前提下,Agent 能力出现了质的飞跃。这意味着模型能力的提升不依赖底层架构重构,而是通过训练数据、推理策略和微调 pipeline 的精细化调整实现。对于 AI 行业来说,这比发布一个新架构更值得关注——它验证了“软件定义模型”这条路径的可行性。

核心矛盾:架构没变,能力怎么涨的

说实话,我听到这个消息的第一反应是怀疑。DeepSeek V3 的架构我记得是 MoE 混合专家,参数规模大,分布式训练效率高。V4 系列如果架构没变,相当于用同一套引擎跑出了不一样的性能曲线。这有违直觉。

从技术角度看,模型能力提升通常有三个杠杆:架构、数据、训练策略。架构不动,意味着计算图、层数、注意力机制这些硬件级别的设计没变。那剩下的就是数据的质量和密度,以及训练时的损失函数、微调策略。Agent 能力大涨,大概率是数据侧和推理侧的联合优化。

我拆成三个维度来看:

  • 数据维度:不再只是堆量,而是做“任务密度高的数据样本”。比如把多步推理、工具调用、长上下文记忆这些场景做成高权重的训练数据,让模型在 Agent 任务上看到更多“好例子”。
  • 训练策略维度:强化学习(RL)对齐做得更精细,针对 Agent 行为的 reward model 可能重新设计了。或者用了多轮交互的 RLHF,让模型在对话中学会“什么时候该调用工具,什么时候该追问”。
  • 推理维度:不做架构改动,但可以在推理时加策略。比如 chain-of-thought 的采样次数、温度参数、reranking 机制调优,或者用了一个轻量的 verifier 模块来过滤糟糕的 Agent 行为。

对标海外:谁也在走这条路

翻一下行业,OpenAI 的 GPT-4o 在架构上也没大改,但 Agent 能力比 GPT-4 强很多。他们用的是 post-training 阶段的强化学习和系统 prompt 进化。Anthropic 的 Claude 3.5 Sonnet 也类似,架构从 3 到 3.5 没变,但 agent 能力(尤其是代码 agent)涨了一大截。

关键结论:当模型规模接近边际收益递减时,后半程的竞争已经从“攒钱买 GPU 堆参数”转向“精细化的数据工程和训练策略迭代”。DeepSeek V4 的更新验证了这一点。

再看一个反面案例:Meta 的 Llama 3 系列,架构从 3 到 3.1 做了不少调整(比如增加 token 数、改注意力机制),但 Agent 能力提升不如预期。这说明架构改动不一定带来 Agent 能力提升,反而可能引入新的不稳定因素。

对商业策略的启示

作为战略顾问,我习惯用波特五力看竞争格局。DeepSeek 这次更新,影响最大的是“替代品威胁”和“买方议价能力”。

竞争力维度 影响
现有竞争者 逼迫 OpenAI、Anthropic 加速在 Agent 场景的投入,不能只靠架构故事
替代品威胁 如果 Agent 能力可以靠数据和策略补足,那开源模型的价值会重新被评估
买方议价能力 企业客户选模型时,不再只看跑分,更看 Agent 任务上的实际表现,这会推高对“定制化 Agent 能力”的需求

从成本角度看,不做架构改动意味着训练成本没变,但推理成本可能因为 Agent 场景的复杂调用而上升。DeepSeek 需要平衡:是给 Agent 能力加一个“推理预算”上限,还是让用户自行承担。

一个开放性问题

如果架构不再是瓶颈,那下一个瓶颈是什么?我认为是数据质量的上限。高质量 Agent 行为数据需要人工标注或模拟环境生成,标注成本高,模拟环境又有偏差。当所有公司都开始卷数据策略时,谁能在数据闭环上跑得更快,谁就能建立真正的护城河。问题是:DeepSeek 能保持这种“架构不动、能力涨”的节奏多久,还是会很快碰到底层架构的天花板?

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧