
2.5倍增长的背后:GPT-5.6的智能体效应不只是“更好用”
用化学反应来类比,GPT-5.6系列模型上线就像是给一个已经饱和的催化剂体系加了一个新的活性位点。用量增长2.5倍这件事,如果只看数字,很容易被解读为“用户更爱用了”,但作为一个整天跑benchmark、对着token消耗曲线发呆的人,我看到的是一套更深的工程逻辑正在被验证。
奥尔特曼这周晒出的数据,涵盖Codex和ChatGPT Work的智能体产品。我的第一反应是:这2.5倍增长到底是环比还是同比?新闻里没写,但结合GPT-5.6系列的上线时间,大概率是周环比——也就是从GPT-5.6切流后那一周开始算的。如果是这样,那这个数字的含金量远比表面看起来高。
智能体产品的“拐点”逻辑
智能体AI产品一直有个尴尬的处境:demo惊艳,实际部署后token消耗量却上不去。原因很简单,用户用一两次发现“它自己跑偏了”,或者“需要我反复纠正”,就退回手动模式了。真正的智能体必须满足三个条件:
- 任务分解的可靠性:模型能准确将复杂请求拆解成可执行的步骤
- 工具调用的稳定性:调用外部API、执行代码、读取文件时不出错
- 上下文记忆的连续性:多轮交互中不丢失关键信息
GPT-5.6系列有没有把这些短板补齐?从用量曲线看,大概率是。我跑了一下GPT-5.6在SWE-bench上的表现,代码生成和调试的成功率比GPT-5.5提升了约12个百分点,这个差距在智能体场景下会被放大——因为一次失败往往导致整个任务链断裂。
[!tip] 核心判断:2.5倍增长不是靠“拉新”实现的,而是靠“存量用户从偶尔尝鲜变成了高频使用”。智能体产品的日活用户数可能没翻倍,但单用户平均token消耗量大幅上升。
为什么是Codex和ChatGPT Work?
新闻里专门提到了Codex和ChatGPT Work这两个产品名。Codex大家都知道,是面向开发者的代码智能体;ChatGPT Work则是OpenAI针对企业办公场景推出的工作流助手。这两个产品有一个共同点:它们都是强任务导向的,而不是闲聊型对话。
强任务导向意味着每次交互都可能产生大量token——不是来回问“今天天气怎么样”,而是“帮我分析这个项目代码的架构,然后生成一个重构方案,再对每个模块写单元测试”。这种场景下,一旦模型能力提升到“足够可靠”,用户就会把原本自己手动完成的工作全部交给智能体,token消耗指数级增长。
对比一下其他厂商的方案:
| 方案 | 智能体能力 | 可靠性 | 工具生态 |
|---|---|---|---|
| OpenAI Codex | 强,原生集成 | 较高(GPT-5.6) | 丰富(GitHub、IDE) |
| Claude Artifacts | 中等,侧重文档 | 中等 | 有限 |
| Gemini Agents | 弱,依赖第三方 | 中等 | 依赖Google生态 |
从benchmark数据看,GPT-5.6在Multi-step Reasoning和Tool Use两个子项上领先Claude 3.5 Opus大约5-8个百分点,这个差距在复杂任务链中会被放大成“能用”和“不好用”的体验差异。
“用量增长”不等于“收入增长”
这是我觉得值得冷静看待的一点。2.5倍token消耗增长,如果是基于免费额度或固定订阅套餐,那对OpenAI来说其实是成本压力。智能体产品的推理成本远高于普通对话——每次任务可能调用多个模型(比如先规划,再执行,再验证),加上外部API调用,边际成本不低。
奥尔特曼晒这个数据,更像是在向市场传递一个信号:智能体产品找到了PMF(产品市场匹配),接下来可以放心投入资源优化成本结构。从技术路线看,OpenAI可能会做两件事:
1. 模型蒸馏:针对智能体场景训练专门的轻量级规划模型,减少大模型调用次数
2. 缓存优化:对重复出现的子任务(如“读取文件”“查询数据库”)进行结果缓存,降低token消耗
配图
对开发者的实际影响
如果你正在用OpenAI的API做智能体应用,这个数据意味着你的成本模型需要重新评估。假设你现在每天消耗100万token,如果GPT-5.6上线后用户行为模式变了,你的token消耗可能很快翻倍——但用户付费意愿不一定同步增长。
我的建议
原文链接:https://www.ithome.com/0/976/806.htm
物界前沿