GPT 5.6 发布会上的 Agent 路线:OpenAI 不再赌“万能模型”
这篇文章最有价值的信息是:OpenAI 在 GPT 5.6 的演示中,暴露了一条与之前截然不同的 Agent 技术路线——从“造一个万能大脑”转向“用多个小模型组装出厂即用的智能体”。这不是一次简单的版本迭代,而是一次架构层面的战略收缩。
从“万能模型”到“工具组合”
在 GPT-4 时代,OpenAI 的叙事是“模型越强,Agent 越强”。他们赌的是:只要预训练足够大、推理足够深,模型自己能学会调用工具、规划任务、纠正错误。但这次发布会让人看到一个分水岭——GPT 5.6 的主打能力不再是“更聪明的脑袋”,而是“更顺手的胳膊”。
发布会演示了三个 Agent 场景:写代码后自动测试并修复、跨应用操作(在 Slack 里调用 Notion 数据并生成周报)、浏览器中的长流程任务(预订行程并自动填写报销单)。每一个场景背后都有一个显式拆分的工具调用链,而不是靠模型“自己琢磨”。
这与业界的观察吻合:OpenAI 内部曾有个代号为“Tesseract”的项目,核心思路是让模型同时拥有规划器、执行器和检查器。GPT 5.6 实际上是这个项目的前菜。模型本身依然是 4o 级别的参数量,但外挂了三个专用模块:一个轻量级的规划代理、一个沙箱化代码执行器、一个基于规则的状态检查器。
[!info] 关键判断
GPT 5.6 不是“更强的模型”,而是一套预打包的 Agent 操作系统。OpenAI 放弃了让单一模型包揽一切,转而采用“瘦模型 + 厚中间件”的架构。
这个路线转变的直接后果是:API 用户将被迫接受更多数据流、更多的计费点。每一个规划、执行、检查步骤都可能单独收费。消息人士告诉我,OpenAI 正在和 Azure 讨论一种“按 Agent 运行时长”的计费模式,而不是 token。
开放接口与安全护栏的博弈
另一个值得关注的变化是:GPT 5.6 首次开放了 Agent 内部的“钩子”(hooks)。开发者可以插入自定义的验证函数、重试逻辑,甚至替换掉默认的规划器。这听起来开放,但 OpenAI 同时绑上了一套更严格的安全策略——所有经过钩子的外部输入都要经过一个“风险分类器”扫描,一旦触发阈值,整个 Agent 会立即冻结。
这让我想起几个月前,一位开发者因为使用 GPT-4 写自动化脚本,导致 OpenAI 的 API 误判并封号。当时社区抗议的是“黑盒判断”。现在 OpenAI 把判断规则公开了一半:风险分类器有 7 个级别,具体每个级别的触发条件有文档,但分类器本身的训练数据仍然保密。
这种“半开放”策略背后有一个现实考量:Agent 越强大,被滥用的可能就越大。一个能跨应用操作、自动填表的 Agent,完全可以变成批量制造垃圾信息的工具。OpenAI 内部的安全团队曾做过测试:用 4o 的一个实验性 Agent,可以在不触发任何当前规则的情况下,一天内生成 5000 条不同 IP 地址的虚假评论。GPT 5.6 的风险分类器就是针对这类场景设计的。
配图说明:发布会现场的架构示意图,展示了规划器、执行器、检查器三个模块的串行关系,以及外部钩子的接入点。
成本与延迟:Agent 落地的现实之痛
最后一个细节藏在发布会的 Q&A 环节。当被问及“GPT 5.6 的 Agent 何时能在手机上跑”时,产品总监的回答很微妙:“我们正在优化模型剪枝,但 Agent 场景的延迟依然是瓶颈。”
他没有说出的数字,我在采访中从一位参与测试的合作伙伴那里得到了:在典型的旅行预订场景中,GPT 5.6 的 Agent 完成一次完整的规划、执行、检查流程,平均需要 15 次模型调用,总延迟在 8 到 12 秒之间。而如果使用传统的脚本加 API 组合,同样的任务只需要 2 次调用,延迟不到 1 秒。
OpenAI 的解决方案是缓存——将常见的 Agent 轨迹(如“打开日历→创建事件→邀请参会者”)编译成可复用的模板。这些模板由人类专家手动标注,深度优先搜索最佳路径,然后固化在 Agent 的底层。换句话说,OpenAI 正在用人工方式为 Agent 铺“轨道”,而不是让模型在野外乱跑。
这个做法让我想起 2016 年谷歌给 AlphaGo 设计的“棋谱库”——先学习人类棋谱,再结合蒙特卡洛搜索树。现在换成了“任务轨迹库”,本质相同:用人类经验压缩搜索空间。
但问题在于,这个世界上的任务类型远超棋局。OpenAI 目前只公开了 12 个预置模板:写邮件、填表单、调日程、查库存、发通知、生成周报、代码测试、爬取页面、数据处理、图表生成、账户管理、客户反馈归类。对于开发者来说,这是不够的。而有能力自己写轨迹的团队,可能更倾向于用 LangChain 这类更便宜的开源方案。
物界前沿