Astra 把题刷满,不等于把活接走
我注意到一个有意思的细节……GPT-6 Astra 这次发布,最吵的是几组接近饱和的分数。FrontierMath Tier 4 到了 97.6%,ARC-AGI-3 从上一代的 7.8% 跳到 99.9%,ExploitBench 直接 100%。同一时间,OpenAI 又把叙事从“会聊天”挪到“会操作电脑”,填表单、改 CRM、写代码、跑测试。看起来像突破。但我更担心,这又是一轮把 benchmark 当成产品成熟度的炒作。
这些测试题都有边界。数学有标准答案,漏洞利用有成功失败,抽象推理有固定反馈。真实工作不是这样。合同审阅、客户工单、数据清洗、线上排障,输入常常脏,字段常常错,责任常常说不清。我最近用开源模型跑推理服务,也拿 WorkBuddy 处理过表格和合同,印象很深,跑分和跑生产差着一整层。截图里合并单元格一乱,OCR 再聪明,也会把管辖法院和争议解决条款混到一列。你让它“一键汇总”,它汇总得很像样,但像样不等于能交给法务。
Astra 强调符号世界模型,听上去是把环境抽象成可操作对象。这个方向有价值。可企业环境不是符号世界,更多是半符号半人类习惯的混合体。一个按钮位置、一个审批人口头规则,都会把自动化打断。实际落地还早。
成本下降之后,瓶颈反而更明显。这次报道里还有几个数字,每题狂烧 360 美元,低算力设置下 GPQA Diamond 仍有 94.9%,API 预估成本下降约 37%。但我这边测下来,复杂任务真正贵的是长链路。调用工具、重试、校验、人工验收、权限隔离、回滚方案都会把成本推上去。OSWorld 2.0 得分 72.6%,已经说明桌面环境还没有饱和。模型能打开浏览器,不等于能把一次跨系统操作稳定做完。
网络安全被标成 Critical,也不该只写成能力证明。它更像提醒。能自己找漏洞、能操作真实系统,权限模型必须重做。FSD 我刚上手,还没资格说长,但黑盒决策和实时接管的问题已经够明显。Agent 自动操作电脑,如果出错,责任怎么界定,日志怎么追溯,用户敢不敢给它写权限,这些比跑分更决定能不能进生产。
我前面写过数据中心那盆冷水,针对的是把算力、模型、测试分包装成全民红利的叙事。Astra 这次也一样。分数漂亮,叙事更大,产品化却还隔着验收单、责任边界和脏数据。
如果它真能把符号世界模型接进连续任务,我会认真看。现在先别把接近满分当成人类退出流程。看看它能不能在我客户那边连续跑一周,不翻车,再谈 AGI 也不迟。
物界前沿