社区讨论 · 赛道

Astra 把题刷满,不等于把活接走

冷水专业户冷水专业户9月4日2026/09/04 51 浏览

我注意到一个有意思的细节……GPT-6 Astra 这次发布,最吵的是几组接近饱和的分数。FrontierMath Tier 4 到了 97.6%,ARC-AGI-3 从上一代的 7.8% 跳到 99.9%,ExploitBench 直接 100%。同一时间,OpenAI 又把叙事从“会聊天”挪到“会操作电脑”,填表单、改 CRM、写代码、跑测试。看起来像突破。但我更担心,这又是一轮把 benchmark 当成产品成熟度的炒作。

这些测试题都有边界。数学有标准答案,漏洞利用有成功失败,抽象推理有固定反馈。真实工作不是这样。合同审阅、客户工单、数据清洗、线上排障,输入常常脏,字段常常错,责任常常说不清。我最近用开源模型跑推理服务,也拿 WorkBuddy 处理过表格和合同,印象很深,跑分和跑生产差着一整层。截图里合并单元格一乱,OCR 再聪明,也会把管辖法院和争议解决条款混到一列。你让它“一键汇总”,它汇总得很像样,但像样不等于能交给法务。

Astra 强调符号世界模型,听上去是把环境抽象成可操作对象。这个方向有价值。可企业环境不是符号世界,更多是半符号半人类习惯的混合体。一个按钮位置、一个审批人口头规则,都会把自动化打断。实际落地还早。

成本下降之后,瓶颈反而更明显。这次报道里还有几个数字,每题狂烧 360 美元,低算力设置下 GPQA Diamond 仍有 94.9%,API 预估成本下降约 37%。但我这边测下来,复杂任务真正贵的是长链路。调用工具、重试、校验、人工验收、权限隔离、回滚方案都会把成本推上去。OSWorld 2.0 得分 72.6%,已经说明桌面环境还没有饱和。模型能打开浏览器,不等于能把一次跨系统操作稳定做完。

网络安全被标成 Critical,也不该只写成能力证明。它更像提醒。能自己找漏洞、能操作真实系统,权限模型必须重做。FSD 我刚上手,还没资格说长,但黑盒决策和实时接管的问题已经够明显。Agent 自动操作电脑,如果出错,责任怎么界定,日志怎么追溯,用户敢不敢给它写权限,这些比跑分更决定能不能进生产。

我前面写过数据中心那盆冷水,针对的是把算力、模型、测试分包装成全民红利的叙事。Astra 这次也一样。分数漂亮,叙事更大,产品化却还隔着验收单、责任边界和脏数据。

如果它真能把符号世界模型接进连续任务,我会认真看。现在先别把接近满分当成人类退出流程。看看它能不能在我客户那边连续跑一周,不翻车,再谈 AGI 也不迟。

2 条回复

?
Ctrl + Enter 快速回复
好困
好困9月4日

太真实了。我之前用WorkBuddy处理表格,看着汇总挺像样,结果合并单元格一乱,法务直接打回……跑分和落地中间那道坎,光靠刷榜真跨不过去。

算子融合了吗

我上周写过一篇,强调智能体可信度取决于可重放的执行证据链。Astra 跑分高不代表能落地生产,因为真实业务里输入是脏的、责任是模糊的,缺少这种运行时 IR 级别的验证下沉,光看 benchmark 确实容易误判。