Astra 的跑分变了,我的日志没变
我花了两天试 GPT-6 Astra 的评测页和 API。我用 OpenAI 接口一个月,Astra 刚发布这两天试的。我做计算机视觉,带研究生,最烦发布时讲漂亮,过两天数字又变。OpenAI 被报道多次修改 Astra 基准测试数据,Astra 内部幻觉率曾从 4.2% 下调到 2%,随后又恢复。看到这个,我没先骂,先把它当实验对象,按流程走了一遍。
基准测试是一组固定任务、固定输入、固定评分规则的实验。从 ImageNet 到 HELM(Liang et al., 2022),榜单推动进步,也制造刷榜动机。ARC-AGI 考抽象推理,幻觉率指编造事实,对齐指按人类目标行事。这些指标本身有道理,但外部仍需要可验证材料。
我先在本地建目录,把提示词、输入、返回、时间戳存成 JSON。再固定评分口径,不让模型自己判自己。最后拿组里一个视觉标注小工具做样本,让模型从飞书导出的需求说明里抽字段。任务不惊艳,但足够脏,能测结构化抽取。
打开 Astra 评测页,视觉风格像论文表格,指标分类清楚,页面上有短解释。但我注意到一个麻烦,页面只显示当前版本,看不到修改历史。科学实验至少要有版本号和日志,否则没法证明同一件事。
我调用 API 跑了几个小任务。整理杂乱文本确实快。学生从标注群里复制十几种“遮挡、部分遮挡、看不清”,模型能统一成三级标签,还给出映射表。我把它当资料员用,不当法官用,体验就顺。卡住也明显。我试着让模型分析一段网络安全样例,标准版直接停止任务,没有暂停等待审批。这个设计能理解,但反馈太硬,返回里只说被停止,没告诉我哪条规则触发。做研究的人最讨厌这种黑箱,因为无法复现。
我这边还遇到一个更现实的坑,同一个提示词,隔半小时跑,语气和输出结构会漂。大模型本质上是概率生成。幻觉率从 4.2% 变 2% 再回 4.2%,我没法判断是评测集变了、评分脚本变了,还是筛选方式变了。Anthropic 的 Fable 5.1 数学成绩也被调低近 10 个百分点。没有公开可复现脚本,外界就只能看它给什么。
它整理非结构化文本省事,页面解释友好,适合数据清洗、需求抽取、代码辅助。麻烦在评测页历史不可见,安全触发原因不透明,官方数字变动削弱可信度,跨模型对比也不透明。
我的结论是看情况。适合科研组、小团队、企业资料员,把 Astra 当助手,前提是有自己的评测集。不适合把它当证据链,也不适合采购方只看官方跑分。之前我写 AI 回答进法庭,现在更明确,模型可以进流程,评测数据不能直接进证据链。可追溯的日志和可复现的实验比跑分页面更可靠。
物界前沿