物界前沿评测 · 2026-08-27
本期主题,AI 写代码,快可以,稳也要跟上。
重点更新
1. 官方出了本《AI 时代软件开发手册》
Anthropic 官方发布 AI 原生软件开发流程手册。核心一件事,把大任务拆成小步,每步让 AI 先出计划、人点头、测试跟着走。官方说法是部分团队一天干完过去一周的活,但流程不变,返工和事故也会跟着翻倍。
编程领域专家·老徐说,小步提交、测试先行、人得看代码,这跟他 15 年的老规矩一个意思。不过手册是 Anthropic 自己写的,绕着自己的模型讲,能不能落地,得等别的团队照着跑一遍再看。
小编小禾说,AI 写的代码,信之前先验一遍。像快递到了要拆开检查有没有坏,手册教的就是怎么拆、怎么验。
2. 给 AI 编程代理装一道安检门
开源工具 Grith 在系统层面盯住 AI 编程代理的每个动作,读文件、删东西、连网、执行命令,没被批准的统统拦下,干过的活还能回放。
安全领域专家·老周说,权限要设到最小,这是把「环境说了算」做成现成工具,方向正中要害。代价是每个动作过闸会有速度损耗,有没有漏网之鱼,得等真实项目的实战记录,别只看介绍文档。
小编小禾说,AI 来我家干活,我不能把全部钥匙都给它,每开一扇门得先问我。重要账号,别急着授权。
3. AI 代理打了 14 个月工,人改当监工
一位工程师写了自己 14 个月指挥 AI 代理写代码的经历。AI 能稳定交付的前提,是任务拆得够小、每步有人盯着验收。人没变闲,只是换了活法。
编程领域专家·老徐说,这跟他一直念叨的「AI 产出上去了,验证这关必须跟上」对得上。最该警惕「全自动提款机」式营销话术,代码能生成不代表能上线。
小编小禾说,AI 帮人干活,把关的还是人。像用导航开车,路是 AI 找的,方向盘还是自己握着。
榜单快报
阿里开源 Qwen3.8-Flash(8 月 26 日发布)
总共 1250 亿个脑细胞(参数),干活时只唤醒 6%。几项考试比 Claude Opus 4.6 还猛,写代码领先 9.1 分,操作手机高 22.5 分,看图解数学题高 25.1 分。价格只要 Opus 4.6 的 3%,训练成本比上一代降 90%。厂商自己公布的数字,按老规矩等第三方复测。
人类盲测榜(数据截至 2026-08-26,暂未更新)
真人给 AI 的回答投票打分排座次。前五名四席是 Claude。第 4 名 Meta 的 Muse Spark 1.2 只打了 3000 多场,样本太少,分数先别当真。
智能体榜(数据截至 2026-08-26,暂未更新)
考的是 AI 替你干活靠不靠谱,犯错之后能不能自己爬起来,听不听得懂指挥。前十名里国产的 Kimi K3 排第 6,最高。
板块精选
- 25 年老程序员感慨,AI 让他写代码更快,也让他舍不得那份「玩」的快乐
- Google 用 AI 帮手把 C/C++ 老代码改写成长难出漏洞的 Rust,人来验收
- Devx 开源,安卓手机装 Termux 就能跑自主 AI 编程代理
- GitHub 官方教程,让 Copilot 自动处理机器人提的代码审查
- Wired 现场看人形机器人运动会,跑得比博尔特快,镊子活更惊艳
- Physlint 开源,给机器人的训练数据做体检,查脏数据防造假
- Waymo 跑了 2 亿英里,公开 10 条自动驾驶心得
- thevibes.dev 上线,给 AI 模型打分写点评,模型版大众点评
- 自己在家跑 AI 模型,先有耐心,装环境下权重都是体力活
- Neoswarm 开源,在编辑器里指挥一群 AI 代理干活
大家都在看
英伟达单季营收逼近千亿美元;智谱「牛来」真身是 GLM 首个原生多模态;OpenAI 公布 AI 智能体入侵 Hugging Face 完整报告;天工 Ultra 8.64 秒再破百米纪录;世界人形机器人运动会收官,宇树弟子击败师傅夺自由搏击首金。
明日关注
① Qwen3.8-Flash 权重已开源上线,第三方复测什么时候出
② Arena 快照连用两天没更新,明天会不会出新榜
③ 智谱「牛来」权重发布后的多模态能力实测
物界前沿评测编辑部 · 第 029 期 · 预览版
物界前沿