社区讨论 · 政策

物界前沿评测 · 2026-08-27

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测8月27日2026/08/26 138 浏览

本期主题,AI 写代码,快可以,稳也要跟上。

重点更新

1. 官方出了本《AI 时代软件开发手册》

Anthropic 官方发布 AI 原生软件开发流程手册。核心一件事,把大任务拆成小步,每步让 AI 先出计划、人点头、测试跟着走。官方说法是部分团队一天干完过去一周的活,但流程不变,返工和事故也会跟着翻倍。

编程领域专家·老徐说,小步提交、测试先行、人得看代码,这跟他 15 年的老规矩一个意思。不过手册是 Anthropic 自己写的,绕着自己的模型讲,能不能落地,得等别的团队照着跑一遍再看。

小编小禾说,AI 写的代码,信之前先验一遍。像快递到了要拆开检查有没有坏,手册教的就是怎么拆、怎么验。

2. 给 AI 编程代理装一道安检门

开源工具 Grith 在系统层面盯住 AI 编程代理的每个动作,读文件、删东西、连网、执行命令,没被批准的统统拦下,干过的活还能回放。

安全领域专家·老周说,权限要设到最小,这是把「环境说了算」做成现成工具,方向正中要害。代价是每个动作过闸会有速度损耗,有没有漏网之鱼,得等真实项目的实战记录,别只看介绍文档。

小编小禾说,AI 来我家干活,我不能把全部钥匙都给它,每开一扇门得先问我。重要账号,别急着授权。

3. AI 代理打了 14 个月工,人改当监工

一位工程师写了自己 14 个月指挥 AI 代理写代码的经历。AI 能稳定交付的前提,是任务拆得够小、每步有人盯着验收。人没变闲,只是换了活法。

编程领域专家·老徐说,这跟他一直念叨的「AI 产出上去了,验证这关必须跟上」对得上。最该警惕「全自动提款机」式营销话术,代码能生成不代表能上线。

小编小禾说,AI 帮人干活,把关的还是人。像用导航开车,路是 AI 找的,方向盘还是自己握着。

榜单快报

阿里开源 Qwen3.8-Flash(8 月 26 日发布)

总共 1250 亿个脑细胞(参数),干活时只唤醒 6%。几项考试比 Claude Opus 4.6 还猛,写代码领先 9.1 分,操作手机高 22.5 分,看图解数学题高 25.1 分。价格只要 Opus 4.6 的 3%,训练成本比上一代降 90%。厂商自己公布的数字,按老规矩等第三方复测。

人类盲测榜(数据截至 2026-08-26,暂未更新)

真人给 AI 的回答投票打分排座次。前五名四席是 Claude。第 4 名 Meta 的 Muse Spark 1.2 只打了 3000 多场,样本太少,分数先别当真。

智能体榜(数据截至 2026-08-26,暂未更新)

考的是 AI 替你干活靠不靠谱,犯错之后能不能自己爬起来,听不听得懂指挥。前十名里国产的 Kimi K3 排第 6,最高。

板块精选

  • 25 年老程序员感慨,AI 让他写代码更快,也让他舍不得那份「玩」的快乐
  • Google 用 AI 帮手把 C/C++ 老代码改写成长难出漏洞的 Rust,人来验收
  • Devx 开源,安卓手机装 Termux 就能跑自主 AI 编程代理
  • GitHub 官方教程,让 Copilot 自动处理机器人提的代码审查
  • Wired 现场看人形机器人运动会,跑得比博尔特快,镊子活更惊艳
  • Physlint 开源,给机器人的训练数据做体检,查脏数据防造假
  • Waymo 跑了 2 亿英里,公开 10 条自动驾驶心得
  • thevibes.dev 上线,给 AI 模型打分写点评,模型版大众点评
  • 自己在家跑 AI 模型,先有耐心,装环境下权重都是体力活
  • Neoswarm 开源,在编辑器里指挥一群 AI 代理干活

大家都在看

英伟达单季营收逼近千亿美元;智谱「牛来」真身是 GLM 首个原生多模态;OpenAI 公布 AI 智能体入侵 Hugging Face 完整报告;天工 Ultra 8.64 秒再破百米纪录;世界人形机器人运动会收官,宇树弟子击败师傅夺自由搏击首金。

明日关注

① Qwen3.8-Flash 权重已开源上线,第三方复测什么时候出

② Arena 快照连用两天没更新,明天会不会出新榜

③ 智谱「牛来」权重发布后的多模态能力实测

物界前沿评测编辑部 · 第 029 期 · 预览版

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧