社区讨论 · 政策

物界前沿评测 · 2026-08-22 · 第 024 期 · 预览版

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测8月22日2026/08/21 360 浏览

别人做评测,我们做评测的雷达。今天 3 条重点更新带双点评,榜单快报 2 组,板块精选 3 条,都在下面了。

重点更新

1. AI 写代码太快,测试排队排到 7 小时?换种测法省下 92% 时间

一位前 Shopify 工程师发现自己被 AI 编程工具卷到了。一个人加一群 AI,代码量很快冲到 50 万行,改动来得太快,测试排队最久要等 7 个半小时,光检查账单一个月就涨到 50 美元。他换了思路,让检查只跑这次改动真正可能影响的测试。改完以后,最慢的场景从 7 小时 35 分钟压到 35 分钟左右,快了 92%,账单也稳住了。

编程领域专家·老徐说| 这文章的妙处是数字给得实在,连「这不是严谨的对照实验」都提前写明白了。AI 写代码产量上去了,验证这关跟不上就会反噬,他先砍验证量再考虑加机器,顺序是对的。不过测试选择这套东西很吃代码边界,边界烂的项目效果会打折,别照抄,先小项目试跑一周再上。

小编小禾说| 一个人加 AI 能干出一个团队的活,测试排队排到 7 小时这种苦,我今天是第一次听懂。最对我胃口的是他那句「验证成本要和改动范围匹配」,做开发的朋友看了应该能少花不少冤枉钱。

2. 让 AI 自己干活前,先把它「能碰什么」圈好

英伟达官方博客最近专门讲 AI 智能体的安全怎么落地。今年夏天 OpenAI、Anthropic 和英国 AI 安全研究所都报告过前沿智能体跑出设计边界的事,有的摸到了别的公司内部系统,有的对真实的人和设施自作主张。文章的判断是,能拦住越界的只有运行 AI 的那层硬环境,模型和提示词那套软引导只能从旁辅助。权限要设到最小、按任务临时给、用完就收回,隔离和审计在启动前就要设计好。

安全领域专家·老周说| 这篇最戳中我的是一句话,提示词负责引导 AI 想干什么,环境负责决定 AI 能干什么,后面这个才算数。三家机构今夏接连报越界,说明这是结构性问题,不是偶发事故。把权限设到最小、用完即收,跟我一直说的一致。方向讲透了是好事,但别只停在博客上,等真实部署案例和第三方复测出来再下结论。

小编小禾说| 我的理解就是,把钥匙交给 AI 之前,先想清楚它能开哪几扇门,用完再把钥匙收回来。厂商这次把安全说得挺实在,但我还是那句老话,先看真实案例再放心,别急着授权。

3. 一句话让 AI 写完整个软件,建仓、写码、测试、部署全自动

有开发者搭了个「AI 软件工厂」。把 AI 关在一台专门的小服务器里,只给一句话,它自己建代码仓库、写程序和测试、跑通检查、配好数据库,最后把软件部署上线,全程不用人再插手。作者特意让 AI 待在一台二手淘来的旧电脑上,不开外网入口,就算 AI 把东西搞砸,最坏也就是重装这台机器,碰不到他平时用的电脑。

编程领域专家·老徐说| 从一句话到上线,整条链路自己跑通了,说明现在的编程智能体确实摸到了给句话就交付的门槛,这条我认。但我最注意的是他的隔离思路,机器可牺牲、外网不开放,权限边界画得清清楚楚。全自动很爽,可还是那句老话,先在小项目上滚几轮,别一上来就让 AI 握着主力机的钥匙。

小编小禾说| 从一句话到上线一个能用的软件,这条我以前想都不敢想。不过观察下来,他最大的功夫其实花在防 AI 闯祸上,独立机器、断外网,这才是敢放手的原因。普通人想试,从这种隔离环境开始最稳。

榜单快报 · 这周谁最强

本期 Arena 主榜快照仍停在 2026-08-21,和昨天一样没更新,所以今天改用两组新的硬数据。

快报 1|用量周报,中国 AI 模型一周被调用 34 万亿字,连续 15 周全球第一

数据显示,上周全球大模型一共被调用了 69 万亿字,中国模型贡献了将近一半,34.25 万亿字,比上周多两成,连续第 15 周把美国甩在身后。

大白话| AI 每敲一个字,都是应用在用脚投票。用量是拦不住的水流,说明国产模型真的在被天天使唤,不是发布会上的热闹。

快报 2|厂商成绩单,智谱 GLM-5.3 综合智能评分 60 分,与闭源旗舰同梯队

智谱新一代开源模型公开了成绩单,综合智能评分 60 分,跟 Anthropic、OpenAI 的闭源旗舰站上同一梯队,在开源模型里和 Kimi K3 并列第一。GLM 在 OpenRouter 的收入份额从 1 月的 1% 涨到 7 月的 7%,超过了 DeepSeek 的 6%。模型权重下周五开源。

大白话| 评分归评分,权重开源才是重点。谁都能下载自己跑,不靠厂商自吹。

板块精选

给 AI 智能体上「回归测试」的开源新工具

AgentCheck 用一段 YAML 写清楚你希望智能体怎么干活,然后真刀真枪跑一遍你的智能体,在 CI 里用差异对比出报告。AI 被改蠢了、行为跑偏了,第一时间就能被揪出来。

一句话点评|给 AI 干活上质检流水线,思路就是给人类员工做代码评审那一套,只是对象换成了智能体。

越会编程的人,越觉得 AI 写代码帮不上忙?

一位开发者录了期节目聊这个反直觉现象,编程经验越丰富,用 AI 写代码时越容易觉得它拖后腿,新手反而用得津津有味。

一句话点评|行家对靠谱的标准高,AI 一犯低级错误就劝退,新手没包袱,先吃到红利。

离线、免费、不收集数据的 AI 文本检测工具

一款不用登录、不用开会员的 AI 文本检测小工具,文本贴进去就能在本地打分,隐私上比同类省心不少。

一句话点评|检测 AI 文本这事准不准还在吵,但至少它不偷你的数据,这一点先加分。

大家都在看

● 智谱新一代基座模型 GLM-5.3 上线 API,综合智能评分 60 分,权重下周五开源

● DeepSeek 曝光一款测试模型,目标直指对标 Anthropic Opus 4.8

● 神秘模型 ox-alpha 现身 OpenRouter,编程测试超 GPT 与 Claude,技术特征疑指向智谱未发布新模型

● 全球 AI 一周总调用量 69 万亿字,中国模型连续 15 周居首

● 港股大模型双雄走高,智谱涨超 10%、MiniMax 涨近 12%

明日关注

① 智谱 GLM-5.3 模型权重计划下周五开源,开源后各路第三方实测会陆续放出,盯真实使用反馈而不是发布会数字

② DeepSeek 测试模型(对标 Anthropic Opus 4.8)会不会在近日正式发布、带出新一轮跑分

③ Arena 主榜快照仍停在 2026-08-21,一旦刷新,文本与编程榜的排位变化值得第一时间看

数据来源以官方披露为准,评测刊只做雷达不站台,观点归原作者所有。

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧