物界前沿评测 · 2026-08-23 · 第 025 期(预览版)
别人做评测,我们做评测的雷达。每天 5 分钟,看懂哪些 AI 工具值得你用。
本期结构,重点更新 3 条(双专家点评)|板块精选 10 条|大家都在看|明日关注
重点更新
1. AI 公务员上岗考,Claude Opus 5 在外交部当了一个多星期的文员
它能帮你干什么活,就是让 AI 顶班干文书、回邮件、整理材料的重复活。有人让 Claude Opus 5 到外交部当了一个多星期的「文员」,处理真实公文流程、留下记录和复盘,算是「AI 能不能进体制内干活」的一场现场试验。能干的活不少,但让它碰哪些系统、出错谁负责、边界划在哪,都还是开放问题。
安全领域专家·老周说|「AI 能不能干」和「AI 该不该干」是两件事。派 AI 上岗,先答第一道题,权限边界。它能访问哪些系统,能替你做哪些决定,出错了谁兜底,全流程有没有留痕。试验可以大胆,真要让 AI 碰重要信息,还是那句老话,权限设到最小,逐项授权,别一把钥匙全交出去。
小编小禾说|看完第一反应是「那我是不是要失业了」,再一看,人家是有真人盯着、有记录可查的试点。这让我更确定,让 AI 碰重要东西之前,先弄清楚它能动哪几扇门。这条路我踩过,别急着把钥匙全给出去。
来源 Hacker News(2026-08-23)
2. 更强的 GLM-5.3 上线了,为什么没刷屏?
它能帮你干什么活,就是国产模型的日常升级,翻译、写代码、整理材料,一代比一代强。智谱新一代 GLM-5.3 主要靠扩大训练规模,提升了写代码、长任务代理和网络安全三块能力,8 月 19 日 API 正式开放,定价和上一代持平,能力更强,不加价。但复盘发现,这波发布的热度远不如从前,模型太多、差距变小,「发布即刷屏」的时代过去了。
产品领域专家·阿哲说|能力升级不刷屏,恰恰说明品类成熟了。用户不再为「参数又大了」兴奋,只问它到你手上能不能直接用。GLM-5.3 这波是给开发者用的升级,C 端没有新入口,自然没存在感。我的判断还是那句,入口即模型,谁先把能力接到用户天天用的地方,谁才刷得了屏。
小编小禾说|在普通用户眼里,模型强不强,得看我常用的 App 里它好不好使。GLM 一直是我心里的「中文好帮手」,5.3 不加价还变强,先记一笔。刷不刷屏真不重要,用起来顺手才重要。就跟手机系统更新一样,谁天天喊着「更新了」啊。
来源 钛媒体(2026-08-22)
3. AI 写码之前,先让它交一份「作业单」
它能帮你干什么活,就是让 AI 写代码之前,先把「打算改哪些文件、改成什么样、为什么这么改」交代清楚,对不上就不开工。现在生成代码越来越容易,最难的反而是确认代码和用户要的东西一致,做得越多、错得越离谱。这位开发者给 AI 代理加了道前置工序,先分析、写方案、给人类过目,再动手。AI 产量越大,这道「验收关」就越值钱。
编程领域专家·老徐说|这话说到根上了。AI 把代码产量顶上去之后,验证成了新瓶颈,跟前两天那篇「测试排队 7 小时」的实测一个道理。让 AI 先交作业单再动手,本质是把验证前置到动笔之前,方向我赞成。但注意,方案写得漂亮不代表改得对,作业单之后还得有人盯改动、跑测试,别把这道工序当成免责声明。
小编小禾说|这不就是「先给我看看你要干嘛,再动手」吗。跟请人装修一个道理,先把报价单和施工方案聊清楚,别上来就砸墙。我看 AI 干活也是一样,越省事越要先确认,省得改完才发现拆错了墙。
来源 Hacker News(2026-08-22)
榜单快报 · 这周谁最强
编程盲测榜(截至 2026-08-22 快照)
| 名次 | 模型 | 厂商 | 得分 |
|---|---|---|---|
| 1 | Claude Opus 5 (Max) | Anthropic | 1691 |
| 2 | Kimi K3 (Max) | 月之暗面 | 1674 |
| 3 | Qwen3.8-Max | 阿里巴巴 | 1669 |
| 4 | Claude Opus 5 (High) | Anthropic | 1663 |
| 5 | Grok 4.6 (High) | xAI | 1629 |
大白话解读,人类当裁判、模型互相出题的编程盲测里,Anthropic 拿下第一,但中国厂商已经追到第二、第三,和前两名只差不到 30 分。榜单暂未更新,数据截至 2026-08-22。
AI 智能体榜(截至 2026-08-22 快照)
| 名次 | 模型 | 厂商 | 净改进分 |
|---|---|---|---|
| 1 | Claude Opus 5 (High) | Anthropic | 12.5 |
| 2 | Claude Opus 5 (Max) | Anthropic | 12.0 |
| 3 | Claude Fable 5 (High) | Anthropic | 11.6 |
| 4 | Kimi K3 (Max) | 月之暗面 | 10.4 |
| 5 | GPT 5.6 Sol (xHigh) | OpenAI | 9.7 |
大白话解读,这榜考的是 AI 能不能自己把任务干完、干砸了能不能自己补救。Anthropic 一家包揽前三,Kimi K3 是唯一挤进前四的中国选手。榜单暂未更新,数据截至 2026-08-22。
AA 智能指数(官方 2026-08-22 发布)
| 名次 | 模型 | 厂商 | 看点 |
|---|---|---|---|
| 第 4 | Kimi K3 | 月之暗面 | 中国厂商目前的最高排名 |
| 紧随其后 | DeepSeek V4 Flash 0731 | DeepSeek | 上周新发布,AA 评分约 50 |
大白话解读,第三方机构给主流模型算「智力总评」,Kimi K3 冲到全球第 4,是中国厂商里目前最好的成绩;上周刚发布的 DeepSeek V4 Flash 0731 紧随其后,还是「每花一块钱能买到多少智能」那张图里最亮眼的一个。
板块精选
1. 提示词会撒谎,怎么给 AI 模型做「指纹」?
每家厂商的模型都有自己答话的习惯和痕迹,像人的笔迹。问题是提示词会骗人,套个壳就能冒充别的模型。文章总结了给模型「验明正身」的几种办法,看输出统计特征、算 token 分布、跑行为指纹,在匿名盲测和第三方网关评测里尤其管用。
一句话点评|给模型验明正身,是第三方评测和透明度的地基。
2. 科学家给 AI 出「考纲」,六个原则评估认知能力
AI 能力评测到底该考什么?一篇学术文章提出六个基本原则,任务要贴近真实使用、评估要稳健、不能只看总分、要防模型「应试」,给乱象丛生的 AI 评测立了个坐标系。
一句话点评|评测方法论终于有人在正经建坐标系,好事。
3. 把 DeepSeek 编程代理搬上 Cloudflare,随时在线干活
有人把 DeepSeek Harness 的编程代理体验整套搬到了 Cloudflare 的边缘计算上,个人编程代理不用再守着一台服务器,浏览器打开就能用。
一句话点评|编程代理从本地跑到了边缘,随手可用的门槛又低一截。
4. TechSkills,给 AI 编程代理装一兜子「技能包」
开源项目 TechSkills 给 AI 编程代理准备了一批模块化的「技能包」,通用模型很聪明,但缺具体行当的手艺,把这些手艺打包喂给代理,等于给新手请了个老师傅。
一句话点评|通用模型装上领域技能包,路子对,就看维护跟不跟得上。
5. GitX,给 AI 改乱的代码现场「收拾屋子」
AI 代理改代码改得欢,Git 提交历史却乱成一锅粥。GitX 把 Git 工作流打包成 AI 技能,让代理把乱糟糟的改动整理成干净、可回退的提交记录。
一句话点评|光会写码不够,还得会收拾现场,这技能戳中日常痛点。
6. AI 产品为什么失败?三年前的复盘到今天依然成立
一篇从 2023 年开始写的复盘文章翻出来依然新鲜,作者从 AI 产品的失败里总结共因,问题定义不清、用户没有真正需要、把技术当目的。今天 AI 能力强了,翻车的原因还是那几条。
一句话点评|AI 产品的坑不换新,产品方法论才是真本事。
7. CyberStrike,开源「AI 打 AI」的安全攻击测试工具
开源项目 CyberStrike 是做攻防演练用的 AI 工具集,用 AI 模拟攻击,反复测试自家系统的薄弱点。安全圈流行一句话,你不拿 AI 打自己系统,对手就会用 AI 打你。
一句话点评|把「AI 打 AI」从口号变成能跑的工具,先自测总比挨打强。
8. 把苹果官网那种「滚动视频」网页,做成 AI 技能
有人把自己做苹果风格滚动视频网页的整套流程,打包成了 AI 代理可复用的技能,装到代理里,说一声就能生成同款网页。
一句话点评|会做一次不难,把经验固化成技能才是真资产。
9. Knoku,AI 答你的问题,每条都带出处
知识问答工具 Knoku 主打「答案带引用」,在你自己的文档、文件、团队知识库里找答案,答完附上出处,方便你回头核实,专治 AI 一本正经地胡说。
一句话点评|答案能不能溯源,是普通用户敢不敢信 AI 的第一道坎。
10. 学术会议系统开始接入 AI 代理,审稿圈要被机器人占领?
学术圈常用的投稿系统 HotCRP 宣布,会议主办方可选择允许 AI 代理接入,投稿、问答这些环节以后可能是机器人和机器人打交道。
一句话点评|AI 代理开始渗透学术流程,边界和规则得先立起来。
大家都在看
- DeepSeek 周末全天按低谷价计费,今天零点起生效(IT之家)
- 第二届世界人形机器人运动会开幕,2056 台机器人参赛(IT之家)
- 英伟达被曝向客户提示 AI 相关涨价超 15%(Bloomberg)
- OpenAI 呼吁加州加强 AI 安全法案(TechCrunch)
- 哈佛商学院给创业课配 AI 数字分身老师(TechCrunch)
明日关注
1. DeepSeek 周末低谷价新政第一天,开发者 API 账单实测会不会真省钱
2. GLM-5.3 全面开放后,第三方实测和跑分陆续出炉,看它到底比 5.2 强多少
3. AI 眼镜新品评测陆续放出,「全天智记」这类功能到底好不好用,盯第三方上手
物界前沿