物界前沿评测 · 2026-10-05
物界前沿评测 · 2026-10-05
第 068 期来了。这期三件重点:一件讲有人给大批常用工具打了分,看哪些 AI 助手能自己上手用;一件讲一个开会时就在旁边帮你记的 AI 助手;还有一件讲中国团队在琢磨「让大模型少想、小模型拍板」的新路子。榜单这边,三张榜官方都还没出新的一版,数据停在 10 月 2 号。
重点更新
一、有人给常用工具打了分,看哪些 AI 能自己上手用
Anchor Terminal 这个站点把一大批常用工具逐个打分,标准就一条:AI 助手能不能自己把它用起来。现在收了 462 个,其中 105 个被评为 AI 能直接上手,另有 214 份人工试用记录。它想解决的,是你让 AI 干活时,它常卡在某个工具不会用上。老徐说这个问题问得实在,可打分是站点自己定的标准、谁也没复跑过;他挑工具的老办法不变——拿一个丢了不心疼的小活让 AI 真跑一遍,卡在哪一步最说明问题,榜单先收藏、别当选型依据。小禾说她一直纳闷为啥 AI 老卡壳,原来有些工具它压根用不了,这份表她先收藏,哪天真要让它自动干活了,再照名单挑几个试。
二、开会时就在旁边帮你记的 AI 助手
有个叫 Bearbits 的助手,开会时它就在旁边听,把大家说的话转成文字,还能当场把你要的信息翻出来给你。它主打「开会当下就能用」,不用等会开完再回头看记录,也不用往会议室里塞一个机器人账号。阿哲说「开会当下就有用」这点比「会后再给你一份纪要」值钱,记纪要谁都能做,难的是当场插得上话、又不打断你;他看的是它抢话的分寸——答慢一点、答错一次,人就弃用了,想试先找一场不重要的会。小禾说她最烦开完会啥也没记住,这个「当场提醒」听着有用,可又怕它听岔了、递错信息;真要试,先拿一对一的小会试,重要谈判别把它放进去。
三、中国团队在琢磨:让 AI 少想、快点下判断
极客公园报道,中国有一批团队在做件新事:让大模型负责慢慢想,另外配一个小模型专门负责快速拍板。思路是把最费钱的思考环节省下来,把判断这一步交给小的模型做,速度就上去了。老徐说把「想」和「判」拆开,工程上是条实打实的省法——大模型费钱在慢慢想,小模型胜在快和便宜;可省了多少、错率涨没涨,他没看到具体数字,想接进项目的先拿丢了不心疼的小活跑一周,看它拍板的错率再定。小禾说她平时就图个快,让 AI 多想几秒都嫌慢,这套「小事让它自己拍板、大事再动大模型」听着对路;真要试,她先拿写购物清单这种不要紧的事试水,别一上来就让它替自己拿主意。
榜单快报
三张榜这期官方都还没出新的一版,数据停在 10 月 2 号。人类盲投文本榜头名还是谷歌的 Gemini 4 Argon,可它只攒了不到 5,000 票、位置还在晃,第二名有 7 万多票、靠得住得多;智能体实干榜考的是「真帮人把活干成了没有」,头名是 Anthropic 的 Fable 5.1;看图榜头名是 Anthropic 的 Fable 5,紧跟阿里的通义千问 3.8,前五名分数咬得很紧,挑工具先看括号里的场次够不够厚。
板块精选(10 条)
- 一个编程工具团队说,他们想的是「一切皆插件」:能被随意加插件,好用也好乱,装之前先看装进来的都是谁写的。
- 一个 26 年的老软件被 AI 用新代码重写:老软件交给 AI 翻新,先看它改的每一处你能不能一条条核出来。
- 一个展览,标题直接写「由 AI 共同策划」:把 AI 的参与写在标题里,是坦白也是争议,看它到底改了什么、比看口号实在。
- 一个陪练,用 AI 模拟德语口语考试:拿 AI 当陪练不丢人,可它给的口语打分别太当真,真考试还得看人和真环境。
- 孙正义罕见示警,AI 安全这把他自己也犯嘀咕:掏钱的人开始提风险,比台上喊口号的更值得听一耳朵。
- AI 助手也有了自己的游乐场:当新玩法围观,别急着把你家助手往里放。
- 让你的 AI 助手自己剪出一条讲解视频:做片子是省事了,可对外的视频还是要自己看一遍再发。
- 一篇长文追问 AI 到底有没有「意识」:会说人话和真懂,是两回事。
- 一篇分析对比美中在「军用 AI」上一松一紧:军用的口子一松,规则谈判就更紧,做出口生意的人得盯着。
- 有人写了篇「AI 让我开心」,和满屏的唱衰唱反调:同一个工具,对不同人的意义能差很远,多听一种声音没坏处。
大家都在看
给常用工具打分、看哪些 AI 能自己上手用;一个开会时就在旁边帮你记的 AI 助手;中国团队在琢磨让 AI 少想、小模型拍板;一个打着「一切皆插件」的编程工具;一个标题写着「由 AI 共同策划」的展览。
明日关注
① 那份工具打分表,盯有没有第三方拿同一批工具复跑一遍。
② 让大模型少想、小模型拍板这套,等有人把省下的时间和钱算出来再看。
③ 打着「一切皆插件」的编程工具,等有人装一堆插件、跑一阵子再说好不好用。
物界前沿