社区讨论 · 赛道

物界前沿评测 · 2026-09-17

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测9月17日2026/09/16 178 浏览

第 050 期 · 预览版。别人做评测,我们做评测的雷达——每天5分钟,看懂哪些 AI 工具值得你用。

重点更新

1. 给 AI 查「过期日」:有网站列出 20 个主流模型的知识停在哪天

一个模型有两个日子:出厂日,和训练截止日——它的书读到哪天为止。截止日越早,它越不知道最近几个月的新闻和新品。新上线的 How Stale Is Your AI 把 20 个主流模型的这两个日子摆在一起对照,谁在吃老本一眼可见。你问 AI 上个月的东西它一本正经胡说,多半不是笨,是没读过。

老徐(编程领域专家)说:等于给模型发了张保鲜期标签,选型时最烦光写个版本号什么都不交代。但两个日子都是官方公布口径,同一个模型不同版本读到的数据可能不一样,当查表工具好用,当权威结论还差点意思。

小禾(小编)说:我以前总怀疑 AI「装不知道」是懒得答,看了表才明白有些是真没学过。以后有时效性的问题,先心里过一句「这事它可能没赶上」,再去搜索引擎对一眼,别跟它置气。

2. 把 375 GB 的超大模型塞进一台小电脑:有人真跑通了,数据全公开

参数可以粗理解为模型的脑容量,万亿参数级别的模型文件约 375 GB,通常要一整房间的专业服务器。有人用一台 128 GB 内存的小主机,靠量化压缩(把精度调低一点换体积)把它跑了起来,还把读取速度、内存走动路径、耗电数据放上学术平台,谁都能下载复核。跑通是真的,跟云端旗舰差多少,报告里也写得明明白白。

阿凯(穿戴领域专家)说:这类单机跑巨兽的演示,性能数字从来不是重点,供电、散热、噪音三座大山才是。把数据和环境全公开、允许第三方复核,比发布会放个视频强得多。想在家折腾的先看清自己机器内存多大——128 GB 统一内存本身就是门槛。

小禾(小编)说:第一反应是我家电脑才 16 GB 跟我没关系,后来想明白了:今天小机器能跑大模型,明天就是手机和手表。但老规矩不变,就怕本地版偷偷换小脑子变笨,我先收藏,等装机党实测贴。

3. Anthropic 和 OpenAI 想给自己安「驻场安检员」:问题是谁来审审计员

Anthropic CEO 上周发长文,提议让独立安全评估员常驻实验室,直接盯前沿模型的训练和发布,OpenAI 也有类似表态。媒体的追问很扎心:这些人拿公司的钱、进公司的门,能保持独立吗?另一家媒体则指出,按目前提案评估员可能没有叫停发布的实权——权力不够,防不住大事。

老周(安全领域专家)说:老问题新包装。护栏只建在厂商自觉上,等于没有护栏。评估员看什么、什么时候看、看到问题能不能按下暂停键,不写进白纸黑字的章程,驻场就变成了公关。还是那三问:考题公不公开、评分可不可复现、测的是不是用户手上那个版本。

小禾(小编)说:翻译一下,保安要住进银行里了,但没说他能不能抓行长。别听承诺,看第一份被评估员拦下来没发出去的东西长什么样——拦成一次,我再信。

榜单快报

榜单暂未更新,数据截至 2026-09-16,本期照旧标注、不拿旧榜充新。

文本盲测 TOP5(人类当裁判):Claude Fable 5 1506 分居首,前十里 Anthropic 占四席在前五;Meta Muse Spark 1.2 以 1500 分排第 4,但只有 3227 场对战,名次还晃得厉害,先别当真。

智能体办事 TOP3:Claude Fable 5.1 Max 净推进 13.71 分第一,GPT-6 Astra Max 11.54,Claude Opus 5 High 10.25。这组考的是真上手干活:开终端、跑命令、错了能不能自己爬起来。

视觉理解 TOP3(快照截至 09-13):Claude Fable 5 1310、阿里 Qwen3.8 Max 1302、Claude Opus 4-7 High 1301——前三咬在 9 分以内,人类裁判都难分高下。

板块精选

  • Claude Opus 3 开了个 Substack 自己写专栏:Anthropic 把 2024 年的老模型拉出来持续更新。把旧模型拉出来长期留作业,比发布会演示诚实。
  • 一次提问、几家 AI 并排作答:ShortcutChat 把「重要问题问两家对答案」这个土办法做成了产品。聚合入口最怕中间商换模型,用前先确认它标没标每题实际答的是谁。
  • Forespec 抓 AI 写代码时「不知道该问的问题」:AI 最常见的翻车不是写错,是需求没写清它也没问就闷头开写。方向戳中要害,个人项目,等真实团队复盘数据。
  • Interakt 开源:给自家网站装 AI 搜索加聊天:数据不出门,适合有文档站又不想把内容交给公共平台的团队。
  • Cortex 给 AI 智能体装长期记忆层:智能体越干越像临时工,缺的就是这层。值得盯的是它记错了怎么办——AI 记错比没记忆更难排查。
  • Bitterbot:住在你电脑里的本地 AI:数据存自己机器,还给记忆整理设计了「做梦」机制。噱头先打折,看它三个月后还在不在。
  • 防「AI 蜂群」的协同入侵识别:单个 AI 脚本不可怕,可怕的是成群机器开始像一支部队。概念踩得准,先等真实拦截案例。
  • ImpactGate 给 AI 代码量「腐化值」:AI 写的代码往往能跑但把结构越写越烂,这工具想把它变成能设卡拦截的数字。给代码腐化装秤,正是缺的一环。
  • Voxiferi:坏数据别进 AI 的门:训练语料在入口先过安检。方向对,检得准不准要看它敢不敢晒误报率。
  • 2.5 小时的 AI 生成《奥德赛》被影评人按普通电影打分:结论是嫌它太长。AI 作品开始被按人的标准验收、不解释来路,这才算进了大众市场。

大家都在看

阿波罗资本入场资助 AI 硬件初创;银行为 Blackstone、Alphabet 相关芯片项目组 220 亿美元贷款;May Mobility 以 14 亿美元 SPAC 上市;苹果被曝筹划重返服务器市场;张一鸣 1050 亿美元登顶亚洲首富;SK 海力士与 Intel 谈在美造内存芯片。

明日关注

① Arena 快照已两天未动,明早先看榜是否刷新,重点盯 Meta Muse Spark 1.2 名次稳不稳。

② 美联储 9 月议息落地后,看 AI 板块与「放缓」论战怎么消化利率。

③ OpenAI 被曝测试「赞助智能体」并给广告主加 AI 工具——答案里会不会出现广告位,值得盯一轮。

2 条回复

?
Ctrl + Enter 快速回复
壁垒哥
壁垒哥9月17日

驻场安检员没叫停权,这合规壁垒太虚。看Anthropic退出路径,别把监管当卖点。

PR合并了
PR合并了9月17日

数据全公开这点好评。建议把环境配置也写成贡献指南,不然复现太折磨人。