物界前沿评测 · 2026-09-15
第 048 期 · 预览版。别人做评测,我们做评测的雷达——今天这期盯三件事:端侧 AI 有了第一张公开成绩单、「第三方安全评测」成了行业共识话题、扫地机开始进长测时代。
重点更新
1. 想在自己旧电脑上跑 AI?先看看这份「裸机 AI」成绩单
有人刚在 GitHub 搭了个「裸机 AI」榜:专门收录不靠大框架、用 C/C++/Rust 手写的超轻量 AI 引擎,宣传口径零依赖、亚毫秒级响应——让 AI 不靠显卡机房、直接在你手上设备里跑起来的那批「小钢炮」,第一次被拉到同一张考卷下排名,还附了速度和支持模型的基准索引。
老徐(编程):出题计分都是仓库主自己定的,宣传味很重;但端侧 AI 确实缺一张公开成绩单。选型别冲,先挑榜上最漂亮的两个拿自己的活跑一周。
小禾:小白只关心装起来麻烦吗、要不要买新硬件。先收藏不动手,等有人拿普通笔记本实测笨不笨。
2. AI 安不安全,凭什么让厂家自己说了算?
彭博昨天的节目专门讨论独立测试能不能让 AI 更安全。背景是这几天吵翻天的「放缓前沿」之争:Anthropic CEO 呼吁踩刹车,OpenAI、马斯克跟进,吵到最后大家不约而同指向同一个方向——与其信厂商自报成绩单,不如交给外部机构测。
老周(安全):独立测试方向对,但要盯三件事——考题公不公开、评分可不可复现、测的是不是你手上那个版本。测特供版的话,公信力和自报分数没区别。
小禾:以前运动员自己发奖牌,现在有人提议请外面的裁判。等哪天「安全体检报告」连着两期名次稳、原始数据能下载,再当挑工具的依据。
3. 扫地机也进「考卷时代」:Wired 长测石头 Qrevo 2,直呼平价机皇易主?
Wired 发了石头新款 Qrevo 2 的长测,标题直接问「新的平价扫地机之王?」。参数谁都会写,长测才见真章:避障、边角、基站洗拖布臭不臭,都是编辑在家实打实用出来的。
阿凯(硬件):吃灰第一原因是安装和充电顺不顺手,不是吸力参数。以后机皇之争得拿公开成绩说话——国内牵头的家用机器人 11 项测试标准刚立起来,单一媒体好评只算半场。
小禾:「平价机皇」先记账,等三个月以上的长用贴,那才是买家秀原版。
榜单快报
综合智能指数(Artificial Analysis 今晨现拉):Claude Fable 5.1 两个模式与 GPT-6 Astra 三家并列 53 分榜首,Claude Opus 5 以 51 分紧随。开源阵营换旗——智谱 GLM-5.3(45 分)首次压过月之暗面 Kimi K3(44 分)。速度最快 Celeris-1,每秒吐 1418 个字。
中文权威榜(SuperCLUE,9 月 11 日更新):DeepSeek 上周刚发的 V4.1-Flash 首进榜就冲到国产第二(71.81 分);GLM-5.3 从 63.27 大涨近 8 分跳到第 3。LMArena 全球公司榜上,智谱被 GLM-5.3 带着从第 6 升到第 5,挤下月之暗面。
会干活的 AI(数据截至 9 月 8-10 日):「AI 替你操作电脑」的 OSWorld 考试,中国团队实在 Agent 以 90.2% 登顶(第二名 Claude Fable 5 为 86.0%);医生考卷 HealthBench 上 Claude Fable 5 得 0.660 分、人类医生基线 0.437——考卷偏简单,别以为 AI 能看病;BenchAlign 综合榜前三还是 Claude Fable 5.1、GPT-6 Astra、Claude Opus 5。
说明:Arena 人类盲测榜快照仍是 9 月 14 日批次、与上期相同,榜单暂未更新,本期不作新变动引用。
板块精选
1. 把 AI 账单拆成「加载、思考、调度、出结果」四段算钱——分不清有效思考和 AI 整本翻书,就省不了钱。
2. arXiv 论文:AI 帮忙整理上万人的访谈文本,社会科学先卷起来,还讨论了怎么防 AI 归纳时夹带私货。
3. 不会写代码也能做软件:把需求和验收标准写成固定流程,AI 按流程产出、人只在节点检查,比聊天式碰运气靠谱。
4. 安全研究员演示一封邮件劫持客服 AI:把指令藏进邮件正文,AI 就分不清「客户来信」和「系统命令」。边界不清的老毛病,不是偶发。
5. AI 助手记性太好也是病:长期记忆会把过期结论当真理继续用,语气还笃定。给 AI 的记忆设保质期。
6. 安全公司预警:AI 量产「老板催款邮件」,语法生硬这个老破绽消失。催转账一律电话回拨本人核实。
7. 研究者公开 1325 个有 AI 辅助痕迹的 GitHub 代码库清单——AI 写的代码存活率研究第一次有了大样本底库。
8. Show HN 新玩具 Otis:装好就调本地模型干活,不接云不注册,「数据不出机器」是全部卖点。
9. Threshyr 1.2.1:断网可用的时间记录器,端侧 AI 把你一天归成「时间块」。这类常开后台的工具,先拿备用机试水两周。
10. ProGantt:把甘特图接上 AI(MCP 接口),AI 能看排期改任务。但 AI 改配置不留报错,合并前必看改动清单。
大家都在看
智谱公司榜升第 5 挤下月之暗面|Arena 文本榜前八 Anthropic 占六席(快照未更新)|DeepSeek V4.1-Flash 首进 SuperCLUE 即国产第二|开源分差咬到 3 分内,刷新随时换榜首
明日关注
① SuperCLUE、LMArena 下一批更新:GLM-5.3 第 3 名坐不坐得稳,新名次先记账不入场
② DeepSeek V4.1-Flash 的第三方复跑:官方说「推倒重来更快更准」,等独立考场重新考一遍再当真
③ Arena 快照若更新,盯 claude-fable-5.1-max(仅 5783 场对战、样本最薄)票数攒不攒得到置信
④ 开源榜三国杀:GLM-5.3、Kimi K3、GLM-5.3-Flash 分差 3 分内,任何刷新都可能换榜首
——完整榜单数据和双专家点评见今日评测刊页面。
物界前沿