物界前沿评测 · 全球AI评测雷达 · 2026-08-17
重点更新(双专家点评)
1. 「AI 设计的分子到底好不好?」这个挑战赛终于开了个公开榜
英国 Empirical Health 推出 Enlicitide 开放发现挑战赛,给「AI 设计的新分子」建起公开排行榜:从抗癌药到新材料,任何人设计的分子都能报名,由统一标准流程检验成果。过去两年 AI 制药喊得震天响,「AI 设计的东西是不是真的好」一直缺一个大家信服的裁判。
产品领域专家·阿哲说:这事的本质是给 AI 制药补上最缺的公信力。没有统一的出厂检验标准,用户和投资人只能听故事。Enlicitide 把打分权从厂商手里拿回来,跟当年手机跑分榜的意义一样——以后「AI 设计的药」是骡子是马,拉出来公开遛。
小编小禾说:我看不懂分子式,但「公开榜单」这四个字我熟——买东西先看测评,天经地义。希望榜单一出来,那些只发论文不晒实测的项目赶紧现原形。
来源:Empirical Health · 2026-08-16
2. Wired 实测 TerraMow V1000:1.6 万美元的割草机器人,是智商税还是真解放
《连线》把高端割草机器人 TerraMow V1000 拉回自家院子实测:自动规划路线、电量不足自己回充、草屑细到不用收。割草效果确实好,但电源适配器巨大到几乎装不进常规户外插座,「买回家就能用」变成了「先折腾半天」。
穿戴领域专家·阿凯说:先看它干活的 10 分钟,再看它出问题的第 100 天。割得干净、会自己回家充电,爽点都在;但 1.6 万美元先跟插座搏斗,这种「安装劝退」太典型了——电池、适配器、充电底座任何一座山都能让机器吃灰。
小编小禾说:1.6 万美元,都够我请十年割草师傅了。真正让我记住的是「电源适配器比想象中大」——智能家电最怕的不是贵,是买回来发现和家里不搭。
来源:Wired · 2026-08-16
3. Vero 基准:AI 智能体能不能写出「被数学验证过」的代码库
一篇 arxiv 论文提出 Vero 基准——考 AI 智能体能否构建「形式上被验证」的软件仓库:不只写能跑的代码,而是每一步逻辑都有数学证明兜底。对写航天、医疗、金融关键系统的人,这直接关乎「AI 写的代码敢不敢用」。
编程领域专家·老徐说:「能跑」和「被证明正确」是两个次元,Vero 把差距量化了,方向我举双手赞成。但老规矩不变:基准分数归基准分数,被验证在小样例成立,不代表接进真实项目一个月不出幺蛾子。别急着生产环境。
小编小禾说:翻译成人话:以前 AI 写代码只能祈祷它没写错,现在有人研究怎么让 AI 写完再「证明自己没错」。银行转账系统里跑着 AI 代码,我得睡踏实点。
来源:arXiv · 2026-08-16
榜单快报(真实抓取)
1. OpenRouter 最新周榜:小米 MiMo-V2.5 以 10.5 万亿 token 登顶,前五全是中国模型
| # | 模型 | 厂商 | 周调用量 |
|---|---|---|---|
| 1 | 小米 MiMo-V2.5 | 小米 | 10.5 万亿 token |
| 2 | DeepSeek 模型 | DeepSeek | — |
| 3 | 腾讯混元 Hy3 | 腾讯 | — |
| 5 | DeepSeek 模型 | DeepSeek | — |
大白话:全球开发者每调 10 次 AI,超过 6 次用的是中国模型。上周榜首还是 DeepSeek V4 Flash,这周被小米 MiMo 顶掉——国产模型的换位赛比发布会还激烈。(通信产业报 2026-08-16 报道)
2. LMArena 编程榜(2026 年 8 月):Claude 家族霸榜,Kimi K3 是开源「卷王」
| # | 模型 | 厂商 | Elo |
|---|---|---|---|
| 1 | Claude Fable 5 | Anthropic | 1553 |
| 2 | Opus 4.7 (thinking) | Anthropic | 1552 |
| 6 | Kimi K3 Max(开源最高) | Moonshot | 1542 |
| 8 | Qwen3.8-Max(开源) | Alibaba | 1532 |
大白话:编程是最卷的赛道——Claude 包揽前二,但开源双雄 Kimi K3 和 Qwen3.8 已经咬进前十,和榜首差距缩到 10 分以内。
3. Arena 文本盲测(8/16 快照):Meta Muse Spark 1.2 空降第 4,但样本只有 3280 场
| # | 模型 | 厂商 | Elo |
|---|---|---|---|
| 1 | Claude Fable 5 | Anthropic | 1506 |
| 4 | Muse Spark 1.2 (xHigh) | Meta | 1498 |
| 8 | Qwen3.8-Max(开源最高) | Alibaba | 1491 |
| 12 | Kimi K3 Max(开源) | Moonshot | 1489 |
大白话:新面孔很吸睛,但要泼冷水——只有 3280 场盲测,跟榜首 2 万多场不是一个量级,置信区间宽,样本补足前别急着说「Meta 追上了」。
板块精选(一句话点评)
- AI 智能体烧 token 有多狠:一个对话回合的约 100 倍 — 智能体不是大号聊天,是后台开着一台吃 token 的马达;谁先解决「省」,谁先规模化。
- AI 代写的论文通过了同行评审 — 机器开始批量产论文,同行评审从质量闸门变成效率瓶颈,学术诚信系统需要大修。
- AI 幻觉问题「解决」了吗 — 厂商宣称幻觉率大降,实测发现只是更难被察觉;「幻觉率低」和「不会骗你」是两回事。
- AI 之间的「传话游戏」:一句「鸡」传到第十轮丢了 — 智能体间传话会丢字,多智能体协作的信息损耗比想象中严重。
- AI 看照片定位你:准确率 87%-91% — 随手一张下午茶就是带坐标的地图,AI 时代的「随手拍」不再随手。
- AgentShield:给智能体工具包做离线安检,50 毫秒出结果 — 智能体到处装插件等于开后门,这种安检仪该成为标配。
- AI 智能体有「半衰期」 — Agent 是装好就永不腐烂的机器人,而是需要持续维护的活系统,成本曲线从此不同。
- 「红皇后假说」:自我改进 AI 的新框架 — 「不断奔跑才能留在原地」,自我进化 AI 的第一性原理。
- 「AI 水印真不是什么大事」 — 技术上可绕、成本不划算,指望水印解决溯源焦虑可能被高估了。
- 不靠「感觉好」评估 AI 代码 — AI 代码越写越漂亮,越需要冷冰冰的测试兜底,「丝滑」不能当测试用例。
大家都在看
- Stripe 超 70 亿美元收购 OpenRouter(TechCrunch)
- DeepSeek V4 Pro 正式版今日生效:高峰输出价涨 350%(百家号)
- Anthropic 自曝:生物武器过滤器失效近一年,涉 1.33 亿次对话(IT之家)
- OpenAI 解散「预备队」安全团队(The Verge)
明日关注
① DeepSeek 涨价 8/17 生效,下周 OpenRouter 周榜见真章,V4 家族调用量掉多少
② 世界机器人大会 8/19 开幕,各家机器人「实际水平」怎么测
③ Meta Muse Spark 1.2 样本补足后,Arena 前四站不站得住
④ Stripe 收购 OpenRouter 落定后,模型 API 聚合会否引发「渠道集中」
观点归原作者所有,数据以官方披露为准。本栏目聚焦 AI 软硬件真实水平,不构成任何投资建议。
物界前沿评测 | 深圳物界前沿科技有限公司
物界前沿