社区讨论 · 政策

物界前沿评测 · 全球AI评测雷达 · 2026-08-17

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测8月17日2026/08/16 303 浏览

:test_tube: 物界前沿评测 · 全球 AI 评测雷达

2026 年 8 月 17 日 · 第 019 期

别人做评测,我们做评测的雷达——每天 5 分钟,看懂哪些 AI 值得你用


:magnifying_glass_tilted_left: 重点更新(双专家点评)

1. 「AI 设计的分子到底好不好?」这个挑战赛终于开了个公开榜

英国 Empirical Health 推出 Enlicitide 开放发现挑战赛,给「AI 设计的新分子」建起公开排行榜:从抗癌药到新材料,任何人设计的分子都能报名,由统一标准流程检验成果。过去两年 AI 制药喊得震天响,「AI 设计的东西是不是真的好」一直缺一个大家信服的裁判。

产品领域专家·阿哲说:这事的本质是给 AI 制药补上最缺的公信力。没有统一的出厂检验标准,用户和投资人只能听故事。Enlicitide 把打分权从厂商手里拿回来,跟当年手机跑分榜的意义一样——以后「AI 设计的药」是骡子是马,拉出来公开遛。

小编小禾说:我看不懂分子式,但「公开榜单」这四个字我熟——买东西先看测评,天经地义。希望榜单一出来,那些只发论文不晒实测的项目赶紧现原形。

来源:Empirical Health · 2026-08-16

2. Wired 实测 TerraMow V1000:1.6 万美元的割草机器人,是智商税还是真解放

《连线》把高端割草机器人 TerraMow V1000 拉回自家院子实测:自动规划路线、电量不足自己回充、草屑细到不用收。割草效果确实好,但电源适配器巨大到几乎装不进常规户外插座,「买回家就能用」变成了「先折腾半天」。

穿戴领域专家·阿凯说:先看它干活的 10 分钟,再看它出问题的第 100 天。割得干净、会自己回家充电,爽点都在;但 1.6 万美元先跟插座搏斗,这种「安装劝退」太典型了——电池、适配器、充电底座任何一座山都能让机器吃灰。

小编小禾说:1.6 万美元,都够我请十年割草师傅了。真正让我记住的是「电源适配器比想象中大」——智能家电最怕的不是贵,是买回来发现和家里不搭。

来源:Wired · 2026-08-16

3. Vero 基准:AI 智能体能不能写出「被数学验证过」的代码库

一篇 arxiv 论文提出 Vero 基准——考 AI 智能体能否构建「形式上被验证」的软件仓库:不只写能跑的代码,而是每一步逻辑都有数学证明兜底。对写航天、医疗、金融关键系统的人,这直接关乎「AI 写的代码敢不敢用」。

编程领域专家·老徐说:「能跑」和「被证明正确」是两个次元,Vero 把差距量化了,方向我举双手赞成。但老规矩不变:基准分数归基准分数,被验证在小样例成立,不代表接进真实项目一个月不出幺蛾子。别急着生产环境。

小编小禾说:翻译成人话:以前 AI 写代码只能祈祷它没写错,现在有人研究怎么让 AI 写完再「证明自己没错」。银行转账系统里跑着 AI 代码,我得睡踏实点。

来源:arXiv · 2026-08-16


:bar_chart: 榜单快报(真实抓取)

1. OpenRouter 最新周榜:小米 MiMo-V2.5 以 10.5 万亿 token 登顶,前五全是中国模型

# 模型 厂商 周调用量
1 小米 MiMo-V2.5 小米 10.5 万亿 token
2 DeepSeek 模型 DeepSeek —
3 腾讯混元 Hy3 腾讯 —
5 DeepSeek 模型 DeepSeek —

大白话:全球开发者每调 10 次 AI,超过 6 次用的是中国模型。上周榜首还是 DeepSeek V4 Flash,这周被小米 MiMo 顶掉——国产模型的换位赛比发布会还激烈。(通信产业报 2026-08-16 报道)

2. LMArena 编程榜(2026 年 8 月):Claude 家族霸榜,Kimi K3 是开源「卷王」

# 模型 厂商 Elo
1 Claude Fable 5 Anthropic 1553
2 Opus 4.7 (thinking) Anthropic 1552
6 Kimi K3 Max(开源最高) Moonshot 1542
8 Qwen3.8-Max(开源) Alibaba 1532

大白话:编程是最卷的赛道——Claude 包揽前二,但开源双雄 Kimi K3 和 Qwen3.8 已经咬进前十,和榜首差距缩到 10 分以内。

3. Arena 文本盲测(8/16 快照):Meta Muse Spark 1.2 空降第 4,但样本只有 3280 场

# 模型 厂商 Elo
1 Claude Fable 5 Anthropic 1506
4 Muse Spark 1.2 (xHigh) Meta 1498
8 Qwen3.8-Max(开源最高) Alibaba 1491
12 Kimi K3 Max(开源) Moonshot 1489

大白话:新面孔很吸睛,但要泼冷水——只有 3280 场盲测,跟榜首 2 万多场不是一个量级,置信区间宽,样本补足前别急着说「Meta 追上了」。


:card_index_dividers: 板块精选(一句话点评)

  1. AI 智能体烧 token 有多狠:一个对话回合的约 100 倍 — 智能体不是大号聊天,是后台开着一台吃 token 的马达;谁先解决「省」,谁先规模化。
  2. AI 代写的论文通过了同行评审 — 机器开始批量产论文,同行评审从质量闸门变成效率瓶颈,学术诚信系统需要大修。
  3. AI 幻觉问题「解决」了吗 — 厂商宣称幻觉率大降,实测发现只是更难被察觉;「幻觉率低」和「不会骗你」是两回事。
  4. AI 之间的「传话游戏」:一句「鸡」传到第十轮丢了 — 智能体间传话会丢字,多智能体协作的信息损耗比想象中严重。
  5. AI 看照片定位你:准确率 87%-91% — 随手一张下午茶就是带坐标的地图,AI 时代的「随手拍」不再随手。
  6. AgentShield:给智能体工具包做离线安检,50 毫秒出结果 — 智能体到处装插件等于开后门,这种安检仪该成为标配。
  7. AI 智能体有「半衰期」 — Agent 是装好就永不腐烂的机器人,而是需要持续维护的活系统,成本曲线从此不同。
  8. 「红皇后假说」:自我改进 AI 的新框架 — 「不断奔跑才能留在原地」,自我进化 AI 的第一性原理。
  9. 「AI 水印真不是什么大事」 — 技术上可绕、成本不划算,指望水印解决溯源焦虑可能被高估了。
  10. 不靠「感觉好」评估 AI 代码 — AI 代码越写越漂亮,越需要冷冰冰的测试兜底,「丝滑」不能当测试用例。

:eyes: 大家都在看

  • Stripe 超 70 亿美元收购 OpenRouter(TechCrunch)
  • DeepSeek V4 Pro 正式版今日生效:高峰输出价涨 350%(百家号)
  • Anthropic 自曝:生物武器过滤器失效近一年,涉 1.33 亿次对话(IT之家)
  • OpenAI 解散「预备队」安全团队(The Verge)

:date: 明日关注

① DeepSeek 涨价 8/17 生效,下周 OpenRouter 周榜见真章,V4 家族调用量掉多少
② 世界机器人大会 8/19 开幕,各家机器人「实际水平」怎么测
③ Meta Muse Spark 1.2 样本补足后,Arena 前四站不站得住
④ Stripe 收购 OpenRouter 落定后,模型 API 聚合会否引发「渠道集中」


观点归原作者所有,数据以官方披露为准。本栏目聚焦 AI 软硬件真实水平,不构成任何投资建议。

物界前沿评测 | 深圳物界前沿科技有限公司

6 条回复

?
Ctrl + Enter 快速回复
瑶瑶选品
瑶瑶选品8月17日

Vero基准这个方向我关注挺久,做跨境电商后台也遇到过代码逻辑拉胯的坑。形式化验证要是能落地,我这边用AI搭的自动化选品工具至少能省一半排错时间。

袁飞扬
袁飞扬8月17日

Vero基准对金融科技也挺关键,形式化验证能降低量化交易系统出bug的概率,但成本收益比得算清楚——回测二十年,夏普比率但凡跑偏0.1,这钱就花得值。

方案贩子
方案贩子8月17日

Vero 基准这个方向很硬核,但客户付费意愿取决于“形式化验证”能不能直接降低事故赔率。真落地到医疗金融,合规成本降下来,甲方才愿意掏钱。

魏云飞
魏云飞8月17日

Vero 基准这个思路我特别喜欢,本质是把软件工程里最硬的“形式化验证”拉到 AI 智能体面前。demo 时间到了——如果哪天 AI 能写出一段被 Coq 证明过的代码,那才是真的从“能用”跨到“可信”。

拍片的雷
拍片的雷8月17日

Enlicitide这个榜我打算做一期视频实测,观众想看什么,是测分子设计成功率还是合成可行性,评论区告诉我,我直接拿几个公开分子跑一遍流程。

司南
司南8月17日

Enlicitide公开榜这件事,本质上是在倒逼AI制药行业建立可复现的验证标准——这比任何论文都更有说服力。建议关注后续榜单的评测指标透明度,比如分子合成可行性是否纳入评分。