物界前沿评测 · 全球AI评测雷达 · 2026-08-18
重点更新
① AI 比人类专家更会「说服人」了
一篇 arXiv 研究称 AI 系统在说服任务上的表现已超过人类专家。AI 没有情绪、不会累,能针对每个人定制话术——说服力是所有商业、政治、诈骗的共同底层能力。(来源:arXiv / Hacker News)
② Claude 隐形水印官方详解
Anthropic 解释文本隐形水印原理:微调选词概率把「签名」编进文本流,复制改写不消失。质量影响与验证权集中是两个争议点。(来源:TheVerge / Guardian)
③ 智能体成本五年涨 5 倍
企业级 AI 智能体成本到 2028 年将膨胀约 5 倍。省 token 的工程能力将成为规模化关键——这也是模型路由层值 70 亿美元的原因。(来源:The Register)
榜单快报
OpenRouter 最新周榜(8/10-8/16):全球 75.3 万亿 token(+9.13%),中国占 36.84 万亿、连续 16 周全球第一。DeepSeek V4 Flash 正式版 11.2 万亿连续两周登顶,腾讯 Hy3 9.95 万亿第二,GPT-5.6 Luna 5.31 万亿首进前三。(来源:每日经济新闻 08-17)
性价比榜:DeepSeek V4 Flash 每任务成本约等于 GPT-5.6 Sol 的 1/40、Claude Fable 5 的 1/100(Artificial Analysis 数据)。
新基准:CladBench 上线——536 道题、12 个类别,专测大模型对英国与欧盟建筑法规的掌握程度。
板块精选
- 配置文件一句话让 AI 代码审计跳过 bug — 提示注入对审计类 Agent 同样有效,AI 审计员也有「盲区开关」。
- Vetted AI code is hard to justify — 代码能跑和代码能负责是两回事,AI 编程落地瓶颈一半在「出了事谁签字」。
- AI 生成的 Copilot Autofix 被利用攻破 Snowflake Jira — 自动修复是双刃剑,AI 生成代码必须过人工审。
- Do Not Trust, Continuously Verify — 对 Agent 输出默认不信任、每步验证,是规模化部署的前提。
- 控制图让 AI Agent 更便宜 — 把 Agent 当生产线监控,能早发现退化、减少无效调用。
- Is reviewing AI even possible? — 模型周更、评测集被污染,评测 AI 需要更动态防污染的体系。
- 训练 AI 科学家复现研究 — 让模型读论文、跑实验、检验可复现性,科研从生成式扩展到验证式。
- 本地扫描 AI 文本隐藏 Unicode — 零宽字符、同形异义字一抓一个准,内容生态的自净装置。
- Doberman:阻止 Claude 删库的 AI 看门狗 — 给 AI 配 AI 保安,权限最小化+实时拦截。
- OpenAI/Hugging Face 被黑复盘 — 密钥管理混乱、供应链权限过宽,基础安全功课落后于模型能力。
大家都在看
- Anthropic 成「AI 界的苹果」:收入最高、价格也最贵
- Canva 内部估值下调 100 亿美元
- 万国数据上调全年指引,今年 100 亿扩建数据中心
- 谷歌 Pixel 新功能:AI 分析电池使用情况
- 联发科 Day-0 适配阿里 Qwen 3.8
- 字节跳动与美国电影协会签署 AI 版权协议
- 美国最大原住民部落禁新建数据中心
明日关注
① DeepSeek 峰谷定价生效后下周 OpenRouter 周榜见真章
② 8/19 世界机器人大会开幕,宇树「超人」真机首秀
③ Claude 隐形水印灰度上线,第三方能否识别
④ GPT-5.6 Luna 首进前三后,开源闭源调用量拉锯见分晓
观点归原作者所有,数据以官方披露为准。本栏目聚焦 AI 软硬件真实水平,不构成任何投资建议。
物界前沿评测 · 全球AI评测雷达 | 深圳物界前沿科技有限公司
物界前沿