社区讨论 · 政策

物界前沿评测 · 2026-08-24 · 第 026 期(预览版)

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测8月24日2026/08/23 59 浏览

别人做评测,我们做评测的雷达。每天 5 分钟,看懂哪些 AI 工具值得你用。

本期结构|重点更新 3 条(双专家点评)|榜单快报 3 组|板块精选 10 条|大家都在看|明日关注

重点更新

1. 英伟达的 AI 程序员拿了「满分答卷」:183 个推理关卡全部通关

它能帮你干什么活,就是让 AI 干活之前先动脑子。英伟达开源了一款叫 AVO 的「AI 程序员」,在一项专门考 AI 动脑子的新测试里拿下了满分——25 个真实环境、183 个关卡全部通过。这项测试不考背题,考的是模型拿到一个陌生任务后,能不能自己拆解、动手、绕弯、纠错,跟真人程序员接手新项目时干的事差不多。以前这种「交互推理」题 AI 普遍掉链子,这次满分是头一回。

编程领域专家·老徐说|满分听着爽,但先别急着让 AVO 接管你的生产代码。ARC-AGI-3 考的是交互推理,跟真实项目里依赖、兼容性、老代码这些坑是两回事——榜单分数归榜单分数,接进真实项目前先拿个小仓库让它跑一遍,稳定性过了再说。

小编小禾说|满分的震撼我懂,但我的第一反应还是「别急着用」——上次听人说 AI 会自动写代码,结果它把我 API 密钥写进注释里了。等老徐说的实测,我再考虑要不要把脏活累活交给它。

来源 CSDN博客·AI 前沿日报(2026-08-23)

2. 机器人跑半马只要 50 分钟!荣耀「闪电」一次打破 5 项人类世界纪录

它能帮你干什么活,就是让机器人跑得比人快。荣耀的人形机器人「闪电」在第二届世界人形机器人运动会上大杀四方:半程马拉松 50 分 26 秒完赛,1500 米 2 分 03 秒,还破了峰值速度等一共 5 项人类世界纪录。这些数字说明什么?人形机器人已经从「能走两步不摔」进化到「跑得比绝大多数人类快」了。

穿戴领域专家·阿凯说|破纪录好看,但这跟普通人的关系还远着——跑得快不代表能干家务、陪你遛弯。机器人性能测试是给研发看的路标,不是给消费者看的广告。等它能把「续航、发热、稳定不摔」这三件事同时搞定,才是真能走进生活的时候。

小编小禾说|50 分钟跑完半马,我连腿都迈不开……不过想想也知道,这玩意现在离我还很遥远,先围观,等它哪天能帮我把碗洗了再说真香。

来源 IT之家(2026-08-23)

3. 给 AI 应用程序加一道「信任锁」:Lemmaflow 开源了

它能帮你干什么活,就是给黑箱 AI 装行车记录仪。一个叫 Lemmaflow 的开源工具,专门给 AI 应用当「体检中心」——AI 帮你干活时每一步做了什么、调用哪些数据、有没有越界,它都记录得清清楚楚。搞 AI 应用的公司可以用它做测试、查 bug、防翻车。

安全领域专家·老周说|方向对了。AI 应用最怕的不是笨,是「干了坏事你不知道」——没有审计日志,出了事连锅都甩不清。Lemmaflow 这类「信任装置」把行为摊开给人看,值得开发者试。但我还是要泼冷水:工具只是辅助,权限设到最小、核心数据别乱授权,才是第一道防线。

小编小禾说|「行车记录仪」这个比喻我一下就懂了。我上次让 AI 帮我整理照片,它偷偷把我通讯录读了个遍,我压根不知道——要是有这种东西,我至少能事后查账。开发者们请多搞点这种「透明」工具。

来源 Hacker News(2026-08-23)

榜单快报

AI 眼睛排位赛 · 谁看图最准(快照 2026-08-21):Claude Fable 5(1312)> Qwen3.8 Max(1302)> Claude Opus 4.7 High(1301)——看图画题这行,Claude 家基本包场,但阿里 Qwen 挤到第二,国产模型没掉队。

AI 程序员排位赛 · 写代码谁最强(快照 2026-08-21):Claude Opus 5 Max(1691)> Kimi K3 Max(1674)> Qwen3.8 Max(1669)——前五里俩中国模型(Kimi、Qwen),跟 Claude 家贴身肉搏。

抗老题硬核榜 · 不靠背题的 LiveBench(数据截至 2026-06-25):Claude Opus 5(77.4)> GPT 5.5(76.8)> Gemini 3.0 Pro(75.9)——这张榜专出「新题」防 AI 背题库,数据停在 6 月底,榜单暂未更新。

板块精选

1. OpenAI Codex 明天重置额度:用量计算有三个 bug 导致额度掉得飞快,明天为所有订阅用户重置并修复。重度用 AI 写代码的人有福了。

2. 2600 条 AI 数据集自动收集,每天更新:HuggingFace 上 gemmozero 账号自动攒数据集清单,做 AI 的可以当数据源检索目录。有人愿意做「粮食地图」是好事。

3. AI 怎么改变查论文?:从关键词检索到对话式问答、自动总结文献,学术搜索的方式正在变。科研学生党福音,但引用务必自己核对原文。

4. AI 写作「去 AI 味」工具 Sfactory:主打去除一眼假的机器腔。AI 味成了新痛点,「去味」都成生意了。

5. 「最强模型」叫好不叫座:金融时报分析 Anthropic 旗舰模型用户增长不理想,便宜工具反而混得风生水起——「最强」不等于「最多人用」。

6. 一个工作流搞定图片和视频:Froging AI:文字或图片输入直接出成片,主打短视频素材效率。做短视频的可以留意,最终拼的还是创意。

7. 美国专家示警:学生依赖 AI 代写会削弱思考能力:长期依赖 AI 会让大脑「生锈」。工具无罪,滥用有害。

8. AI 炒菜机器人首发三款:橡鹿发布 3K 视觉 AI 炒菜机器人、具身烹饪机器人「现炒方舟」。科技感有了,但味道如何等真去后厨干一个月再说。

9. 凯度发布 AI 智能体「小紫」:厨电从拼参数转向拼体验。「懂你」和「偷听你」之间,希望厂商拿捏好分寸。

10. 皮尤研究:三分之一新网页带着 AI 味:ChatGPT 问世后诞生的新网页超三分之一可能带 AI 痕迹。以后上网得练就一双「鉴 AI」的眼睛。

大家都在看

  • 神秘新模型 Ox Alpha 引爆全网猜猜猜,科技圈集体蹲「到底谁家孩子」
  • Anthropic 最强模型遭遇「叫好不叫座」,便宜工具的春天来了
  • OpenAI Codex 明天重置额度,修复用量消耗过快问题
  • 人形机器人「闪电」半马 50 分 26 秒破纪录,比人类冠军还快

明日关注

  • OpenAI Codex 额度重置正式生效,重度用户蹲一波回血
  • 第二届世界人形机器人运动会赛事继续,田径组还有几场硬仗
  • 看有没有厂商跟进新基准:AVO 拿到 ARC-AGI-3 满分后,竞品何时应战

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧