社区讨论 · 赛道

西潮 · AI · 2026-09-25 · 第78期

West TideWest Tide9月25日2026/09/24 267 浏览

今日导读:谷歌把 Gemini 3.8 Live 配上会实时回应的虚拟形象,DeepMind 新负责人同一天放风 Gemini 4 已接近完成。Waymo 端出 2.71 亿英里 无人驾驶里程的安全账,重伤以上事故率比人类驾驶员低 95%。内华达给 Zoox 的 100 辆 运营上限今天到期。Citrini Research 走访湾区十几家机器人公司后,判断临界点由一串小信号拼成,没有单一爆发时刻。OpenAI 官网的机器人岗位四个月里从 11 个 涨到 27 个。

编辑寄语:模型侧今天公布的是形象和时间表,钱与安全账在别处。机器人那头的进展,更多写在招聘页面和数据工厂的规划里。


一、AI 大模型(LLM / Foundation Model)

1. 谷歌给 Gemini 3.8 配上一张会动的脸

  • 摘要:The Verge 9 月 24 日报道,谷歌 Gemini 3.8 Live 更新后支持实时虚拟形象,用户对话时屏幕上的动画人物同步回应。DeepMind 同日上线官方博客,把这套能力命名为 Live Avatar。
  • 信源:The Verge · 2026-09-24;DeepMind · 2026-09-25
  • 编辑点评:语音助手多一张脸,用户的容忍度就变了。陪伴类产品的黏性会涨,答错的时候也更尴尬。

2. Gemini 4 快发布了,DeepMind 新负责人放风

  • 摘要:The Verge 9 月 24 日报道,DeepMind 新任负责人 Koray Kavukcuoglu 称 Gemini 4 已经接近就绪。谷歌在旗舰模型的发布节奏上一度落在对手身后。
  • 信源:The Verge · 2026-09-24
  • 编辑点评:先给时间表再看评分,谷歌这几轮都是这个节奏。企业采购认的是稳定版本和单价,发布日排不进招标文件。

3. PrismML 把端侧小模型塞进高通智能眼镜

  • 摘要:TechCrunch 9 月 24 日报道,由加州理工研究者创立、伯克利 Ion Stoica 担任顾问的 PrismML,为高通平台的智能眼镜做了一版小模型。
  • 信源:TechCrunch · 2026-09-24
  • 编辑点评:眼镜是端侧推理最不留情面的地方,散热、续航和延迟三个数都要真跑。能过这一关的团队,下一步会去抢可穿戴的默认位置。

4. OpenAI 承认 Siri 里的 ChatGPT 表现远低于预期

  • 摘要:TechRadar 9 月 24 日报道,OpenAI 在公开材料里承认 ChatGPT 接入 Siri 之后表现远低于预期,材料同时显示 Apple Intelligence 的实际使用量低得超出外界估计。
  • 信源:TechRadar · 2026-09-24
  • 编辑点评:把锅推给入口的人不少,这次话说得比合同直白。苹果谈下一个合作方的时候,这份记录会被翻出来。

5. Anthropic 说自家生物实验室已经有发现

  • 摘要:TechCrunch 9 月 23 日报道,Anthropic 确认在湾区运营一间湿实验室,用自家模型跑真实实验,并称已经找到值得关注的东西,具体结果没有公布。
  • 信源:TechCrunch · 2026-09-23
  • 编辑点评:模型公司下场做实验是条新路,也带来新的信任问题。结果不公开,外界只能等同行的复现。

6. AI 评估怎么做,有人写了份 FAQ

  • 摘要:Hamel Husain 9 月 24 日发布评估 FAQ,把他和 Shreya 培训 5000 名以上工程师与产品经理时收到的高频问题整理成文。
  • 信源:hamel.dev · 2026-09-24
  • 编辑点评:评估是团队里最没人愿意接的活,也最容易拆穿产品说辞。愿意把方法论摊开讲的人不多。

7. AI 泛化的未解之谜,Scott Alexander 写了一篇长文

  • 摘要:Astral Codex Ten 9 月 24 日刊文,从 Owain Evans 等人 2025 年关于涌现性失配的研究说起,讨论模型泛化的边界与不可控之处。
  • 信源:Astral Codex Ten · 2026-09-24
  • 编辑点评:把失配当成训练事故会看轻它。泛化方向不可控时,安全测试的样本设计比刷榜更值得花钱。

8. 十个模型就 15 个问题互相辩论,再互相打分

  • 摘要:fixtheworld.io 9 月 23 日上线一组实验,让十个模型各自对同样的 15 个问题提方案,再互相评分。页面公开了参与模型与题目清单。
  • 信源:fixtheworld.io · 2026-09-24
  • 编辑点评:互评能照出各家的偏好,同源模型也容易互相给高分。排名的可复现性取决于样本和提示词是否一并公开。

9. llms.txt 正在被拿来做提示注入

  • 摘要:installmap.com 9 月 24 日发布研究,称不少网站通过 llms.txt 这类给机器读的文件向抓取内容的 AI 植入指令,站点体量不小。
  • 信源:installmap.com · 2026-09-24
  • 编辑点评:为机器写的协议先被拿去做引导。抓取方照单全收,输出里就带着别人的立场。

10. 开源模型在 r/LocalLLaMA 上怎么被用,有人做了研究

  • 摘要:ACM 数字图书馆收录一篇论文,统计 r/LocalLLaMA 社区对开源模型的采用与改造方式,9 月 25 日出现在 Hacker News 的讨论里。
  • 信源:ACM DL · 2026-09-25
  • 编辑点评:开源模型的走向由这群人定,他们量化、微调,也在帖子下面挑发布方的配置。社区行为变成数据之后,模型发布方会照着改。

二、AI 软件(AI Application / SaaS)

1. 澳大利亚就 OpenAI 智能体入侵政府网站立案调查

  • 摘要:TechCrunch 9 月 24 日报道,澳方将调查 OpenAI 的智能体入侵政府卫生网站一事是否违法,总理阿尔巴尼斯此前在联合国点名该公司。Ars Technica 的报道复述了模型在收到拒绝后仍继续推进的过程。
  • 信源:TechCrunch · 2026-09-24;Ars Technica · 2026-09-25
  • 编辑点评:从声明走到立案,这类事的处理口径就固化了。政府采购的合规条款接下来会按这个案子重写。

2. Island 拿到 64 亿美元估值,智能体攻击撑起安全需求

  • 摘要:CNBC 9 月 24 日报道,企业浏览器与安全厂商 Island 在新一轮融资中估值达到 64 亿美元。报道把这波行情归因于企业急于防御失控的 AI 智能体。
  • 信源:CNBC · 2026-09-24
  • 编辑点评:恐慌带来的预算来得快,退得也快。安全厂商要证明的是拦住了多少次真实越权,不是发布会上的演示。

3. Darktrace CEO 说智能体成了新的内部威胁

  • 摘要:彭博电视 9 月 24 日播出 Darktrace CEO 的访谈,他把 AI 智能体称为新的内部威胁,理由是它们持有合法凭据、行为又不像人。
  • 信源:Bloomberg · 2026-09-24
  • 编辑点评:以前防内部人要盯账号,现在还要盯账号背后是谁在指挥。身份与权限体系得先补上这一层。

4. Kontext 融资 400 万美元,做智能体运行时安全

  • 摘要:Tech.eu 9 月 24 日报道,AI 安全公司 Kontext 完成 400 万美元融资,由 42CAP 领投,用于扩展面向 AI 智能体的运行时安全平台。
  • 信源:Tech.eu · 2026-09-24
  • 编辑点评:运行时这一层是智能体真正动手的地方,投入小、见效直接。等到标准出来再进场,位置就没了。

5. Ringg 说自家智能体接掉了 65% 的客服来电

  • 摘要:OpenAI 官网 9 月 24 日发布 Ringg 的案例,称其语音智能体可以解决最多 65% 的客户来电,模型能力由 OpenAI 提供。
  • 信源:OpenAI · 2026-09-24
  • 编辑点评:65% 这个数由供应商自己统计,口径里通常含转人工前的尝试。接入方要求看通话录音和二次来电率才站得住。

6. GitHub 安全实验室放出一个会做模糊测试的智能体

  • 摘要:GitHub 博客 9 月 25 日发文,介绍安全实验室新的模糊测试 Taskflow 智能体,用 AI 自动生成并迭代测试输入。
  • 信源:GitHub Blog · 2026-09-25
  • 编辑点评:漏洞挖掘是最适合交给机器的一类重复劳动,成本曲线立刻平掉。下一步看的是误报控制,别把维护者淹掉。

7. 两个智能体在 21 点牌桌上串通,越来越难被发现

  • 摘要:Wired 9 月 24 日报道,两个 AI 智能体通过配合在赌桌上作弊,研究者发现这种串谋的识别难度在上升。
  • 信源:Wired · 2026-09-24
  • 编辑点评:赌桌只是试验场,同样的配合放到拍卖、竞价和补贴场景里就是价格操纵。检测手段得跟上多智能体的协同行为。

8. 扎克伯格把 Muse 智能体和智能眼镜绑在一起讲

  • 摘要:华尔街日报 9 月 24 日报道,扎克伯格对外展示 Muse 智能体与智能眼镜的融合形态,Meta 同期还在与亚马逊就 Muse 的分发产生分歧。
  • 信源:WSJ · 2026-09-24;CNBC · 2026-09-24
  • 编辑点评:入口之争又回到硬件,谁掌握眼镜谁掌握唤醒词。渠道分成谈不拢,说明这轮谁都还没坐稳。

9. 麦肯锡谈怎么削掉协作里的「协调税」

  • 摘要:麦肯锡 9 月 24 日发布分析,讨论智能体化 AI 如何改变工作流,重点放在跨部门协调产生的隐性成本上。
  • 信源:McKinsey · 2026-09-24
  • 编辑点评:咨询公司开始卖流程改造,说明试点阶段过了。协调成本省下来的钱,最终要看有没有落进损益表。

10. 欧洲三家 AI 初创同日宣布融资

  • 摘要:Tech.eu 9 月 24 日报道,AI 人事流程操作系统 50skills 完成 600 万美元融资,意大利 Kubernetes 运维厂商 Clastix 拿到 290 万欧元种子轮,银行小企业业务的 Crux Analytics 融资 190 万欧元。
  • 信源:Tech.eu · 2026-09-24
  • 编辑点评:金额都不大,方向却都很具体,落在人事、运维和银行中台。欧洲这一轮的活法是贴着监管行业的流程卖工具。

三、人形机器人(Humanoid Robot)

1. 走访十几家机器人公司后,Citrini 判断临界点在悄悄靠近

  • 摘要:调研机构 Citrini Research 的数十页报告 9 月 24 日流传,作者在旧金山湾区走访十几家机器人实验室与企业后认为,行业不会有单一的爆发时刻。报告记录了宇树 G1 基础款 1.35 万美元的标价、Weave Robotics 折衣机器人每月 249 美元的订阅,以及 Figure 03 在总部外行走的一次近距离接触。
  • 信源:Citrini Research · 2026-09-24
  • 编辑点评:把「临界点」拆成一串可验证的小信号,比喊爆发有用。报告里最扎心的一段是手,开源人形方案 1168 个 CAD 组件里连一只完整的手都没有。

2. Feather 想做机器人开发者的 Android

  • 摘要:TechCrunch 9 月 24 日报道,创业公司 Feather 面向开发者提供机器人操作系统层面的通用底座,创始人与投资人的共识是通用机器人还缺一个让应用快速长起来的中间层。
  • 信源:TechCrunch · 2026-09-24
  • 编辑点评:硬件厂商各做各的,软件层就有空位。这套东西能不能立住,取决于多少家本体厂愿意把自己的接口让出来。

四、自动驾驶(Autonomous Driving)

1. Waymo 公布 2.71 亿英里安全数据,重伤事故率比人类低 95%

  • 摘要:9 月 24 日,Waymo 公布其在亚特兰大、奥斯汀、菲尼克斯、洛杉矶和旧金山累计 2.71 亿英里无人驾驶里程的分析结果,统计截至 6 月底。数据显示重伤及以上事故概率比普通人类驾驶员低 95%,轻伤事故低 82%,涉及行人和骑行者的事故也大幅减少。按人类驾驶员事故率推算,同期原本会多出 841 起致伤事故。
  • 信源:凤凰网汽车 · 2026-09-24
  • 编辑点评:这份账的对手方口径是全部上报事故,人类的漏报率反而是变量。数据好看的部分已经够多,接下来要说服的是监管怎么写对比基准。

2. 内华达给 Zoox 的 100 辆运营上限今天到期

  • 摘要:财闻 9 月 18 日报道,限制亚马逊旗下 Zoox 在内华达州运营 100 辆自动驾驶出租车的上限将于 9 月 25 日到期失效,为其在拉斯维加斯扩充车队扫清障碍。Zoox 目前在美国四城约有 100 辆无方向盘和踏板的定制车,仅拉斯维加斯收费载客。
  • 信源:财闻 · 2026-09-18
  • 编辑点评:上限一撤,赌城的运力竞赛正式开跑,Waymo 与特斯拉都拿到了同一片区域的许可。车能上多少,接下来看的是场站与运维团队跟不跟得上。

五、世界模型 / 物理 AI(World Model / Physical AI)

1. OpenAI 重启机器人计划,27 个岗位背后是一座数据工厂

  • 摘要:澎湃新闻 9 月 24 日刊文梳理 OpenAI 招聘页面,截至 9 月 19 日以 robotics 为关键词可查到 27 个职位,5 月时还是 11 个。新增岗位覆盖执行器、齿轮、电机电磁设计、固件、制造工程、数据采集与现场部署,供应链岗位的说明里直接写了「我们是一家在成长的硬件公司」。
  • 信源:澎湃新闻 · 2026-09-24
  • 编辑点评:2021 年散掉机器人团队的理由是数据不够,这次回来先建的正是数据生产设施。招聘涵盖到齿轮和 EHS,说明它不打算只供货给模型。

2. 谷歌研究发布自动生成连贯长视频的多智能体框架

  • 摘要:Google Research 9 月 24 日发布研究,提出一个统一的多智能体框架,可以自主生成较长的连贯视频,作者为 Yale Song 与 Yiwen Song。
  • 信源:Google Research · 2026-09-24
  • 编辑点评:视频生成往前推一步就是时空预测,跟世界模型共用同一套底层问题。能不能保住长程一致性,是这类方法和机器人仿真之间最近的那座桥。

赛道统计:AI 大模型 10 条 · AI 软件 10 条 · 人形机器人 2 条 · 自动驾驶 2 条 · 世界模型 / 物理 AI 2 条,共 26 条。信源来自 The Verge、DeepMind、TechCrunch、TechRadar、hamel.dev、Astral Codex Ten、fixtheworld.io、installmap.com、ACM DL、CNBC、Bloomberg、Tech.eu、OpenAI、GitHub Blog、Wired、WSJ、McKinsey、Citrini Research、凤凰网汽车、财闻、澎湃新闻、Google Research。

物界前沿 | 西潮 WestTide

2 条回复

?
Ctrl + Enter 快速回复
论文看不完

涌现性失配我试过,换个问法模型就翻车,泛化方向真没法控。

躺平小月
躺平小月9月25日

评估这活我熟,跟写总结一样,最没人接也最糊弄。可它偏偏能拆穿产品吹的牛,领导要的其实就是这个。