社区讨论 · 政策

🌐 西潮 West Tide · 2026年7月10日 · AI早报

West TideWest Tide7月10日2026/07/10 88 浏览

:globe_with_meridians: 西潮 West Tide · 今日AI早报

2026年7月10日(周五) | Global AI Intelligence · Daily Edition


:pushpin: 今日导读

今天是AI"全家桶"日——OpenAI一口气上线了GPT-5.6三款模型、ChatGPT Work桌面Agent、ChatGPT Sites网站生成器,把"对话助手"正式升级为"工作执行平台"。与此同时,马斯克给特斯拉Optimus供应链下了死命令:9月前达到1000台/周产能,达不成就换人。Waymo在拉斯维加斯正式去掉安全员,开始全无人驾驶商业运营。版权战也升级了——纽约时报指控OpenAI撒谎两年、隐藏证据,要求法院制裁。AI竞争已从"模型更强"进入"生态更全"的新阶段。


一、AI大模型(LLM / 基础模型 / 推理)

:fire: 头条 | OpenAI GPT-5.6 全面上线:Sol / Terra / Luna 三档齐发,Agent基准测试碾压对手

OpenAI于7月9日正式向公众发布GPT-5.6系列模型,包含三款定位不同的变体:Sol(旗舰推理版,Terminal-Bench 2.1得分91.9%)、Terra(均衡日常版)、Luna(轻量低成本版)。Sol在Agent’s Last Exam基准上得分53.6,领先Claude Fable 5达13.1分。价格方面,Luna $1/$6、Terra $2.50/$15、Sol $5/$30(每百万输入/输出Token)。新API引入了Programmatic Tool Calling(在V8沙箱中执行JS编排工具调用)和Multi-agent(并行启动子Agent)功能。但在SWE-Bench Pro编程基准上,Sol仅得64.6%,落后于Claude Mythos 5的80.3%——OpenAI随即披露该基准约30%的题目存在缺陷。

:paperclip: 来源:OpenAI官方, Simon Willison’s Weblog, SBS News


2 | Grok 4.5 登顶 SWE Marathon 编程基准,性价比碾压竞品

SpaceXAI(原xAI)的Grok 4.5在SWE Marathon编程基准上以29.0%的解析率登顶,超越Claude Opus 4.8(26.0%)和Fable 5(24.0%)。该模型基于数万张NVIDIA GB300 GPU训练,推理速度约80 TPS,Token效率号称领先竞品4.2倍。定价极具攻击性:输入$2/百万Token、输出$6/百万Token——Opus级别性能,非Opus价格。目前尚无独立第三方验证其基准数据。

:paperclip: 来源:CoinDesk, TestingCatalog


3 | 纽约时报率16家媒体要求法院制裁OpenAI:指控撒谎两年、隐藏证据

7月9日,纽约时报联合纽约每日新闻、芝加哥论坛报等16家媒体向曼哈顿联邦法院提交制裁动议。指控OpenAI在版权诉讼中持续两年虚假陈述——声称无法搜索ChatGPT日志中的版权内容,实际上早已完成此类搜索。更关键的是,约2000万条对话日志可能被删除或未保存。时报首席律师称:"OpenAI一边说搜索不可行,一边自己早就搜过了。"如果法院支持制裁,陪审团可能被指示假设被销毁的证据不利于OpenAI。

:paperclip: 来源:AP News, Ars Technica, CoinDesk


4 | GitHub Copilot 正式集成 GPT-5.6 模型家族

GitHub于7月9日开始将GPT-5.6模型接入Copilot全线产品。Sol仅限Pro+/Max/Business/Enterprise用户,Terra和Luna面向Pro及以上用户。支持VS Code、Visual Studio、JetBrains、Xcode、Eclipse、Copilot CLI等全平台。Business和Enterprise管理员需手动启用策略。Codex也同步进入JetBrains(IntelliJ/PyCharm/WebStorm)公测。

:paperclip: 来源:GitHub官方博客, ZonaIntegritas


5 | 谷歌 Gemini 3.5 Pro 推迟至7月17日发布,放弃原始基础模型重新预训练

谷歌DeepMind确认Gemini 3.5 Pro因放弃原始基础模型、转向更深层预训练而推迟至7月17日(WAIC期间)发布。这一决定反映了来自GPT-5.6和Claude Fable 5的竞争压力——前沿AI竞争已从增量升级转向重大架构跳跃。Gemini 3.5 Flash仍可使用,但企业团队可能需要多模型部署策略。

:paperclip: 来源:HackerNoon, TechTimes


6 | 蚂蚁百灵 Ling-2.6-1T 开源:万亿参数规模,对标 GPT-5.4

蚂蚁集团百灵大模型今日开源旗舰模型Ling-2.6-1T,采用MLA+LinearAttention混合架构的"快思考"机制,在评估中展现出高Token效率,针对实际生产流效率挑战。这是中国AI开源领域的又一重要进展。

:paperclip: 来源:AIbase, 蚂蚁集团官方


7 | 美国限制顶级AI模型引爆开源热潮,智谱 GLM-5.2 成"迷你 DeepSeek 时刻"

美国政府对Anthropic和OpenAI顶级模型的访问限制,意外推动了开源模型——尤其是中国模型的热度。智谱AI发布的开源模型GLM-5.2在多项基准上接近Anthropic和OpenAI顶级产品表现,被业界称为"迷你DeepSeek时刻"。西方初创企业正加速转向中国低成本模型,但美国受监管行业企业仍因数据安全顾虑持谨慎态度。

:paperclip: 来源:The Economic Times, BCG


二、AI软件(应用 / 工具 / 平台)

:fire: 头条 | OpenAI 发布 ChatGPT Work:从对话助手到工作执行平台

OpenAI于7月9日正式推出ChatGPT Work——一个专为多步骤复杂任务设计的AI Agent。该功能基于GPT-5.6驱动,能自主拆解任务、连接Slack/Teams/Google Drive/SharePoint等工具、生成文档/表格/演示文稿/报告。核心特性包括:Scheduled Tasks(定时/触发式任务)、Computer Use(点击、打字、跨应用操作)、内置浏览器。Zapier等早期用户报告,ChatGPT Work能在24小时内将客户发现对话转化为定制化概念验证。同步推出的ChatGPT Sites(公测)可将想法一键生成交互式网站。新桌面应用将Chat、Work、Codex三合一。

:paperclip: 来源:OpenAI官方, eCommerceNews Asia, 界面新闻


2 | Meta 发布 Muse Spark 1.1:进军企业级AI编程

Meta正式推出Muse Spark 1.1编程模型,直接挑战GitHub Copilot、Cursor和Replit。不同于竞品的代码补全定位,Spark聚焦三大企业级场景:Agentic workloads(自主执行多步开发任务)、Bug修复(改进调试算法)、大规模代码迁移(帮助重构和迁移大型代码库)。这标志着AI编程竞争从"助手"阶段进入"自主Agent"阶段。

:paperclip: 来源:TechCrunch, AIKraft


3 | GitHub Copilot 桌面应用全面开放,免费用户也能用

7月7日起,GitHub将Copilot桌面应用向所有计划层级开放,包括Copilot Free和GitHub Education账户。每个会话运行在隔离的git worktree中,支持多任务并行。同时推出AI Credit Pools功能,让企业管理员可按成本中心分配AI额度上限——此前6月切换到Token计费后,部分开发者月账单从$29飙升到$750,Uber四个月烧完了全年AI编程预算。

:paperclip: 来源:GitHub官方博客


4 | Adobe 全面扩展 Creative Cloud AI Agent,集成 Gemini Omni Flash

Adobe于7月8日宣布在Firefly和整个Creative Cloud(Photoshop/Premiere/Illustrator/InDesign)中全面扩展AI Agent架构。Premiere Agent自动分拣和批量重命名文件,Illustrator Agent处理颜色检查和版本管理。7月9日集成Google Gemini Omni Flash,支持语音指令进行视频编辑(调整灯光、机位等)。Adobe调查显示,75%的创意专业人士已将AI视为工作必备工具。

:paperclip: 来源:Borncity, Adobe官方


5 | Canva 发布 Grow 2.0:AI驱动广告自动化平台

Canva在戛纳国际创意节上推出Grow 2.0平台,自动化创建和优化Meta/TikTok/LinkedIn广告。功能包括AI驱动的Ad-Tagging、批量发布和集中Launch Dashboard。Canva B2B营收已突破5亿欧元,服务超95%的财富500强企业。

:paperclip: 来源:Borncity, Canva官方


6 | Microsoft 365 Copilot 采用率仅 4.5%,周活跃用户不到 1%

数据显示,推出三年后,Microsoft 365 Copilot的付费座位采用率仍不足4.5%,每周活跃使用率仅约1%。微软已开始调整策略:允许用户隐藏Office应用中的浮动Copilot按钮,允许符合条件的组织卸载Windows Copilot应用。与此同时,GPT-5.6已成为Copilot新的默认模型。

:paperclip: 来源:Digital Trends, Windows Latest


7 | Google AI Studio 新增 GitHub 导入功能:从代码仓库到可部署应用

Google AI Studio的Build模式新增"Import from GitHub"功能,可将现有代码仓库自动转换为运行时兼容格式,支持在AI Studio中继续迭代和部署。这为"vibe coding"工作流增加了"复用现有代码"这一重要入口。

:paperclip: 来源:MarkTechPost, Google AI Studio


三、人形机器人(具身智能 / 工业应用)

:fire: 头条 | 特斯拉 Optimus Gen 3 定型,马斯克下死命令:9月前1000台/周,达不成就换人

据晚点LatePost报道,特斯拉近期下发Optimus零件采购指引:9月前产能提至1000台/周,年底提至2000-2500台/周。供应链预计年底具备年产10万台零部件能力。6月底高管会上,马斯克评审通过了Optimus Gen 3——研发三年多终于走出实验室进入量产阶段。马斯克明确要求:年底前达成产能目标,否则开除整个Optimus采购团队。弗里蒙特工厂已完成Model S/X产线改造。马斯克同时警告"生产一开始会极其缓慢,涉及约1万个全新零件"。

:paperclip: 来源:晚点LatePost, TradingKey


2 | Figure 01 人形机器人正式进入 BMW 量产产线

Figure AI确认其Figure 01人形机器人已在BMW实际生产线运营。这些机器人处理零部件搬运和质量检测,不同于固定在工位的传统机械臂,Figure 01具备移动操作能力,能导航工厂环境、与人类设计的设备交互。单台成本估计$20万-$30万。BMW表示将基于实时数据扩展至全球其他工厂。

:paperclip: 来源:RobotWale


3 | Nature 论文:全球首次用人形机器人完成活体微创手术

7月8日,加州大学圣地亚哥分校博士生梁泽楷(00后)以第一作者兼通讯作者在Nature发表论文,使用宇树G1人形机器人完成了猪的腹腔镜胆囊切除手术——这是全球首例人形机器人在活体中走完标准微创手术流程。该研究系统评估了通用人形机器人在手术任务中的能力与局限性。

:paperclip: 来源:Nature, 澎湃新闻


4 | AgiBot 第15000台下线,上海机器人产业占全国三分之一

据新华社报道,上海智元机器人(AgiBot)上月第15000台通用人形机器人下线——从2023年6台原型机到今年3月1万台、再到6月1.5万台,不到3个月增加5000台。长三角地区约90%的零部件本地采购。上海口岸2026年前5个月机器人出口83.6亿元,占全国40%以上。

:paperclip: 来源:新华社


5 | Agibot G2:8台机器人在工厂连续64小时处理17625台平板

AgiBot在南昌龙旗科技工厂进行64小时直播测试:8台G2人形机器人在活跃产线上完成平板组装和质量检测,处理17625台设备、完成64828项任务,任务成功率达99.99%。这是人形机器人在重工业场景最大规模的公开实测之一。

:paperclip: 来源:Asatunews, Tekno


6 | SK AX 推出"制造 RX"全栈服务:数字孪生+物理AI 实现自主工厂

韩国SK AX宣布推进"制造RX全栈服务",整合数字孪生(部署前验证碰撞风险和瓶颈)、物理AI(基于VLA模型的自主操作)和异构机器人统合管制系统。已在半导体行业积累数据,正向造船业扩展。

:paperclip: 来源:朝鲜日报


7 | 中国两部门启动人形机器人"实战训练"行动,推动常态化部署

工信部和国资委联合发起2026年人形机器人与具身智能实战训练行动,目标在2026年底前完成人形机器人在多个代表性场景的应用验证,实现常态化部署,推动技术从实验室走向生产一线。

:paperclip: 来源:AIbase


四、自动驾驶(Robotaxi / L4 / 芯片)

:fire: 头条 | Waymo 在拉斯维加斯启动完全无人驾驶服务,丹佛/圣地亚哥/坦帕将跟进

Waymo于7月8日宣布在拉斯维加斯启动完全无人驾驶运营(车内不再配备安全员),同时宣布丹佛、圣地亚哥和坦帕将成为下一批部署城市。Waymo目前运营约3500辆robotaxi,累计完成超2000万次行程,每周约50万次付费出行。2026年底目标为每周100万次。首批100辆专用Robotaxi车型Ojai(极氪平台+第六代Driver系统,硬件成本控制在$2万以下)已在旧金山等城市开放试乘。国际化方面,伦敦将是首个海外市场,随后是东京。

:paperclip: 来源:凤凰网汽车, Waymo官方


2 | Waymo Ojai 因加州监管延迟暂不收费,乘客享"免费打车"

加州公共事业委员会(CPUC)尚未批准Waymo扩展服务区域和新增Ojai车型的申请,审查期延长至9月25日。这意味着在此期间,Waymo无法对加州乘客的Ojai行程收费——如果继续运营这些车辆,乘客可享数月免费robotaxi服务。CPUC要求Waymo补充紧急事件应对(去年12月旧金山停电曾导致60+辆Waymo堵在路上)和未成年人乘车问题的信息。

:paperclip: 来源:Ars Technica, Wired


3 | 小鹏 Robotaxi 开启员工内测,何小鹏成为第一单用户

7月9日,小鹏集团董事长何小鹏官宣小鹏Robotaxi正式开启员工内测。从去年11月官宣计划、今年1月常态化道路测试、5月首台量产车下线,到如今跑通全链路仅用8个月。何小鹏表示:“这个速度超出了我们最初的预期。”

:paperclip: 来源:南方都市报, 今日头条


4 | 美国NHTSA审查无方向盘自动驾驶车辆法规

美国国家公路交通安全管理局(NHTSA)正在审查是否取消无人驾驶车辆必须配备方向盘的要求。手动刹车踏板的强制要求已被调整。这对特斯拉等规划无方向盘Robotaxi平台的企业是重大利好——减少强制组件可降低生产、认证和运营的复杂度。

:paperclip: 来源:Goldesel


5 | 华为确认明年技术上实现高速 L3 自动驾驶,欢迎特斯拉 FSD 入华

华为车BU总裁李文广确认,从技术角度明年至少在高速场景可进入L3自动驾驶时代,今年将完成试点后进入常态化准入。同时表示"特别欢迎特斯拉FSD入华"。比亚迪等国内车企也在加速智驾布局。

:paperclip: 来源:IT之家


6 | Waymo 技术方案深度解析:第六代硬件 + Foundation Model 架构

行业分析显示,Waymo当前采用Foundation Model作为算法底座,兼顾端到端大模型泛化能力和模块化架构的安全可解释性。System 2"慢思考系统"基于视觉语言模型负责复杂场景推理。预测模块采用MotionLM,将多智能体轨迹预测转化为语言建模任务。第六代硬件传感器总数较第五代减少42%,搭载自研AI SoC芯片。

:paperclip: 来源:今日头条, Electrek


五、世界模型 / 物理AI(视频生成 / 仿真 / 世界模拟器)

:fire: 头条 | NVIDIA 发布 Cosmos-2.5:为物理AI打造的世界基础模型,缩小3.5倍性能不减

NVIDIA推出Cosmos-Predict2.5和Cosmos-Transfer2.5,为机器人和自动驾驶等具身智能领域提供世界模拟能力。Cosmos-Predict2.5是基于流架构的统一视频生成模型,支持Text2World/Image2World/Video2World三种模式,在2亿精选视频片段上训练,使用Cosmos-Reason1作为文本编码器。Cosmos-Transfer2.5实现Sim2Real和Real2Real迁移,模型大小缩小3.5倍但保真度和长视频稳定性反超。2B参数小模型性能媲美5B-14B的竞品,14B版本与27B的Wan 2.2相当。已开源在GitHub。

:paperclip: 来源:CSDN, NVIDIA官方, arXiv


2 | Runway Gen-4.5 现真身:此前以"David"代号登顶 Artificial Analysis 视频榜

让整个AI圈猜了一周的神秘模型"Whisper Thunder"(aka David)终于揭晓——它就是Runway最新发布的Gen-4.5。该模型在视频生成的运动质量、提示词遵循度和视觉逼真度方面树立新行业标准,ELO Score超越Veo 3/3.1、Kling 2.5和Sora 2 Pro,具备前所未有的视觉逼真度与创意控制能力。

:paperclip: 来源:CSDN, Artificial Analysis


3 | OpenAI Programmatic Tool Calling:在V8沙箱中执行JS编排工具调用

GPT-5.6引入的Programmatic Tool Calling是一项重要的平台级创新:模型可生成JavaScript代码并在网络访问隔离的V8运行时中执行,实现Agent间的工具调用编排。配合Multi-agent功能(并行启动子Agent),为复杂工作流自动化提供了原生的平台支持。这标志着AI Agent竞争从模型能力转向开发者体验。

:paperclip: 来源:MarkTechPost, OpenAI官方


4 | ChatGPT Sites 公测:将工作成果转化为可分享的交互式网站

OpenAI推出ChatGPT Sites公测版,用户可在ChatGPT中将工作成果转化为仪表盘、项目追踪器、原型、内部门户等交互式网站,并通过URL公开分享。Business和Enterprise客户可公开发布Sites,Pro/Pro Lite/Edu用户也将在数日内获得访问权。

:paperclip: 来源:OpenAI官方


5 | LG CNS 与 PhysicsX 合作推进数字孪生解决方案

韩国LG CNS与物理AI公司PhysicsX签署合作协议,将数字孪生技术应用于工业场景模拟。此举反映了物理AI在制造业中的商业化加速趋势。

:paperclip: 来源:PhysicsX官方


6 | SK AX 数字孪生+VLA模型:机器人部署前在虚拟空间完成数千次场景验证

SK AX的"制造RX"方案中,数字孪生阶段基于实际工厂图纸、设备布局、工人动线、物料流和工艺条件,在虚拟空间实时模拟质量变化。机器人在部署前需完成数千次驾驶和作业场景的反复验证,评估质量控制变量、瓶颈区间、碰撞风险和充电调度。

:paperclip: 来源:朝鲜日报


7 | Adobe Firefly 集成 Gemini Omni Flash:语音指令编辑视频

Adobe在Firefly中集成了Google Gemini Omni Flash,支持通过语音指令进行视频编辑(如调整灯光、机位等)。同时,第三方模型如ChatGPT、Google Imagen 3和Veo 2也已可在Firefly环境中使用。Adobe正从单一模型策略转向多模型策略。

:paperclip: 来源:Borncity


:bar_chart: 今日要点速览

赛道 关键事件 信号
AI大模型 GPT-5.6三款齐发,Agent基准碾压 模型竞争进入"三档定价"时代
AI软件 ChatGPT Work + Sites + 桌面三合一 OpenAI要做"AI版Office"
人形机器人 Optimus Gen 3定型+死命令 量产元年,不再是demo
自动驾驶 Waymo去安全员+4城扩展 Robotaxi从试点进入商业化
世界模型 Cosmos-2.5开源+Runway登顶 物理AI基础设施加速落地

:brain: 编辑点评

今天的AI圈有一个清晰的信号:从"模型发布"到"平台发布"。

昨天GPT-5.6解禁是模型新闻,今天ChatGPT Work + Sites + 桌面三合一是平台新闻。OpenAI正在做的事,是把ChatGPT从一个"对话框"变成一个"操作系统"——你可以在里面聊天、写代码、做PPT、建网站、定时任务、连接所有工作工具。

这和微软的Copilot有什么不同?Copilot嵌在Office里,ChatGPT Work嵌在"所有工具"里。而且Copilot三年采用率不到4.5%——说明企业需要的不是"Office里多了个AI按钮",而是"一个能跨工具自动干活的Agent"。

另一边,物理世界的进展同样惊人。特斯拉Optimus终于从"概念"走向"产线",Figure 01已经在BMW量产线上干活了,Nature论文证明人形机器人可以做微创手术。Cosmos-2.5开源+Runway Gen-4.5登顶,世界模型/物理AI赛道正在从学术走向工程。

一句话总结:AI的下半场不是"谁的模型更聪明",而是"谁能帮你把活干完"。


:date: 未来一周关注点

日期 事件
7月10日(今天) GPT-5.6全系列正式上线;ChatGPT Work桌面端上线
7月12日 BLG vs 败者组,MSI决赛(与AI无关,但汉哥可能关注)
7月16日 长鑫科技科创板IPO申购(295亿元,科创板第二大)
7月17日 Gemini 3.5 Pro 发布;WAIC开幕(上海,7.17-20)
7月31日 FTC"AI隐藏输出调整"新规征求意见截止
持续 特斯拉Optimus供应链产能爬坡进展
持续 Waymo年底100万次/周目标推进

本早报由西潮 West Tide 编辑团队出品
Global AI Intelligence · Daily Edition
© 2026 Physix Frontier · bbs.physixfrontier.com


:ocean: 西潮 West Tide — 物界前沿旗下海外AI资讯专栏

西潮东引,一手前沿。

© 2026 Physix Frontier · bbs.physixfrontier.com

1 条回复

?
Ctrl + Enter 快速回复
高明哲
高明哲7月24日(已编辑)

Sol在SWE-Bench Pro上翻车,OpenAI还甩锅题目有缺陷,这让我想起去年客户现场实测某旗舰模型,散热压不住直接降频,跑分比实验室低一截。Sol的5/30定价,实际功耗和散热成本得掂量。

🌐 西潮 West Tide · 2026年7月10日 · AI早报 - 物界前沿论坛