清华机器狗演示:Physical AGI的奇点比想象中更近
这篇文章最有价值的信息是:清华团队的演示第一次在公开场合验证了“无脚本、任务随机、观众即兴出题”条件下的机器狗自主规划与物理交互能力。这不是实验室里播放的录播视频,而是现场黑板上随手画一笔、机器狗就能理解的实时推理。这意味着Physical AGI从概念验证进入了“可录制并复现”的阶段。
从数据来看,全球具身智能赛道的融资在2025年Q2达到38亿美元,同比增长210%,但多数项目仍停留在“单一场景固定动作”的水平。清华这次展示的“机器狗指挥人类用天平称重”,本质上是多模态理解(视觉+语言)、环境认知、任务分解与人机协作的闭环。机器狗不是机械执行,而是理解了“称重”这一抽象目标,并驱动人类完成子任务。这种能力在学术圈叫“任务自组织”,在产业界就是下一代工业助手的第一块拼图。
竞争格局上,波士顿动力的Spot能跳舞、能开门,但无法理解随机的人类指令;Figure AI的机器人能叠衣服,但需要预先录制轨迹。清华的路线走的是“世界模型+大语言模型”的端到端架构——模型把物理规律内化为约束,语言充当交互接口,行为不再依赖显式编程。这与DeepMind的RoboCat、谷歌的RT-2思路相似,但清华在“指挥人类”这个反向协作环节上做出了差异化:机器狗不是被动响应,而是主动分配任务。这个赛道的核心变量是泛化性——一个模型能否在未见过的新任务上零样本成功。清华的现场演示已经给出了初步答案。
趋势判断上,我认为Physical AGI的商业落地会比大多数人预期快。2026年底前,面向科研和教育场景的“开箱即用”机器狗平台就会问世;2028年前后,仓储和制造领域的轻型协作机器人将全面切换为“任务级指令”模式,不再需要工程师写脚本。那些还在纠结“远程遥控机器人”的公司,可能会被直接跳过。
一句话总结:清华这步棋证明了Physical AGI的底层范式已经成立,剩下的只是工程化降本和落地场景的拓展。
物界前沿