
当具身智能摆起擂台,算法和硬件谁更焦虑?
这篇文章最有价值的信息是,具身智能赛道正从“纸上谈兵”进入“肉搏战”阶段,而这场肉搏暴露了学术界和工业界长期忽视的一个核心矛盾:强化学习在仿真环境里跑得再漂亮,到了真实世界可能连一颗螺丝都拧不紧。
宇树机器人在展台中央摆出擂台,把自家机器人拆得七零八落,零部件散落一地。这看起来像行为艺术,实际上是一种技术宣言——我们不怕你拆,因为我们的硬件模块化、可替换,甚至欢迎你来看内部结构。而魔法原子工作人员在背后吐槽银河通用“挺拉的”,则直接把暗流涌动的鄙视链抬到了台面上。
这两条信息放在一起,恰好勾勒出演进的两种路线:宇树代表的是硬件优先、控制次之的工程派,而银河通用代表的则是端到端大模型驱动的算法派。作为强化学习方向的研究者,我不得不承认,这两个路线在实验室里经常被放在一起讨论,但到了产业展会上,它们之间的裂痕比想象中更深。
宇树的思路很直接:先把机器人的本体做到极致,关节电机、减速器、传感器都模块化,坏了能换,成本可控,然后在这个硬件平台上跑经典的控制算法,再加一些强化学习的策略层。这种做法的好处是,你不需要依赖一个黑盒大模型来理解物理世界,机器人的每一步动作都有明确的物理约束。坏处是,泛化能力差,换个场景就要重新调参。但宇树似乎不在乎,他们赌的是工业场景和家庭场景的标准化程度足够高,不需要那么强的智能。
而银河通用这类公司走的是另一条路:用大模型把视觉、语言、动作全部串联起来,让机器人看到一个物体、听到一句指令,就能自己生成动作序列。这非常性感,也是我博士课题的核心方向。但问题在于,端到端训练出来的策略在仿真环境里表现惊艳,到真实环境里就可能因为一个螺丝松动、一个关节摩擦系数变化而彻底崩溃。魔法原子的吐槽,某种程度上戳中了这个痛点——实验室里跑出来的demo,在展会上被拆了台,不是技术不行,是真实世界的鲁棒性还没到商业化门槛。
从我的研究视角来看,这两个路线其实直面的是同一个问题:强化学习在真实物理世界中的样本效率和安全边界。在仿真里,我们可以用GPU集群一天跑几百万个episode,随意探索,随意失败,然后通过reward shaping教会机器人最优策略。但在真实世界,一次跌倒就可能损坏电机,一次碰撞就可能伤人。宇树选择用硬件可靠性来降低这种风险,银河通用选择用更强大的模型先验来减少探索次数。两条路都有道理,但都没有完全解决“从仿真到现实”的迁移鸿沟。
我最近在看的一篇论文——Google DeepMind的RT-2系列——其实在尝试融合这两种思路。他们用互联网规模的视觉语言数据训练一个大的policy backbone,再通过少量真实数据fine-tune。但问题在于,这种fine-tune需要大量高质量的真实机器人数据,而真实数据的采集成本远高于仿真。宇树把硬件拆给你看,潜台词是“我的数据可以低成本采集”,银河通用则可能还在为收集一个抓取动作的失败案例而发愁。
另一个值得注意的细节是,宇树摆擂台这件事本身,就是一个硬件的营销行为,但背后折射出算法公司普遍缺乏的“物理检验”。很多做算法的人,包括我自己,习惯了在调参时只看reward曲线,忽略了机器人关节的扭矩极限、电池的续航衰减、甚至螺丝的防松设计。实验室里,我们可以用恒温恒湿环境、用高精度定位系统、用无限次reset,但展会上的高温38°C、地面不平、观众围观,才是最真实的测试环境。
导师让我试一下,把强化学习策略直接部署到宇树的硬件上,看看能不能跑通一个简单的开门任务。我猜结果会很有趣——策略在仿真里能100%成功,但一旦电机初始位置有1%的偏差,可能就卡住了。这不是算法的问题,是仿真环境过于理想化。宇树的擂台,其实是在提醒我们这些做算法的,别把物理世界当成黑盒。
我不打算给两条路线分高下,因为他们最终都会走向融合。
原文链接:https://www.tmtpost.com/8069915.html
物界前沿