场景赛的金牌,比百米冲刺更有含金量
我注意到一个有意思的细节:第二届世界人形机器人运动会,智元精灵 G2 拿了两金三银两铜,两块金牌分别来自消防应急和图书管理,恰恰是场景赛里最不起眼的两项。场馆里不少观众围在百米赛道旁边看机器人冲刺,但真正让我驻足的,是图书场景里那个把书从货架拿下来、翻到指定页码、再放回原位的机械臂动作。慢,但稳。
这届赛事把场景赛从 6 项扩到 21 项,占全部 51 项的四成以上,报名队伍 666 支,场次翻了一倍多。竞技赛的规则很好理解:跑得比别人快、举得比别人重、踢得进球门,全是可量化的指标。场景赛不一样,它考的是「能不能把一个长流程完整走下来」。货架识别、路径规划、抓取姿态、放回位置,中间任何一环掉链子,前面全白干。从我这边看,竞技赛比拼的是机器人的上限,场景赛测的是它的下限。
我在实验室带学生做蛋白质结构预测时,经常遇到类似的问题。AlphaFold3 在同源建模的标准数据集上跑出不错的准确率,一换到新蛋白、新底物,结果就垮一半。原因在于标准集里的样本分布是光滑的,真实场景充满长尾:某段序列就是和已知结构不像,某些 loop 区域就是比训练集里所有样本都别扭。机器人也是一样。场馆里跑得再稳的机器狗,换到铺着地摊、光线忽明忽暗的家里,可能连门槛都过不去。所以「场景赛」这个设计本身,就是行业在替产业化回答一个问题:机器人在非理想环境下,到底能扛住多少不确定性。
这届运动会把 100 米改成了全自主项目,场景赛也要求全自主定位、识别与操作。全自主意味着容错率被拉低了,以前出了问题人可以远程接管,现在规则要求你把判断权交给模型本身。裁判和观众看得见的是机器人拿没拿稳一本书,看不见的是这个动作背后,从视觉语言模型到运动控制指令的决策链路。我对这条链路太熟了,输出格式但凡有一点不稳定,下游一个抓取动作就不知道偏到哪里去。结构化指令加字段校验,这套做法在机器人控制里同样适用。先锁死接口,再谈智能,顺序不能反。
所以我不太认同「拿了奖牌就能拿订单」这个口号,它只对了一半。奖牌证明的是机器人在设定条件下能完成任务,但订单需求端往往是「在场馆里能跑,不等于在仓库里能用」。供电、网络、光照、货架间距,环境里任何一个变量变了,模型可能就需要重新微调。不过反过来想,人形机器人公司愿意把比赛当自己的训练场,这个信号本身比名次更值钱——与其在虚拟环境里刷一万个回合,不如在真实场景里设三十道难题。出赛场就能进现场,这个标准对现在的行业来说仍然偏高,但方向是对的。
至于奖牌能不能换订单,那是后话。这届运动会把场景赛比重拉这么大,至少说明行业在认真对待这件事。
物界前沿