62.6% 的真相:当机器人学会“抄作业”,我们该慌还是该学
社区讨论 · 政策

62.6% 的真相:当机器人学会“抄作业”,我们该慌还是该学

刷题中刷题中7月19日2026/07/19 62 浏览

刚看到这个数据的时候,我差点以为自己看错了——RoboCasa-365 榜单,新纪录 62.6%,比之前最好的结果整整高出 8.4 个百分点。要知道,这个榜单上大部分模型还在 50% 以下挣扎。黎曼动力的 Riemann-1.0 靠的是看了 20 万小时人类干活实录,说白了就是让机器人“抄作业”。作为一个正在刷 LeetCode 准备 AI 算法岗面试的应届生,我第一反应不是佩服,而是好奇:这个技术路线,面试会问吗?如果会,我该怎么答?

我仔细读了一下新闻,发现这个方案的核心思路其实很朴素:用大量人类操作视频作为训练数据,做行为克隆(Behavior Cloning)。但 20 万小时这个数字太吓人了,相当于一个人连续干 22 年家务。如果换成我每天刷题,刷到 20 万小时,大概能刷 600 万道 LeetCode——当然,这不可能。所以问题来了:为什么数据量这么大,效果才刚过 60%?为什么其他模型用更少的数据,也能做到 50% 左右?这里面的差距,可能正是面试官想考察的。

为了理解这个,我想拿两个方案做个对比。一边是黎曼动力的“数据堆砌”路线,另一边是很多学术团队常用的“仿真+强化学习”路线。比如之前 SOTA 的模型,可能用了更精巧的奖励函数设计,或者用仿真环境生成大量多样化的数据,再通过域随机化迁移到真实场景。这两种路线最大的区别在于:一个是直接模仿人类,一个是让机器人自己摸索。

模仿学习的好处是上手快,数据收集相对容易(网上有无数人类做家务的视频),而且行为看起来自然。但它的核心瓶颈是“分布偏移”——训练数据里没有的场景,机器人很容易出错,比如换个抽屉方向或者光照条件,可能就抓瞎了。这也是为什么 20 万小时的数据下,准确率才 62.6%,说明还有大量边缘情况没覆盖到。而强化学习的路线,虽然可以探索更广的状态空间,但奖励函数设计很难,而且仿真到真实的迁移仍然是个大坑。

我最近在准备面试,刚好看到一些大厂面经里提到这类问题:如何平衡数据规模和模型泛化能力?如何设计一个能处理长尾分布的机器人学习系统?说实话,我原来觉得刷了 300 道 LeetCode 就够应付了,现在发现真正前沿的 AI 面试题,往往是从这种最新论文里出的。而且黎曼动力这次把数据规模做到这么大,其实在暗示一个方向:数据量足够大时,简单的模型也能出效果,就像 GPT 系列那样。但机器人领域,sim-to-real 的鸿沟比 NLP 大得多,20 万小时的人类数据,成本真的值得吗?

换个角度想,这个结果其实也说明,单纯靠“看视频”来学,可能永远达不到 100%。因为人类干家务时有很多隐藏信息——比如手感、力度、温度变化,这些在 2D 视频里根本看不到。新闻里说这是“家务大考”,但真实的家务场景比 RoboCasa 复杂得多,比如打碎一个鸡蛋怎么办?这种小概率事件,20 万小时里可能只有一次,模型根本学不到。

作为求职者,我最大的学习心得是:不要迷信“大就是好”。数据量的提升固然重要,但如何低成本获取高质量数据,如何设计更高效的模仿学习算法(比如利用预训练视觉模型、结合少量强化学习微调),可能是更值得关注的面试热点。我最近就在看一些论文,比如用 diffusion policy 做机器人动作生成,或者用世界模型来预测未来状态,这些方向可能比单纯堆数据更有前景。

最后,给和我一样在准备 AI 算法岗面试的朋友一个行动建议:看完这篇新闻,立刻去搜一下黎曼动力的技术报告或论文,重点看他们的模型架构、数据收集方式和失败案例分析。如果能复现一个简单的模仿学习项目,比如用 UR5 机械臂学一个开抽屉的动作,放到简历上会非常加分。面试官大概率会问:“给你 100 小时的人类数据,你怎么设计一个能做家务的机器人?” 现在,你至少可以回答:先看看 Riemann-1.0 是怎么做的,再想想怎么改进它的泛化能力。

原文链接:https://www.qbitai.com/2026/07/454592.html

1 条回复

?
Ctrl + Enter 快速回复
瑶瑶选品
瑶瑶选品7月28日(已编辑)

这个问题我懂,做跨境选品时也遇到过类似瓶颈——数据堆到一定程度,边际收益就陡降。62.6%说明单纯靠堆数据解决不了长尾分布,得配合主动学习或者数据增强。