
私人厨师拍视频训练机器人:具身智能的“数据饥渴”与商业幻象
Shift 这家公司让私人厨师上门做饭,全程录像,然后用这些视频训练机器人。听起来很酷,但核心问题只有一个:这种数据采集方式,能解决具身智能落地的真实瓶颈吗? 我的判断是——不能,至少目前不能。
先看数据本身。Shift 的做法本质上是“自然场景行为录制”,即让真人做一遍任务,录下视频,再从中提取动作轨迹。这比传统遥操作采集(人戴 VR 手套操作机械臂)成本低得多,因为不需要昂贵的遥操作设备,也不雇专业操作员。但代价是什么?数据质量极度依赖场景一致性。一个私人厨师在陌生厨房做饭,动作是自然的,但机器人要学的是“拿锅铲”这个动作,而不是“这个特定厨房、这个特定角度、这个特定光照下的拿锅铲”。视频里包含大量无关信息(背景、人物影子、厨房布局),需要后处理清洗,而清洗成本往往被低估。
我做过一个简单对比:
| 数据采集方式 | 单条数据成本 | 动作精度 | 场景泛化能力 | 适用任务复杂度 |
|---|---|---|---|---|
| 遥操作 + 动作捕捉 | 高($50-100/分钟) | 亚毫米级 | 高(可刻意变化场景) | 高(精细操作) |
| 自然人视频录制 | 低($5-10/分钟) | 像素级 | 低(需大量数据覆盖) | 中(粗放操作) |
| 合成数据(仿真) | 极低($0.1/分钟) | 完美 | 中(受限于仿真引擎) | 中(特定任务) |
Shift 的厨师视频,表面看便宜,但要让机器人从这些视频里学到可泛化的技能,需要的视频量可能是遥操作数据的 100 倍以上。而且,机器人学习需要“动作-状态-奖励”三元组,视频里只有“动作-状态”,没有奖励(比如“菜炒好了”这个成功信号)。除非你雇人给每帧打标签,否则这就是一堆无监督的像素流,对训练策略网络帮助有限。
再看商业模式。Shift 宣称“让用户免费吃大餐,同时获得数据”,听起来像 Uber 的共享经济套路。但注意:Uber 获取的是标准化数据(路线、时间、评分),而 Shift 获取的是极度非标准化的厨房场景数据。每个用户的厨房布局、炊具品牌、食材摆放都不一样。即使收集了 10 万小时视频,真正能被机器人复用的特征可能只占 1%。除非 Shift 要求所有用户统一厨房设备(不现实),否则这些数据就是“脏数据”的海洋。
团队执行力方面,我查了一下 Shift 的背景:创始人来自 Google X 和 Uber,技术背景不错,但他们最大的问题是低估了“从数据到模型”的工程链路。收集视频只是第一步,后面还有:视频清洗、动作提取、场景分割、策略训练、仿真验证、真机部署。每一步都可能卡住。而且,这类数据采集方式很难规模化——你让厨师上门,一天只能拍 3-5 个家庭,每周 20 个视频。而一个具身智能模型要具备基本泛化能力,至少需要 100 万条高质量轨迹。按这个速度,要拍 10 年。
更关键的是,这种数据采集方式无法解决“长尾问题”。厨房里最难的任务不是炒菜,而是“开瓶盖”、“剥蒜”、“从冰箱里拿一盒鸡蛋”。这些动作需要精细力控制,视频里人的动作很流畅,但机器人学不到触觉反馈。Shift 的视频只能教机器人“轨迹”,教不了“力控”。而真正有价值的具身智能落地场景(比如养老助残、工业柔性装配),恰恰需要力控。
最后,给出一个明确的趋势预测:未来 12 个月内,Shift 这种“用免费服务换数据”的模式会先被资本吹捧,然后被现实数据效率打脸,最终转向混合方案——即用少量遥操作数据做精细动作,用大量视频数据做粗放感知,但视频数据必须来自可控场景(如标准化厨房样板间),而非真实用户家庭。 创业者如果真要搞数据采集,建议直接租用样板间,雇人做标准化动作,别折腾用户上门。自由职业厨房的“野性”数据,只会让算法工程师的头发掉得更快。
总结:Shift 的初心是好的——降低数据获取成本。但具身智能的瓶颈从来不是数据量,而是数据质量与场景覆盖的匹配度。免费吃一顿饭,换来的可能是机器人未来十年都学不会的“炒菜”。
原文链接:https://www.wired.com/story/i-let-a-private-chef-film-my-kitchen-for-robot-training-data/
物界前沿