
具身智能的“设计系统”缺位,投资人正在补课
上周在深圳一个闭门展示会上,我亲眼看到一个双臂机器人试图把螺丝刀放进工具箱。它花了三秒识别目标位置,又用两秒规划轨迹,最后在距离螺丝刀槽口还有五毫米的地方卡住了——机械臂抖动了两下,然后缓缓退回原位。旁边的工程师赶紧解释:“这个场景的demo数据还没喂够。”投资人却已经掏出手机拍下这一刻,小声对同伴说:“数据采集现在是个大问题。”
我站在旁边,职业病犯了。这个场景让我想到我们的设计系统搭建初期:组件库建好了,但缺少真实业务场景的数据填充,设计师画出的界面永远“差一点意思”。具身智能的困境,本质上是一个交互设计问题——只不过用户是机器人,而交互界面是物理世界。
[!quote]
具身智能拼到今天,拼的已经不是谁的机器人会摆pose,而是谁的机器人真的会干活。
这句话说到了点子上。摆pose只需要美观,干活需要的是交互流程的闭环。而数据,正是让这个闭环跑起来的“像素级规范”。
数据:机器人交互的“设计系统”
做UI/UX的人都知道,设计系统不是一堆按钮和颜色拼在一起,它需要定义状态、行为、反馈机制。同样的道理,机器人要“会干活”,也需要一个类似的数据系统:每个动作的起始状态、中间过渡、异常处理、完成反馈。
但现实是,大部分机器人目前的数据就像十年前的设计稿——杂乱无章,充满噪音。一个机器人的训练数据可能来自不同传感器、不同场景、不同标注标准,就像设计师从各个项目里零散收集的组件,没有统一命名的变体,没有间距规范,没有交互逻辑文档。
这张图里展示的是AI姿态变换生成的数据,虽然看起来是“模拟”的,但它背后反映了一个关键问题:数据质量比数据量更重要。一个关节角度偏差0.5度,在视觉上可能看不出区别,但在实际物理交互中,机械臂就可能抓不住杯子,或者拧不开瓶盖。这就像UI设计里,一个像素的间距偏差,用户不会注意到,但整个组件的视觉重量就歪了。
投资人现在开始研究“喂饭”,本质上是在考察数据的设计系统是否成熟。XDOF拿到7000万美元融资,硅谷老钱加速入场,不是因为他们的机器人造型更酷,而是因为他们能拿出结构化的、可复用的、带标注的交互数据。这就像我们评价一个设计系统好不好,不是看Sketch文件有多少图层,而是看它能不能让一个实习生快速搭出可用的页面。
从摆pose到真正干活:交互流程的优化
我见过太多机器人demo:在封闭实验室里,它们能完成精准的抓取、流畅的行走、优雅的避障。但一旦放到真实环境,比如一个堆满杂物的厨房,或者一个光线变化的工厂,就立刻“失智”。这背后的原因不是算法不够先进,而是交互流程的边界条件没有被数据覆盖。
设计系统里有一个概念叫“极致状态”(edge case),比如按钮的loading状态、网络断开时的反馈、数据为空时的占位符。机器人也需要类似的“状态设计”:当螺丝刀歪了3度怎么办?当光线被遮挡怎么办?当目标物体表面有反光怎么办?这些在真实场景中必然出现的问题,如果训练数据里没有对应的样本,机器人就会像没有写异常处理的代码一样,直接崩溃。
投资人眼中的“数据”,其实是在寻找一个完整的交互流程数据集。这个数据集不仅要包含成功的操作,还要包含失败的操作、纠正的操作、过渡的操作。就像我们做用户测试时,不仅要记录用户成功完成任务的路径,还要记录他们犹豫、回退、误操作的过程。这些“坏数据”反而能教会机器人如何应对真实世界的混乱。
而现在的行业现状是,大多数机器人公司还在用“摆 pose”的方式收集数据——让机器人在固定场景下反复执行同一动作,录下来,喂给模型。这就像设计师只画了静态的组件图,却没有定义hover、active、disabled的交互状态。这样的数据,养出来的机器人只会“表演”,不会“干活”。
趋势预测:下一个风口是“数据设计师”
如果具身智能要真正落地,接下来的行业变化会非常明确:会出现一个专门负责“数据体验”的角色。这个角色不是数据科学家,也不是机器人工程师,而是一个懂交互、懂场景、懂设计系统的中间人。
在字节跳动,我们有一个“设计规范工程师”的岗位,专门负责把设计系统的组件翻译成开发语言,确保每个像素在代码里都正确。未来机器人行业也会出现类似角色:他们需要定义每个动作的数据采集标准,设计数据标注的模板,优化数据集的“用户体验”——让机器人更容易从数据中学习。
投资人现在急着“喂饭”,本质上是看到了这个趋势。他们投的不是机械臂、不是电机、不是
原文链接:https://www.tmtpost.com/8068658.html
物界前沿