社区讨论 · 政策

具身数据采集:5S店模式能跑通吗,还是合成数据才是终局?

黑产克星黑产克星7月26日2026/07/26 91 浏览

一年融资44.7亿,近百名玩家挤进具身数据赛道。这个数字让我想起2020年AI标注行业的疯狂——当时也是几百家标注公司拿到融资,结果一年后90%的尾款都收不回来。

核心判断:具身数据采集的商业模式,目前还卡在“数据质量 vs 采集成本”的剪刀差上。5S店模式看似降低了入场门槛,但真正能靠卖数据赚钱的,不会是那些在营业厅里摆几副手套的玩家,而是能控制数据噪声、保证标注一致性、且具备规模化复现能力的小团队。

先看新闻里描述的5S店模式:普通顾客领一套夹爪、手套和头戴相机,经过培训就能边做家务边采集数据。首期投放10套设备。这个模式的工程问题是:

  • 数据噪声控制:普通顾客的采集动作不规范,手臂抖动、夹爪抓取角度偏差、相机视角遮挡,这些都会产生大量低质量帧。在反欺诈领域,我们处理过类似问题——用户行为数据若不做实时校验,误报率能高到50%以上。具身数据的采集,如果没有实时质量反馈机制,最终10%的有效数据可能都不到。
  • 标注一致性:不同人对“拿起杯子”这个动作的起止点定义不同。有人从手接触杯体开始算,有人从施加力开始算。标注不一致会导致模型训练时梯度冲突。在工业界,标注一致性通常需要做到95%以上才能保证模型收敛,而5S店模式下的众包标注,能到70%就是极限。
  • 场景覆盖度:营业厅模拟的家居环境太单一。真实场景的鲁棒性要求数据包含光照变化、遮挡、物体排列随机性。5S店采集的数据,大概率是“干净但窄”的场景,像极了早期人脸识别数据集——所有人都是正面无遮挡,一旦侧脸就崩。

对比合成数据路线的玩家(比如NVIDIA的Isaac Sim、国内几家做仿真引擎的创业公司),工程可行性差异更明显。我列个对比表:

维度 5S店规模化采集 合成数据+域迁移
单条数据成本 约2-5元(含设备折旧+人工) 约0.01-0.1元(算力成本)
数据标注质量 低(70%一致性) 高(99%自动标注)
场景多样性 中(受限于物理空间) 高(无限随机生成)
隐私合规风险 高(采集人脸、室内环境) 低(无真实人物)
模型迁移效果 需要大量真实场景微调 需要解决sim-to-real gap

关键数字: 合成数据虽然单条成本极低,但sim-to-real gap的解决需要额外投入。目前最好的域迁移技术,也只能将仿真数据的泛化率做到85%左右,剩下的15%必须靠真实数据补。这意味着,5S店模式的核心价值不是“卖数据”,而是“卖那15%的真实场景补充”。

但问题在于,这15%的真实数据,能不能支撑起一个独立商业模式?看看数据:一年44.7亿融资,按平均每家5000万算,也有近90家拿到钱。可目前具身智能本身还在早期,真正能跑通全链条(数据采集+模型训练+机器人部署)的公司,不超过10家。大部分数据采集公司,其实是在给这10家公司做“数据外包”。

从风控工程师的视角,这种外包模式有两个致命缺陷:

第一,数据复用性差。 不同机器人厂商的传感器型号、控制接口、动作空间都不同。A公司采集的数据,B公司必须重新做标注转换。这就像当年反欺诈领域,各家银行自己搞黑名单库,结果数据格式不统一,交换成本高到没人愿意做。最终只有标准化程度最高的头部玩家(比如特斯拉的Optimus)能形成数据飞轮,其他人只能吃残羹。

第二,数据长尾效应。 具身智能最缺的不是“拿杯子”这种常规动作,而是“从倾斜的抽屉里取出被压住的书”这种罕见场景。5S店模式无法高效采集这些长尾数据,因为普通顾客不会遇到这种极端情况。而仿真环境可以配上随机物理引擎,直接生成上万种意外场景。

数据化结论: 如果按“有效数据帧”计算,5S店模式的实际产出成本可能被低估。假设一个顾客采集1小时,生成3600帧,但其中因抖动、遮挡、标注错误导致的无效帧占70%,有效帧仅1080帧。按成本5元/帧算,有效帧成本高达46元/帧。而合成数据即使算上域迁移的额外开销,有效帧成本也控制在0.5元/帧以内。差距接近100倍。

所以,真正能靠卖数据赚钱的,应该是那些同时具备仿真引擎和真实场景采集能力的公司。他们用合成数据做80%的“基础训练”,再用5S店模式补充15%的“真实微调”,最后5%的“极端场景”靠定制化采集(比如找专业运动员模拟摔倒动作)。这种组合拳,才能把数据成本压到可接受范围。

但问题来了:当具身智能进入规模化部署阶段,这5%的极端场景数据,会不会成为决定模型安全性的关键瓶颈? 就像金融反欺诈

原文链接:近百名玩家涌入具身数据:一年融资44.7亿,谁能真靠“卖数据”赚钱? – 量子位

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧