社区讨论 · 政策

1.5B参数开源VLA:效率突破还是数据幻觉?

因子矿工因子矿工7月20日2026/07/20 68 浏览

我注意到一个有意思的细节,面壁智能发布的MiniCPM-Robot系列模型,参数规模只有1.5B,却宣称“冲进具身智能第一梯队”。在量化领域,我们习惯于用夏普比率、最大回撤等指标评估策略,而面对一个模型,第一反应是:它的训练数据量级是多少?评估基准是什么?样本外泛化能力如何? 如果这些信息缺失,任何“第一梯队”的标签都只是营销上的alpha,而非实际的技术alpha。

模型规模与性能的悖论:当1.5B试图挑战7B

从公开信息看,MiniCPM-Robot是视觉-语言-动作(VLA)模型,面壁智能强调其“小参数、高效率”。但这里有一个关键问题:VLA模型需要同时处理视觉、语言和连续动作空间,参数量与任务复杂度之间是否存在一个经验下限?

模型 参数量 任务类型 代表性基准
RT-2 (Google) 55B 机器人操作 616个任务,成功率97%
PaLM-E (Google) 562B 具身推理 多模态推理
MiniCPM-Robot 1.5B 通用操作 未公开标准化benchmark

1.5B参数是否足够?从信息论角度看,一个通用VLA模型需要编码视觉特征、语言指令、动作序列以及它们之间的复杂映射关系。如果模型容量不足,可能存在过拟合训练环境的风险——在特定场景下表现良好,但换一个光照条件、物体位置变化,成功率可能断崖式下降。量化研究员都知道,样本内回测漂亮不等于样本外有效,具身智能领域同样如此。

面壁智能声称“第一梯队”,但未提供与RT-2、PaLM-E在同任务上的A/B测试结果。如果仅在自建数据集上评估,且未公开数据分布细节,那么这种说法缺乏统计显著性检验。我们需要看到:在多个标准基准(如CLIPort、BEHAVIOR-1K)上的零样本迁移成功率,以及在不同机器人本体(不同机械臂、不同抓取器)上的泛化表现。

数据质量:开源VLA的最大隐忧

作为因子挖掘从业者,我深知数据质量直接决定模型性能上限。MiniCPM-Robot是开源模型,这本身是好事,但开源VLA面临一个核心矛盾:高质量机器人操作数据极度稀缺,且获取成本极高。

[!note]
一个典型的机器人操作数据集,需要真实环境部署、人类遥操作、多视角相机采集、精细化标注。公开数据集如BridgeData v2 约6万条轨迹,而RT-2使用了大模型蒸馏和互联网数据增强。1.5B参数模型若想泛化,训练数据量级至少需要达到百万级轨迹。

面壁智能可能采用了三种策略之一:

  1. 仿真数据为主:仿真环境(如ManiSkill、RLBench)生成的数据具有低成本、高多样性优势,但存在sim-to-real gap。量化中类似“模拟回测”与“实盘交易”的差异。
  2. 知识蒸馏:从大模型(如7B或13B的VLA)中蒸馏知识到小模型。这要求先有一个强大的教师模型,但面壁智能并未提及。
  3. 数据增强:通过视觉变换、语言指令重写等提高数据效率。但动作空间(连续关节角度或末端位姿)难以通过简单增强获得多样性。

如果训练数据全部来自公开数据集(如Open X-Embodiment),而这些数据集本身存在偏差(比如多数任务都是桌面拾取放置),那么1.5B模型很可能只是记住了分布内模式,而非真正理解物理世界。量化研究中,我们常通过K-fold交叉验证和Walk-forward分析来评估过拟合,在具身智能中,类似的评估方法应该是在不同背景、不同光照、不同物体替换下的成功率 decay 曲线。

从因子挖掘视角看具身智能的评估风险

在私募做因子挖掘时,我们最怕的是幸存者偏差和前视偏差。具身智能领域同样存在类似的评估陷阱:

  • 任务选取偏差:只展示成功案例,失败案例被剪辑掉。视频中展示的“拿杯子、开抽屉”是典型任务,但若遇到抽屉卡住、杯子滑落等情况,模型如何应对?需要报告成功率的置信区间。
  • 环境过拟合:训练环境与测试环境高度相似。量化中,我们严格区分训练集、验证集、测试集,且测试集必须包含不同市场状态。具身智能的测试集也应该包含分布外场景(如不同颜色、不同纹理、不同光照、动态干扰)。
  • 动作空间量化误差:机器人动作往往是连续的,模型输出是离散化后的动作token。1.5B模型如何编码连续动作?如果采用离散化bin,粒度过粗会导致动作

原文链接:1.5B开源通用VLA模型,冲进具身智能第一梯队 – 量子位

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧