
Helix 这模型搬不回家,我换了个法子测
被朋友安利了 Helix。他在一家人形机器人集成公司干活,微信上甩过来一段视频,说 Figure 的机器人进了客户家里,自己找东西自己拿,让我看看是不是吹的。
我说行。但得先把话说清楚,Helix 不是能下载的 App,也不是能搬回家的硬件。它是 Figure AI 的一套视觉语言动作模型,通俗点说,就是装在人形机器人脑子里的那套决策系统。视觉语言动作,英文缩写 VLA,意思是它能同时处理看到的画面和听到的话,然后直接输出动作,中间不用人再翻译一遍。它跑在 Figure 03 这台机器人身上。我手里没有 Figure 03,国内也不太好弄到。
所以我换了个法子,蹭他的实验室泡了一下午。我自己拍机器狗视频有一阵了,人形机器人也上手一个来月,看这套东西不算完全外行。
他们公司没代理 Figure,但攒了不少一手资料,还有一段客户现场的操作录像。我看到的操作端比想象中简单,就是一个输入框,敲一句「把桌上的东西收进冰箱」,机器人自己去拆步骤,拆完执行。朋友让我自己敲两条,一条拿杯子,一条把散落的东西归拢到一处。杯子那条成了,归拢那条卡了一下,机器人对着一个软包装犹豫了几秒才动手。
Helix 最核心的设计是双系统。一个叫 S2,负责理解场景和语言,思考频率大概每秒七到九次。另一个叫 S1,负责把想法变成具体动作,每秒能跑两百次。这套设计的意思就是,慢的那个想大方向,快的那个管手上别抖。录像里两台机器人一起搬东西,一台转身,另一台立刻跟着调姿态,那一下确实顺。
惊喜的地方在泛化。官方演示里它拿过一个之前没见过的仙人掌,带刺的、形状不规则的,照样能抓起来。它是靠模型自己认,没提前把每个物体都编进程序。我朋友说他们内部复现时也试过没见过的日用品,成功率比他预想的高。
卡住的地方也很实在。S2 每秒七到九次这个频率,意味着它的理解是有间隔的,遇到需要立刻反应的场面,只能靠 S1 硬顶。早期版本的 Helix 只控制上半身,三十五个自由度上下,腿是另一套东西在管,后来才出的全身版本,把走路、平衡和操作并到一个网络里。还有就是场景一变,表现会掉。换个房间布局、换套灯光,同一件事就得多试几次。
我这边测下来最直接的感受是,它把听懂人话和动手干活接成了一条链,但这条链还不够粗。它值不值得你关注,取决于你手里有没有一台能跑它的机器人。
它做得好的地方有几个。自然语言直连动作,不用为每个任务单独训一遍,这是真的省事。泛化抓取在同类里算靠前。多机协作那段不是剪出来的效果,逻辑上说得通。问题也很实在,延迟感明显,对突发情况的处理还嫩,接触门槛极高,个人和小团队基本没戏,换环境掉点这件事说明它离稳定还差一截。
所以结论是看情况。做家庭服务机器人、手里有整机团队、需要泛化抓取能力的,值得盯着它,把它的技术路线当参照物。想快速做 demo 卖货的小团队,别对标它,你的数据闭环撑不住这套玩法。至于像我这样的内容创作者和个人用户,短期内它跟你没关系,看看演示就够了。
真要我给个建议,如果你在做具身智能,别急着追 Helix 的演示效果,先问自己一个问题,你手上有多少小时的自家场景数据。模型再强,没有数据喂它,它也只是一段视频。
物界前沿