两个“具身”的路线之争:WAIC上的规则引擎与端到端
社区讨论 · 政策

两个“具身”的路线之争:WAIC上的规则引擎与端到端

黑产克星黑产克星7月19日2026/07/19 67 浏览

WAIC第三天,我挤在浦东展馆的机器人区,旁边一个做自动驾驶的哥们儿正在吐槽:“你看这个抓取演示,五秒一个动作,比我们线上模型的latency还稳定。” 我盯着那台机械臂——它正用真空吸盘把一个易拉罐从A点挪到B点,动作精准但机械,像极了我们风控系统里那些跑了几年的固定规则:if 设备指纹黑名单 then 拒绝,if 交易金额>阈值 then 人工审核。

另一边的展台,具身智能的Demo正用自然语言指令控制机器人:“把桌上的苹果放到蓝色盘子里。” 机器人停顿了两秒,然后歪歪扭扭地移动夹爪,成功了一半——苹果滚到了盘子边缘。围观人群鼓掌,但熟悉黑产的我都知道,这种“两秒延迟”和“成功率九成”在真实生产环境里意味着什么。

两条路线:规则引擎的“可解释性” vs 端到端的“灵活性”

先看传统机器人控制。这就像我们做反欺诈的经典规则引擎——确定性、可审计、可回滚。一个典型的工业机械臂程序:

# 传统控制逻辑(伪代码)
def pick_and_place(object_position, target_position):
    if not gripper_status == "ready":
        return error("gripper not ready")
    approach_vector = object_position - current_position
    if norm(approach_vector) > safety_threshold:
        return error("approach too far")
    move_to(object_position, velocity=0.5)
    gripper.close()
    lift_up()
    move_to(target_position, velocity=0.3)
    gripper.open()
    return success

每个步骤都有边界检查,异常处理,日志输出。规则覆盖度可以量化,误报率可以压到0.1%以下。但代价是:只能处理已知场景,换一个零件就要重新标定参数。

再看大模型驱动的具身智能。这像我们最近在尝试的图神经网络异常检测模型,端到端,从视觉输入直接输出动作序列:

# 端到端具身模型(推理阶段)
perception = vision_encoder(camera_image)  # 256维特征
language_embedding = text_encoder("pick up the apple")  # 128维
joint_state = robot_state_encoder(joint_angles)  # 64维
action_tokens = transformer_decoder(perception, language_embedding, joint_state)  # 每个token控制一个电机
motor_commands = token_to_motor(action_tokens[-1])  # 最后一个token映射到执行

[!note] 核心差异:规则引擎的延迟是纳秒级的,端到端模型的推理延迟至少是百毫秒级。在物理世界,100ms的延迟就可能让机械臂撞上工件。

数据驱动的“黑产”问题:泛化与过拟合

WAIC上最让我感兴趣的是某公司的“柔性抓取”方案。他们用仿真数据训练了一个抓取姿态预测模型,宣称能抓取任意形状的物体。现场演示很完美——但我和他们工程师聊了聊,发现两个致命问题:

  • 仿真到现实的迁移鸿沟:仿真中摩擦力、光照、物体材质都是理想化的。真实场景中,一个沾了油的苹果和一个干燥的苹果,抓取策略完全不同。这就像我们风控的“样本选择偏差”——训练集里80%是正常交易,黑产样本只有1%,模型学到的是“大部分交易正常”,但实际部署时黑产会精准攻击那1%的盲区。
  • 规则覆盖度的“长尾”:演示中他们只展示了三四种物体。我问:“有没有测过不规则物体,比如剪子、钳子?” 对方沉默了两秒。这让我想起我们做规则引擎时的一个经验:任何规则集都有长尾,端到端模型只是把长尾从显式规则变成了隐式特征。黑产会找到那千分之一的特征组合,像对抗样本一样触发模型的最差结果。

工程落地:谁能在物理世界跑通?

现阶段,我倾向于认为“混合架构”才是现实路径。就像我们做反欺诈,先用规则引擎过滤掉90%的明确欺诈,再用深度学习模型处理模糊案例。在物理世界,可以这样分层:

1. 底层运动控制:用PID、轨迹规划等传统控制,保证安全性和实时性(毫秒级响应)

2. 上层决策:用大模型理解任务语义,生成粗略动作序列(秒级规划)

3. 中间层:规则引擎做“安全护栏”,校验模型的输出是否在物理约束内(比如关节角度、力矩限制)

拿风控场景类比:规则引擎是“拒绝列表”,深度学习是“风险评分”,混合架构是“先查拒绝列表,再打分,然后人工复核高风险”。

WAIC上还有一个展台展示了“机器人安全停靠”系统——当检测到人员靠近时,机器人立即降速并停止。这其实就是一个简单的规则:if 人体距离 < 50cm then 急停。用端到端模型去做这个判断,反而会因为推理延迟导致安全隐患。

最终,物理世界的AI竞争,不是模型参数量的竞争,而是工程容错率的竞争。黑产不会给你时间调参,产线不会因为你的模型“正在学习”就停止生产。

原文链接:https://www.qbitai.com/2026/07/454802.html

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧