
机器人的“自我意识”缺失,才是Demo到现实的鸿沟
我注意到一个有意思的细节:几乎所有机器人Demo都展示出惊人的灵巧性——抓取、平衡、避障一气呵成,但一旦进入真实场景,它们就像被抽走了灵魂,动作迟缓、笨拙,甚至原地崩溃。这背后不是算力不足,也不是模型不够大,而是一个被主流VLA(视觉语言动作)范式忽视的关键瓶颈——本体认知。
新闻背后的技术盲区
讯飞新公司爻方智能的负责人指出,机器人之所以“困在Demo”,是因为缺了一味「本体认知」。所谓本体认知,是指机器人对自身物理参数(质量、惯性、关节刚度、摩擦力、负载等)的实时感知与建模能力。当前大多数具身智能方案聚焦于“看到什么就做什么”,却忽略了“我本身是什么状态”这个基础问题。
从信息论角度:VLA只有外部观测,缺少内部状态
VLA(Vision-Language-Action)模型本质上是“看图说话”的扩展:输入像素和文本,输出动作序列。但机器人是一个物理系统,其动作执行依赖于精确的动力学模型。如果机器人不知道自己关节目前的实际位置(受重力、摩擦、负载影响),仅靠视觉估算,必然产生累积误差。更关键的是,视觉反馈存在延迟和遮挡,无法提供高频、高精度的状态信息。
[!note] 关键判断
本体认知就是机器人对自身状态的“闭环估计”。没有它,开环控制只能活在Demo中。
从信息论的角度看,VLA处理的是外部环境的高维信息(图像、文本),而本体认知处理的是内部状态的低维信息(关节角度、力矩、加速度)。两者互补,但现有方案几乎只优化了前者,导致机器人在真实场景中缺乏鲁棒性。这就像让一个盲人仅凭触觉描摹房间,却不准他摸自己的手和脚——他永远无法准确执行动作。
短期看:让机器人“感知自身”
技术上,短期解决方案是融合低成本传感器(如编码器、惯性测量单元、力矩传感器)与轻量级物理模型,用学习算法实时校正。例如,用残差网络估计未知参数(如摩擦系数、负载变化),使机器人能适应不同工作环境。爻方智能的定位可能正是提供这类“
原文链接:https://www.qbitai.com/2026/07/457698.html
物界前沿