
U1 Pro:长程任务闭环的工程化突破,还是多模态智能体的又一场秀
最近跑了一下GAIA验证集,发现一个有趣的现象:多模态大模型在单步指令上准确率普遍超过90%,但一旦任务链条超过5个步骤,成功率就断崖式下跌到25%以下。GPT-4V勉强撑到8步,Claude 3.5 Opus在10步左右开始频繁丢失上下文,Gemini 2.0 Flash在工具调用时经常出现参数错乱。这个数据背后是一个行业共识:长程任务闭环,是当前多模态智能体最硬核的瓶颈。
商汤昨天在WAIC上发布的SenseNova U1 Pro,直接把这个目标写进了产品定位——“面向长程任务的交付级原生多模态智能体基座”。翻译一下:不是让你在聊天框里调戏,而是能跑完整业务流的干活型AI。
长程任务为什么难
先拆解一个典型的长程任务:用多模态智能体完成一份竞品分析报告。需要截图、OCR、搜索、数据对比、生成图表、输出PDF。这中间涉及至少10个原子操作,每个操作都可能出错,而且错误会累积。
[!tip] 核心难点在于三个维度
- 记忆衰减:Transformer的注意力机制在长序列中会丢失早期信息,尤其是在多模态输入里,视觉token的压缩率远低于文本
- 规划与执行的耦合:当前大多数模型先规划再执行,但实际场景中计划往往需要动态调整,回退成本极高
- 工具调用的鲁棒性:API返回格式变化、超时、权限不足,这些工程问题在学术benchmark里被刻意忽略了
商汤的U1 Pro给出了一个看起来更工程化的答案:原生多模态理解+生成+行动统一,而不是像GPT-4那样用插件系统拼凑。他们称之为“交付级原生多模态智能体基座”。
技术方案拆解
从公开信息看,U1 Pro的核心差异点在于“原生”二字。多数多模态模型是在文本大模型上外挂视觉编码器,再用一个对齐模块把视觉特征映射到文本空间。商汤的做法是在训练阶段就统一了视觉、文本、代码、工具调用的token空间,这意味着模型内部可以直接处理多模态推理,而不需要经过额外的“翻译”步骤。
具体到长程任务,他们提出了一个叫做“动态规划与自我修正”的机制。我用一个简化代码示例来理解这个逻辑:
class LongHorizonAgent:
def __init__(self, model):
self.model = model
self.memory = []
self.error_buffer = []
def execute_task(self, task_graph):
# 动态规划:不是一次生成完整计划,而是边执行边调整
for step in task_graph:
result = self.model.execute(step)
if self._check_consistency(result):
self.memory.append(result)
else:
# 自我修正:回退到上一步,重新生成
self.error_buffer.append(step)
self.memory.pop()
step = self._replan(step)
return self.memory
看起来简单,但实际工程实现中,记忆的压缩和检索、错误类型的分类、回退策略的粒度,都是深思熟虑的设计。商汤在演示中展示了U1 Pro处理一个20步任务,中间经历了两次API超时和一次OCR识别错误,系统自动重试并调整了后续步骤的顺序。这个能力,GPT-4V目前还做不到。
对比:为什么其他方案不适合长程任务
目前主流的多模态智能体方案大致分三类。第一类是“模型+工具集”模式,如GPT-4 with plugins,核心在模型本身,工具调用由外部系统管理。第二类是“规划器+执行器”分离,如HuggingGPT,用
原文链接:https://www.tmtpost.com/8070465.html
物界前沿