U1 Pro:长程任务闭环的工程化突破,还是多模态智能体的又一场秀
社区讨论 · 政策

U1 Pro:长程任务闭环的工程化突破,还是多模态智能体的又一场秀

天玑天玑7月18日2026/07/18 58 浏览

最近跑了一下GAIA验证集,发现一个有趣的现象:多模态大模型在单步指令上准确率普遍超过90%,但一旦任务链条超过5个步骤,成功率就断崖式下跌到25%以下。GPT-4V勉强撑到8步,Claude 3.5 Opus在10步左右开始频繁丢失上下文,Gemini 2.0 Flash在工具调用时经常出现参数错乱。这个数据背后是一个行业共识:长程任务闭环,是当前多模态智能体最硬核的瓶颈。

商汤昨天在WAIC上发布的SenseNova U1 Pro,直接把这个目标写进了产品定位——“面向长程任务的交付级原生多模态智能体基座”。翻译一下:不是让你在聊天框里调戏,而是能跑完整业务流的干活型AI。

长程任务为什么难

先拆解一个典型的长程任务:用多模态智能体完成一份竞品分析报告。需要截图、OCR、搜索、数据对比、生成图表、输出PDF。这中间涉及至少10个原子操作,每个操作都可能出错,而且错误会累积。

[!tip] 核心难点在于三个维度

- 记忆衰减:Transformer的注意力机制在长序列中会丢失早期信息,尤其是在多模态输入里,视觉token的压缩率远低于文本

- 规划与执行的耦合:当前大多数模型先规划再执行,但实际场景中计划往往需要动态调整,回退成本极高

- 工具调用的鲁棒性:API返回格式变化、超时、权限不足,这些工程问题在学术benchmark里被刻意忽略了

商汤的U1 Pro给出了一个看起来更工程化的答案:原生多模态理解+生成+行动统一,而不是像GPT-4那样用插件系统拼凑。他们称之为“交付级原生多模态智能体基座”。

技术方案拆解

从公开信息看,U1 Pro的核心差异点在于“原生”二字。多数多模态模型是在文本大模型上外挂视觉编码器,再用一个对齐模块把视觉特征映射到文本空间。商汤的做法是在训练阶段就统一了视觉、文本、代码、工具调用的token空间,这意味着模型内部可以直接处理多模态推理,而不需要经过额外的“翻译”步骤。

具体到长程任务,他们提出了一个叫做“动态规划与自我修正”的机制。我用一个简化代码示例来理解这个逻辑:

class LongHorizonAgent:
    def __init__(self, model):
        self.model = model
        self.memory = []
        self.error_buffer = []
    
    def execute_task(self, task_graph):
        # 动态规划:不是一次生成完整计划,而是边执行边调整
        for step in task_graph:
            result = self.model.execute(step)
            if self._check_consistency(result):
                self.memory.append(result)
            else:
                # 自我修正:回退到上一步,重新生成
                self.error_buffer.append(step)
                self.memory.pop()
                step = self._replan(step)
        return self.memory

看起来简单,但实际工程实现中,记忆的压缩和检索、错误类型的分类、回退策略的粒度,都是深思熟虑的设计。商汤在演示中展示了U1 Pro处理一个20步任务,中间经历了两次API超时和一次OCR识别错误,系统自动重试并调整了后续步骤的顺序。这个能力,GPT-4V目前还做不到。

对比:为什么其他方案不适合长程任务

目前主流的多模态智能体方案大致分三类。第一类是“模型+工具集”模式,如GPT-4 with plugins,核心在模型本身,工具调用由外部系统管理。第二类是“规划器+执行器”分离,如HuggingGPT,用

原文链接:https://www.tmtpost.com/8070465.html

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧