
多模态不是Coding的简单升级,而是算力与算法的双重重构
林达华在WAIC上的判断我基本认同,但需要补充一个关键视角:Coding领域已经进入了“工程优化”阶段,而多模态目前还在“暴力探索”阶段。两者虽然都是大模型落地的核心战场,但技术栈的成熟度差距至少有一个代际。
我最近在跑一个多模态RAG(检索增强生成)项目,实测下来,纯文本的Coding Agent我可以做到85%以上的任务完成率,但一旦加入图像、视频输入,性能直接掉到50%以下。这不是模型能力的问题,而是模态对齐的底层机制还没有被真正解决。
多模态的难点不在“理解”,而在“对齐”
林达华提到多模态是下一个战场,这个判断技术上是准确的。但我想从实操层面拆解一下为什么多模态比Coding更难。
Coding本质上是一种结构化文本生成,模型只需要理解代码的语法树和语义逻辑。而多模态要求模型同时理解图像中的像素分布、音频中的时序信号、以及文本中的抽象概念,并在这些异构信息之间建立映射关系。目前主流做法是用CLIP或类似模型做视觉编码器,再通过Q-Former或线性投影层将视觉特征对齐到语言模型的语义空间。但benchmark显示,这种对齐在细粒度任务上存在严重失真。
举个例子,我最近用GPT-4o和Claude 3.5 Sonnet做了一组对比测试:给定一张包含多个物体的复杂场景图,要求模型描述“左上角第三个物体的颜色”。结果两个模型都出现了位置偏移误差,且对物体边缘的识别不够精确。这说明当前的多模态对齐本质上还是“粗粒度的语义匹配”,而不是真正的像素级理解。
而Coding领域,模型已经能够通过代码执行验证来反馈修正,形成闭环。多模态缺乏这种天然的自监督信号,数据标注成本也高得多。
商汤的技术路径:从“全域感知”到“动态融合”
林达华在采访中强调多模态要解决“感知”和“理解”的融合问题。商汤这次提出的方案,从技术角度来看,是试图绕开纯Transformer架构的局限,引入空间感知的归纳偏置。
我注意到他们最近发布的InternVL 2.0系列,在视觉编码器上采用了动态分辨率策略,也就是针对不同尺寸的图像自适应调整patch大小,而不是像传统做法那样统一resize到固定尺寸。这个策略在OCR和文档理解任务上效果显著。我之前跑了一下他们的模型,在DocVQA(文档视觉问答)上比Qwen-VL-Max高了约3个点。
但问题在于,这种动态分辨率策略会显著增加推理时的计算开销。对于端侧部署来说,实时性会是个瓶颈。林达华没有直接谈这个,但我觉得商汤如果要拿多模态做商业化,必须在模型压缩和量化上做出突破,否则只能走云端大模型路线,而这条路已经被OpenAI和Anthropic占据了先发优势。
多模态的下一场战役:从“理解”到“生成”
目前主流多模态模型都集中在“理解”端,即给定图像/视频,输出文本描述或答案。但真正的战场是“多模态生成”,也就是根据文本指令生成图像、视频、音频,甚至跨模态编辑。
Coding领域已经出现了Cursor、Copilot这类工具,开发者可以边写代码边看到实时反馈。多模态生成如果也能做到“实时交互编辑”,比如一边描述一边修改图像中的某个物体,那才是真正颠覆性的应用。但目前的扩散模型和自回归模型在生成效率上还差得远,尤其是视频生成,单帧推理时间还在秒级,更别说实时。
林达华提到的“多模态是Coding之后的下一个战场”,从技术演进节奏来看,我认为至少还需要2-3年才能达到Coding领域的成熟度。但有一件事现在就可以做:关注多模态对齐的数据构建方法,尤其是利用合成数据来做细粒度标注。这是目前成本最低、效果最确定的突破口。
[!tip] 行动建议
如果你现在想切入多模态赛道,不要直接从模型训练入手,而是先做数据工程。搭建一套自动化的多模态标注流水线,利用已有的视觉检测模型生成伪标签,再用人机协同做精标注。这套流程跑通之后,无论你用哪个基座模型,都能在特定领域快速建立优势。我团队已经在电商场景下验证了这个策略,效果比直接用预训练模型微调高出15%以上。
多模态的未来属于那些能把“模态对齐”从黑盒变成白盒的人。别被当前的benchmark成绩迷惑,真正的硬仗还在后面。
原文链接:https://www.leiphone.com/category/yanxishe/uHHqpDWEcbFxyyvD.html
物界前沿