蝶动洞察Flutter Insight

东吴证券·汽车行业AI系列深度19期:多模态如何从模型拼接走向统一?

分类:人工智能

标签:多模态大模型、Transformer、全模态Omni、原生多模态、理解与生成统一、多模态推理、东吴证券、智能驾驶、物理AI

摘要:本报告是东吴证券研究所于2026年8月7日发布的汽车行业AI系列深度第19期,由证券分析师黄细里撰写,行业评级维持增持。报告承接该系列前作《语言智能为何从RNN转向Transformer》《视觉智能为何引入Transformer》,把研究视角从单一模态推进到模态融合,系统回答一个核心问题:多模态大模型如何从早期的模型拼接走向底层统一。报告开宗明义指出,多模态智能的本质,是把文本、图像、音频、视频等异构信息映射进同一套统一表示,并在此表示之上完成理解、推理、生成与交互;判断一个模型是否真正多模态,关键不在于它能接收几种输入,而在于模态之间是松散拼接还是深度统一、对齐究竟发生在流程的哪个位置、跨模态转换过程中损失了多少信息。作者认为,多模态是人工智能第二阶段架构收敛、任务收敛、模态收敛这三重收敛在模态维度上的集中兑现。 报告构建了一个以对齐位置为主线的三阶段分析框架,这是全篇的核心方法论。第一阶段为外挂式与组合式阶段,时间跨度为2021年至2023年,核心问题是如何让图像进入语言模型体系,代表成果包括对比学习图文对齐的CLIP、十亿级弱监督图文对训练的ALIGN、兼顾对齐与描述生成的Co

来源:zuudee | 日期:2026-08-07 | 格式:pdf | 页数:15

加载中...