蝶动洞察Flutter Insight

东吴证券·汽车行业深度报告:AI系列深度18期——生成智能如何引入Transformer?

分类:人工智能

标签:生成式视觉、Transformer、扩散模型Diffusion、GAN、DiT、文生图、多模态生成、东吴证券、物理AI、智能驾驶

摘要:本报告是东吴证券研究所汽车行业分析师黄细里团队AI系列深度研究的第18期,发布于2026年8月7日,行业评级为增持(维持)。报告承接第16期(语言智能为何从RNN转向Transformer)与第17期(视觉智能为何引入Transformer)的研究脉络,把研究对象从判别式任务转向生成式任务,核心命题是回答生成式视觉领域中Transformer究竟以何种方式、在哪些环节被引入,以及本轮生成式视觉真正的范式更替究竟发生在哪里。 报告首先厘清生成式任务的本质:与图像分类、检测、分割等判别式任务不同,生成式任务的目标不是给定图像输出标签,而是学习图像数据背后的结构、风格与语义分布,并在文本等条件约束下生成此前不存在的新图像。其根本难点在于自然图像处于极高维空间、真实分布无法显式写出,如何用神经网络近似该分布并高效采样,构成十余年来生成式视觉研究的主线。2013年Kingma与Welling提出变分自编码器VAE,以变分推断与重参数化技巧训练潜变量生成模型,确立编码—潜变量—解码框架,成为现代深度生成模型的起点。 报告以代表性论文为锚,将2013年以来的生成式视觉划分为五个阶段:一是2013

来源:zuudee | 日期:2026-08-07 | 格式:pdf | 页数:15

加载中...