乐于分享
好东西不私藏

【AI系列深度15期】Transformer如何开启AI第二次爆发?

【AI系列深度15期】Transformer如何开启AI第二次爆发?

未经许可,不得转载或者引用。

投资要点

投资要点:

AI第二次爆发的本质,是模型能力形成方式从“人工设计”转向“规模化学习”。AI1.0时代深度学习仍带有“一任务一模型”特征,CNN、RNN等架构分别服务于图像、文本等专用任务,能力主要停留在基础感知层面。本轮AI2.0以Transformer等通用底座为核心,叠加数据、算力与自监督训练,使模型学习统计结构与通用表征,能力来源由强任务先验和强归纳偏置,转向弱归纳偏置下的规模化学习与涌现。

Transformer成为AI2.0关键基础架构:自注意力机制解决循环网络串行计算和长程依赖瓶颈,更适合GPU并行算力与大规模训练;弱归纳偏置为跨模态迁移提供统一接口,使多类输入逐步进入同一底座体系。2017年以来,主干架构总体稳定,能力提升更多来自MoE、长上下文、多模态融合、后训练与推理机制,而非底层架构切换。

从技术演进看,大模型可概括为“模型能力奠基—人机对齐与行为优化—推理与外部系统赋能”三阶段,并由能力广度和使用效率两条支线贯穿。第一阶段通过预训练、规模扩张和Scaling Laws奠定参数内能力;第二阶段通过SFT、RLHF、DPO等对齐技术提升可用性;第三阶段依托思维链、RAG、工具调用、强化学习推理和任务路由,将能力增量迁移到运行时系统。

GPT系列提供了大语言模型落地产业端的典型路径:GPT-1至GPT-3验证decoder-only架构和规模化泛化能力,InstructGPT与ChatGPT补齐交互入口,GPT-4/GPT-4o推动模型走向多模态交互,o1/o3/o4-mini/GPT-5进一步整合推理时计算、工具使用、多模态任务和实时路由。关键技术通常先在研究与工程验证中形成,再通过产品化入口实现规模扩散。

Scaling Law回答“规模如何转化为能力”,也反映AI2.0资源优化边界的外扩。早期scaling围绕参数量、数据量与训练算力展开,随后纳入能力涌现、计算最优配比、高质量数据、对齐、部署和推理成本等约束。2024年以来,MoE稀疏激活、测试时计算、RL reasoning、扩散Transformer与视频生成等方向,使scaling扩展为训练、推理、数据、架构、对齐与多模态的全链条资源优化框架。

从产业形态看,AI第二次爆发的外在结果是数字AI任务边界初步收敛。Transformer已参与文本、代码、知识库、工具、多模态输入和数字工作流,推动架构、任务与模态三重收敛。产业价值重心也从“设计何种架构”,转向“谁能把规模、数据、对齐、推理与系统工程能力做到位”。但推理阶段增量目前更多体现在语言、数学、代码等可验证任务中,向视觉生成、复杂多模态交互与真实物理闭环迁移仍需验证。

我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。

风险提示:技术迭代不及预期的风险,大模型厂商 ARR 增速放缓的风险,云服务商资本开支不及预期的风险,智能驾驶及机器人商业化落地不及预期的风险。

1

 AI2.0的本质:从“人工设计”到“规模化学习”

2012年AlexNet在ImageNet数据集上取得突破,正式开启深度学习第一轮发展浪潮。该阶段具有鲜明的“一任务一模型”特征:CNN、RNN等网络架构各自适配特定任务领域,模型核心价值主要集中在图像、文本等基础感知环节。受架构能力约束,当时模型尚难形成流畅的人机交互能力,这也是To C产品未能大规模落地的重要原因。

AI第二轮产业变革的核心逻辑出现根本变化:模型能力不再主要依靠人工定制,而是依托海量数据与规模化训练自主形成。上一轮深度学习的模型性能高度依赖人为设计的网络结构,研发人员依据图像局部特征、时序依赖等现实规律设计架构。本轮大模型以Transformer等统一通用架构为基础,叠加算力提升与数据规模扩张,通过自监督训练从海量样本中学习统计结构与通用表征,使模型能力形成方式由过去依赖强任务先验和强归纳偏置,转向弱归纳偏置下的规模化学习与能力涌现。

各类主流网络架构的归纳偏置强度整体呈递减趋势:CNN绑定较强的空间特征约束,RNN内置时序递归逻辑,而Transformer主要依靠注意力机制与位置编码搭建通用框架,人为预设约束相对最少,模型效果更多由数据驱动。对比AI 1.0与AI 2.0可以看到,长期维度下,依托通用框架叠加算力扩容的技术路线,逐步优于人工注入领域知识的定制化方案。

2

Transformer成为跨模态通用底座

Transformer是AI2.0的起点。相较循环网络,其主要突破两个瓶颈:1)循环网络需按时间步串行计算,难以并行;自注意力允许序列内各位置并行计算,能够更充分利用GPU算力;2)循环网络在远距离信息传递中存在衰减,全局自注意力使任意两个位置可直接交互,从而缓解长程依赖问题。

同时,Transformer能够成为大模型通用基础架构,除并行计算优势外,另一关键原因在于其弱归纳偏置设计,天然支持跨模态迁移与复用。

2017年以来,主流大模型底层主干架构保持高度稳定,Transformer仍是前沿大模型最核心的架构基础。近年来模型能力提升更多来自MoE稀疏化、注意力机制优化、长上下文扩展、多模态token融合,以及以强化学习和test-time compute为代表的推理型后训练机制,而非底层架构范式的全面切换。

3

Transformer发展复盘

结合核心论文,我们认为大模型演进框架可以总结为:一条核心发展主线搭配两条并行优化支线。主线为模型能力升级重心持续向外转移,分为三个递进阶段;两条支线分别对应能力拓展广度、训练推理使用效率。该划分标准区分能力优化所处层级,分为架构设计、预训练、规模扩张、对齐调优、推理增强、智能体系统等各类技术进展。

3.1

阶段一:模型能力奠基

本阶段核心思路是依托模型参数承载全部基础能力,覆盖底层架构设计、预训练、规模扩容三大环节。2017年Transformer问世,搭建起支持并行运算的注意力基础框架;2018-2019年GPT-1、BERT落地,确立预训练+微调的主流训练模式,实现海量文本数据的特征学习;2020年Scaling Laws理论与GPT-3落地,证明模型性能可随规模提升稳定增长,形成可量化的工程落地路径;2022年Chinchilla进一步明确算力约束下,参数量与训练数据的最优配比。

整体来看,该阶段核心目标是将通用基础能力固化至模型参数,奠定大模型“预训练+规模扩张”的底层发展范式,模型性能上限直接由算力、数据投入规模决定。

3.2

阶段二:人机对齐、行为优化

本阶段不会为模型新增底层原生能力,而是校准模型现有输出逻辑,使其贴合人类指令与使用偏好。代表性技术包括FLAN指令微调、InstructGPT提出的SFT监督微调-奖励模型-强化学习RLHF三段式流程、Constitutional AI、DPO等,ChatGPT的推出则是该阶段技术落地、走向商业化的标志性节点。

我们认为,模型具备基础能力、可正常落地使用、输出行为可控是三个独立维度,对齐技术主要解决后两大痛点。正是依托对齐相关技术,预训练模型中潜藏但无法直接落地的能力得以释放,成为AI2.0从实验室技术转向大众产品爆发的核心转折点。

3.3

阶段三:推理与外部系统赋能

本阶段聚焦模型部署使用环节,依托运行时配套系统补充额外能力。2022年思维链技术落地,通过分步推理优化模型解题逻辑,能力提升不再单纯依赖模型参数;RAG检索增强、Toolformer、ReAct等方案,将外部知识库、工具能力与模型解耦;2024-2025年o1、DeepSeek-R1等工作将强化学习用于长链条推理与可验证任务,打开推理阶段算力优化的新方向;o3、GPT-5更进一步整合推理逻辑、工具调用、任务调度路由,产品形态从单一独立模型升级为一体化智能系统。

3.4

模型能力的广度与效率

两条并行优化支线贯穿整个发展阶段,两条支线不会改变能力优化的核心层级,而是决定同一阶段下,模型可覆盖场景范围、落地成本高低:

能力拓展广度:Codex实现代码领域适配,Flamingo、GPT-4o、Gemini打通图像、音频、视频多模态输入,超长上下文技术将单轮可处理信息量级提升至百万token;

落地使用效率:MoE稀疏架构(Switch Transformer、Mixtral、DeepSeek-V3)在固定算力下拓展有效参数规模,LoRA/QLoRA、FlashAttention、RoPE等技术降低训练与推理部署成本,LLaMA、Mistral、通义千问、DeepSeek等开源模型完善产业生态。

站在产业视角来看,当前行业底层架构逐步趋同,预训练方案也趋于同质化,行业竞争核心已不再是底层架构设计优劣,而是企业在模型外部体系的搭建能力,具体涵盖对齐数据集与优化方案、推理架构与工具链路、全流程训练部署工程化能力,行业价值创造重心,正从底层架构研发转向全链路工程落地。

4

 复盘GPT:大语言模型如何落地产业

我们选择GPT作为大模型落地的产品代表,从产业视角复盘大语言模型由学术成果走向规模化应用的完整周期。2018—2026年,GPT大致经历基础语言模型、产品化、多模态、推理模型四个阶段。每一次跃迁,均对应Transformer能力被进一步产品化、系统化的关键节点。

基础语言模型阶段(GPT-1至GPT-3、InstructGPT)的核心特征,是decoder-only架构确立与规模化泛化能力显现。OpenAI基本确立以自回归Transformer为核心的大语言模型路线,并依托参数、数据、算力扩张持续提升模型能力:GPT-1验证预训练表征可迁移至下游任务,GPT-2展现无需微调的zero-shot泛化能力,GPT-3进一步体现few-shot与上下文学习能力,并在工程层面开始以scaling law指导规模扩张。InstructGPT在预训练模型基础上引入人工示范、人工偏好数据与RLHF,使模型输出更贴合人类意图,形成SFT—奖励模型—强化学习(PPO)的经典三阶段流程。

产品化阶段(ChatGPT/GPT-3.5)的核心变化,是基础语言模型正式转向对话式AI助手产品。GPT-3.5是底层模型系列,ChatGPT则是在其基础上经过后训练与产品化封装形成的对话应用,补齐模型从“能续写”到“能对话、能理解用户意图并完成任务”的关键环节,也成为大语言模型进入大众应用市场的标志性拐点。

多模态阶段(GPT-4/GPT-4 Turbo/GPT-4o)中,OpenAI的优化重点从单纯提升文本生成与指令跟随,进一步转向输入模态扩展。GPT-4引入图文输入,使模型能够在文本与图像共同输入下完成视觉问答、图表解释、截图分析与文档理解,ChatGPT由此具备“看图理解”的多模态能力;GPT-4o则进一步走向原生端到端实时多模态交互,推动模型产品形态由文本助手向综合交互入口升级。

推理模型阶段(o1/o3/o4-mini/GPT-5)的核心突破,是推理时计算量扩展。o1通过强化学习优化模型解题过程,使模型在回答前先完成问题拆解、步骤规划与推理校验,而非直接快速生成答案;o3、o4-mini将推理能力进一步延伸至工具使用与多模态任务;GPT-5则在性能升级基础上,将快速模型、深度推理模型与实时路由机制整合为统一系统,以适配快速问答、复杂推理以及不同成本、延迟约束下的多类使用场景。

复盘GPT迭代历程可以发现,其产业落地关键节点与前文划分的三大演进阶段高度一致:基础大模型发展阶段,对应模型内部原生能力搭建;以RLHF、ChatGPT为代表的产品化阶段,对应人机对齐行为优化;多模态大模型与推理模型落地,则对应推理与外部系统赋能阶段,并同步带动能力广度、落地效率两条支线持续展开。

通过对GPT发展的复盘,我们发现从 RLHF 到 ChatGPT,从长链推理到 o 系列模型,技术路线往往先在研究与工程验证中形成,再通过产品化入口实现规模扩散。当前,大模型能力提升的重心已不再局限于预训练阶段的参数扩张,而是逐步转向由后训练对齐、测试时计算、工具调用、外部数据与自动化工作流共同构成的系统化能力扩展。由此,围绕经典技术论文梳理行业演进脉络,能够帮助我们识别下一阶段产业落地的潜在方向与节奏。

5

caling Law复盘:从预训练幂律到全链条资源优化

扩展规律(scaling law)回答的是“规模如何转化为能力”。这一规律伴随大模型发展不断被修正与拓展,逐步形成覆盖训练、数据、对齐、推理与多模态的全链条框架。

阶段0(2017—2019)中,相关研究开始发现模型误差会随数据、模型与算力扩张呈稳定幂律下降,为“深度学习性能可被外推”提供了关键思想基础。

阶段1(2020)确立预训练scaling law。Kaplan等将语言模型loss抽象为参数量、数据量与算力的幂律函数,GPT-3进一步证明scale不仅能够降低loss,也会带来few-shot与上下文学习能力。

阶段2(2021—2022)转向能力scaling与涌现争论。Gopher、PaLM将scaling研究从loss曲线推向多任务能力谱系,“涌现能力”概念由此形成,随后也引发“涌现或由指标选择造成”的讨论。

阶段3(2022—2023)进入计算最优scaling。Chinchilla修正早期“只堆参数”的路径,指出在给定算力约束下,参数量与训练token数应同步增长,并以700亿参数Chinchilla在多项评测上优于2800亿参数Gopher作为验证。

阶段4(2023—2024)进一步纳入数据、对齐与部署约束。高质量token成为新的瓶颈,数据质量与重复、指令微调、奖励模型过优化、推理成本等因素均被纳入scaling变量。

阶段5(2024—2026)扩展出新的scaling轴。MoE稀疏激活、测试时计算、RL reasoning、扩散Transformer与视频生成等方向,共同推动scaling law从“预训练大模型规律”,演化为覆盖训练、推理、数据、架构、对齐与多模态的全链条资源优化框架。

扩展规律六阶段演进,与三大演进阶段在逻辑上互为表里:当scaling从“预训练参数与token”扩展到“数据、对齐、推理时算力与多模态”,本质上对应能力升级重心从模型内部原生能力搭建,继续延伸至人机对齐行为优化和推理与外部系统赋能。换言之,scaling的边界正在从训练阶段延伸至对齐与运行时。这进一步印证,AI2.0后续能力增量与成本结构,将越来越多由模型外部工程能力决定。

6

  大语言模型或已成为数字AI任务的通解

较之AI 1.0时代不同任务匹配不同基座模型的产业形态,在AI 2.0时代,Transformer已以基座模型或重要组件的角色参与到广泛的数字AI任务解决过程,使得AI任务在数字AI领域的解决方案实现初步收敛。

我们将其概括为三重收敛:架构收敛,即文本、图像、音频等各类模态逐步统一到Transformer底座;任务收敛,即从“一个任务一个模型”走向“一个通用模型应对多任务”;模态收敛,即文本、图像、音频等不同输入进入同一模型体系处理。三者共同构成AI从专用模型走向通用底座的外在表现。但是,我们认为大语言模型尚未展现出可作为物理AI任务通解的迁移能力。

7

结论

第一,关于本质。AI 第二次爆发的核心,是模型能力从依赖人工规则与任务专用架构设计,转向依托通用架构、海量数据、参数规模与算力投入的共同扩展。相较于上一代任务专用模型,大模型不再主要依赖人为注入、且与具体任务深度绑定的强归纳偏置,而是通过统一底座模型在大规模数据中学习通用表征,并在不同任务、模态与场景中实现能力迁移。

第二,关于发展历史及未来方向。Transformer 时代的大模型演进,大体可以沿着“预训练与规模化奠基—人机对齐与行为优化—推理增强与系统化扩展”三大阶段展开。自 2017 年 Transformer 提出后,主干架构范式总体趋于稳定,后续边际进步更多来自规模化、数据工程、后训练对齐、测试时计算、工具调用与系统工程等环节。与之对应,扩展规律也从早期围绕预训练参数、数据 token 与训练算力的规模化,进一步延伸至数据质量、对齐方法、推理时算力、多模态输入输出与外部工具系统的全链条优化。相应地,行业价值重心正从单纯讨论“设计何种架构”,转向比较“谁能把规模、数据、对齐、推理与系统工程能力做到位”。算力与系统工程、数据工程、对齐优化、推理系统建设,将成为后续更需重点关注的环节。

需要提示的是,推理阶段算力与强化学习带来的能力增量,目前更多体现在语言、数学、代码等结果相对可验证的任务中;其能否稳定迁移至视觉生成、复杂多模态交互与真实物理闭环场景,仍需持续验证。

第三,关于大语言模型成为数字 AI 任务的通用底座。AI 第二次爆发的外在形态,是架构、任务与模态的持续收敛。大语言模型不仅提升了文本任务能力,也逐步成为连接代码、工具、知识库、多模态输入与数字工作流的统一交互入口。从产业角度看,在通用底座形成后,产业价值更容易向掌握基础模型能力、数据闭环、算力资源与生态入口的主体集中。

8

风险提示

技术迭代不及预期的风险:数字 AI、物理 AI 技术进展低于预期,任务或应用场景拓宽速度低于预期。

大模型厂商 ARR 增速放缓的风险:若客户增长、续费率或客单价不及预期,模型厂商 ARR 增速可能放缓。

云服务商资本开支不及预期的风险:若自由现金流承压,或 AI 算力需求及投资回报低于预期,云服务商可能下调资本开支。

智能驾驶及机器人商业化落地不及预期的风险:若产品可靠性、成本下降或用户需求低于预期,相关产品商业化进程可能放缓。

最新代表报告

《【AI系列深度14期】深度学习如何开启AI第一次爆发?》20260805

《【AI系列深度13期】世界模型如何实现?》20260805

《【AI系列深度12期】从模块化到端到端》20260804

东吴汽车团队介绍

团队荣誉

2025年证券时报(新财富)最佳分析师汽车行业第一名;

2024年证券时报(新财富)最佳分析师汽车行业第一名;

第二十一届新财富最佳分析师汽车和汽车零部件板块第二;

第二十届新财富最佳分析师汽车和汽车零部件板块第二;

第十九届新财富最佳分析师汽车和汽车零部件板块第三;

第十五届卖方分析师水晶球汽车及零部件板块第二;

第五届新浪财经金麒麟最佳分析师汽车行业第二;

第四届新浪财经金麒麟最佳分析师汽车行业第二;

第三届新浪财经金麒麟最佳分析师汽车行业第三;

Wind第十二届金牌分析师汽车板块第一;

Wind第十一届金牌分析师汽车板块第一;

Wind第十届金牌分析师汽车板块第一;

Wind第九届金牌分析师汽车板块第二;

上海证券报最佳分析师汽车板块第一;

黄细里 团队负责人

华中科技大学企业管理学士,上海交通大学企业管理硕士;

负责投资策略+汽车智能化主线,曾任职长江证券汽车分析师等,13年汽车行业研究工作经验

工作邮箱:huangxl@dwzq.com.cn

孟璐 团队成员

同济大学金融本硕;

聚焦全球化乘用车,5年汽车行业研究经验

工作邮箱:mengl@dwzq.com.cn

郭雨蒙 团队成员

中国海洋大学本科,北京航空航天大学硕士

聚焦零部件+机器人,2025年加入东吴证券,此前就职于民生证券、天风证券,5年汽车行业研究经验

工作邮箱:guoym@dwzq.com.cn

孙仁昊 团队成员

同济大学本科,香港中文大学(深圳)硕士

聚焦智能化零部件+客车,4年汽车行业研究经验

工作邮箱:sunrh@dwzq.com.cn

童明祺 团队成员

上海财经大学金融本硕

聚焦智能化乘用车,2025年加入东吴证券

工作邮箱:tongmq@dwzq.com.cn

公众号| 东吴汽车黄细里团队

请扫关注我们

免责声明:

本公众订阅号(微信号:东吴汽车黄细里团队)由东吴证券研究所汽车团队设立,系本研究团队研究成果发布的唯一订阅号。

本公众号所载的信息仅面向专业投资机构,仅供在新媒体背景下研究观点的及时交流。

本订阅号不是东吴证券研究所汽车团队研究报告的发布平台,所载内容均来自于东吴证券研究所已正式发布的研究报告或对已发布报告进行的跟踪与解读,如需了解详细的报告内容或研究信息,请具体参见东吴证券研究所已发布的完整报告。

本订阅号所载内容不构成对具体证券在具体价位、具体时点、具体市场表现的判断或投资建议,不能够等同于指导具体投资的操作性意见。本订阅号所载内容仅供参考之用,接收人不应单纯依靠本资料的信息而取代自身的独立判断,应自主做出投资决策并自行承担风险。东吴证券研究所及本研究团队不对任何因使用本订阅号所载任何内容所引致或可能引致的损失承担任何责任。

本订阅号对所载内容保留一切法律权利。订阅人对本订阅号发布的所有内容(包括文字、图片、影像等)未经书面许可,禁止复制、转载;经授权进行复制、转载的,需注明出处为“东吴证券研究所”,且不得对本订阅号所截内容进行任何有悖原意的引用、删节或修改。

特别声明:《证券期货投资者适当性管理办法》、《证券经营机构投资者适当性管理实施指引(试行)》于2017年7月1日起正式实施。通过新媒体形式制作的本订阅号推送信息仅面向东吴证券客户中的专业投资者,请勿在未经授权前进行任何形式的转发。若您非东吴证券客户中的专业投资者,为保证服务质量、控制投资风险,请取消关注本订阅号,请勿订阅、接收或使用本订阅号中的任何推送信息。因本订阅号难以设置访问权限,若给您造成不便,烦请谅解!感谢您给予的理解和配合。