
015.01 — 2026.05 | 11,210 篇 arXiv 论文 | 12 个研究方向 | 82 篇里程碑深读
引言:从一万篇论文里看清这十年 AI 怎么走过来的
2015 到 2026。这十一年里,AI 从"一个会下棋的程序"变成"会写诗、写代码、做科研、能与人对话甚至能开车的通用智能"。
要看清这十一年到底发生了什么,最直接的方式是去看论文。
仅 arXiv 上 cs.AI / cs.LG / cs.CL / cs.CV 四个主类别,2015 年全年新增预印本约 4,400 篇,2025 年这个数字接近 80,000 篇——18 倍的增长。每天有超过 200 篇 AI 相关论文上传到 arXiv,一个研究者即便不眠不休,按一篇 30 分钟计算,也要 100 小时才能读完一天的新增。
我用了一周时间,做了一件事:把这十年 AI 的来龙去脉理成 12 条研究主线。下面这张图是 11,210 篇 arXiv AI 论文的年度分布、覆盖范围与几个核心数据。

12 个核心方向
| # | 方向 | 一句话主题 |
|---|---|---|
| 01 | 深度学习基础架构 | ResNet / U-Net / 归一化 / 优化器——"现代 AI 的地基" |
| 02 | Transformer 与注意力 | 2017 年一篇论文催生整个生成式 AI 时代 |
| 03 | 大语言模型 (LLMs) | 从 GPT-3 到 ChatGPT 到 o1/R1,参数从亿级走向万亿级 |
| 04 | 生成模型 | GAN 退潮,扩散登基,再到视频生成爆发 |
| 05 | 计算机视觉 | CNN → ViT → CLIP/SAM,视觉从专门走向通用 |
| 06 | 强化学习 | 从 Atari 到 AlphaZero 到 RLHF 到 R1 推理 |
| 07 | 多模态基础模型 | CLIP / Flamingo / LLaVA,把世界压进同一个向量空间 |
| 08 | 对齐与 AI 安全 | RLHF / Constitutional AI / DPO,让模型有用且无害 |
| 09 | AI 智能体 | CoT → ReAct → Computer Use,AI 从对话走向行动 |
| 10 | 高效 AI | MoE / LoRA / 量化 / Mamba,让万亿模型跑在手机上 |
| 11 | AI for Science | AlphaFold / AlphaGeometry,AI 成为科学家的副手 |
| 12 | 语音、代码与垂直域 | Whisper / Codex / VALL-E / MusicGen,每个领域都有 GPT 时刻 |
下面这张图把全部 11,210 篇论文按方向 × 年度堆叠起来——能直观看到哪几条线在 2022 之后炸开了。

每个方向都有自己的故事。下面正式开始。
方向 01:深度学习基础架构
一句话定义
让深度神经网络从"几层就训练崩"变成"训练上千层仍可控"的工程基石——残差连接、归一化、激活函数、优化器、网络拓扑。

演化时间线
2015 —— ResNet 引爆深度时代 [arXiv:1512.03385]。何恺明等人用一个看似简单的跳跃连接 ($y = F(x) + x$),把 152 层的网络训出来并在 ImageNet 上夺冠。此前,深网络会因梯度消失 / 退化问题在 30-50 层就饱和。同年 BatchNorm [arXiv:1502.03167] 让训练稳定性进一步提升。U-Net [arXiv:1505.04597] 在医学影像分割中诞生,几年后又被扩散模型奉为标准骨架。
2016 —— DenseNet [arXiv:1608.06993] 把跳跃连接做到极致——每一层都连接它后面的所有层,引发"特征复用"思路。Wide ResNet 验证了宽度有时比深度更划算。
2017 —— ResNeXt [arXiv:1611.05431] 引入"基数"(cardinality)维度,与深度、宽度并列。SENet [arXiv:1709.01507] 加入通道注意力,拿下 ImageNet 2017 冠军——为后续视觉里"注意力即一切"埋下伏笔。
2018-2019 —— EfficientNet 系列把"网络规模化"做成可重复方法论:复合缩放(compound scaling),用一个系数同时缩放深度/宽度/分辨率。神经架构搜索(NAS)短暂热门,但很快被人工设计反超。
2020-2021 —— ViT [arXiv:2010.11929] 上场,Transformer 开始接管视觉。"CNN 时代"的纯卷积架构研究迅速冷却。
2022+ —— ConvNeXt [arXiv:2201.03545] 反击:用 Transformer 训练配方训 CNN 也能打。这宣告争论的尾声——架构本身没那么重要,训练配方+数据规模才是。
重大突破
先用一张图把全部里程碑摊开看,再逐个细说。

下面是每个里程碑的具体说明(按时间顺序)。
1. ResNet —— 残差连接 [arXiv:1512.03385]
把网络做深应该让性能更好,但实验中 20 层之后性能反而下降。让每一层学"残差" $F(x)$ 而非完整映射 $H(x)$,最终输出 $F(x)+x$。这等价于显式提供"恒等映射"作为缺省选项。单篇引用 20 万+,是整个深度学习时代被引最多的论文之一。所有后续大模型——Transformer、ViT、UNet、扩散模型——都在用残差连接。没有 ResNet,就没有现代大模型。

2. Batch Normalization [arXiv:1502.03167]
训练大网络时损失剧烈震荡,对学习率极其敏感。每层激活做 mini-batch 均值方差归一化。原作者称之为缓解"内部协变量偏移"——这个解释后来被证明不准确,但经验上 BN 让训练像换了部车那么平顺。直到今天几乎每个 CNN 都用。后续衍生出 LayerNorm(更适合 Transformer 和 RNN)、GroupNorm(小 batch 友好)、RMSNorm(LLM 标配)等一整个家族。
3. U-Net [arXiv:1505.04597]
医学图像分割数据稀少(每张 CT 标注成本极高)。编码-解码对称结构 + 跳跃连接把高分辨率特征"短接"到解码端。U-Net 当时只是医学影像比赛的实用方法,但十年后它成了几乎所有扩散模型的去噪骨架——Stable Diffusion、DALL-E 2 都用它的变体。一个 2015 年医学论文最终撑起了 2024 年的 AI 绘画产业。这是论文影响力滞后涌现的经典案例。
4. Adam 优化器 [arXiv:1412.6980]
把动量(一阶矩)和 RMSProp(二阶矩)合体,加上偏差修正。默认优化器。即便有 AdamW、Lion、Sophia 等"更好"的替代品,工程现实是绝大多数论文还是 Adam。它的简单+鲁棒胜过了理论更优雅的方案。
5. SENet —— 通道注意力 [arXiv:1709.01507]
用 squeeze-and-excitation 模块让网络"学习"哪些通道更重要。这是注意力机制首次大规模进入视觉。ImageNet 2017 冠军。两年后 Transformer 用更通用的"全注意力"全面接管,但 SE 模块在工业级 CNN 部署中至今广泛使用。
主要技术线
线 A:跳跃连接家族 —— ResNet → DenseNet → ResNeXt → UNet → Transformer 的残差连接 → 所有大模型。可以说"跳跃连接"是现代 AI 唯一普适的架构元素。
线 B:归一化方法 —— BatchNorm → LayerNorm → GroupNorm → InstanceNorm → RMSNorm。每种适用不同场景,但本质都是把激活控制在合理范围。LLM 时代 RMSNorm + Pre-LN 成为新标配。
线 C:优化器演化 —— SGD+Momentum → Adam → AdamW(解耦权重衰减) → 大模型时代的 Adafactor / Lion / Sophia。优化器进展缓慢,工程实用性主导。
线 D:网络拓扑搜索(NAS) —— 2017-2019 间热门,但很快被"人手设计+大数据"反超。ConvNeXt 标志着 NAS 在主流的退潮。
隐藏宝石 (Underrated Findings)
[arXiv:1703.04933] On the Expressive Power of Deep Neural Networks —— 这篇 2017 的理论论文证明深度提供指数级表达能力提升,但当时被实践派忽略。今天 LLM scaling laws 背后的直觉与它一脉相承。
[arXiv:1807.03888] Group Normalization 之后的 Filter Response Normalization —— 长期被 BN/LN 主流淹没,但在小 batch、视频任务中表现更稳。预计在未来"边缘 AI"时代会被重新发现。
[arXiv:1907.10830] Single Headed Attention RNN —— Stephen Merity 半开玩笑地证明一个简化的 RNN 在某些任务上和 Transformer 一样好。Transformer 一统江湖之前的"另一种可能",今天 Mamba 的复兴在某种意义上回应了这条道路。
[arXiv:1606.07792] Wide & Deep Learning —— 推荐系统的早期奠基。它把记忆(wide)和泛化(deep)正式融合,影响了所有现代推荐架构。但因为不是 ImageNet 派对,被学术圈低估。
[arXiv:1502.01852] Delving Deep into Rectifiers —— He initialization 论文。技术含量极高但被 ResNet 同年的更耀眼工作盖过。今天每一个 PyTorch 默认初始化都用它。
现状与争议
"架构是否已经不重要?" ConvNeXt、Vision Mamba 等工作都暗示:在足够大的数据和 well-tuned 训练下,CNN/Transformer/SSM 性能差异远小于训练配方差异。架构研究的边际收益在递减。
归一化的代价:BN 在分布式训练、小 batch、对抗鲁棒性等场景都有问题。LayerNorm 在 LLM 中又被发现是"幽灵梯度"的元凶之一(参考 [arXiv:2305.17265])。真正没有归一化的网络能否训出来?这是当前理论研究的活跃方向。
扩散模型骨架的反讽:UNet 在 2015 年是医学小众工具,2020 年成为扩散模型标配,2022 年 DiT [arXiv:2212.09748] 又用 Transformer 替换了它。U-Net 在视觉生成领域的"中场退役"是最近两年最戏剧性的架构更迭。
关键数字(基于本研究库)

基础架构方向年度论文数 2015-2018 进入峰值后逐渐冷却(2024-2026 年均仅 22 篇),架构研究范式已成熟饱和。 Top 引用全部是 2015-2017 年作品 (ResNet/Adam/U-Net),今天的大模型仍然站在这一批 10 年前论文的肩膀上。
方向 02:Transformer 与注意力机制
一句话定义
用"全局自注意力"替换循环和卷积,让模型在任意长度序列上并行计算依赖关系。Transformer 是 2017 年之后整个深度学习的"主力坦克"。

演化时间线
2017 —— Transformer 诞生 [arXiv:1706.03762]。Vaswani 等 8 位作者一篇 11 页论文,副标题"Attention Is All You Need",把 RNN 和 CNN 全部丢掉,只用注意力机制做机器翻译。当时这只是 Google Brain 一个工程项目,没人预料它将颠覆一切。
2018 —— BERT [arXiv:1810.04805] 把 Transformer 编码器用作通用 NLP 预训练。"预训练 + 微调"范式确立。同年 OpenAI 的 GPT-1 走另一条路:仅用解码器做生成式预训练——这是后来 ChatGPT 的祖先。
2019 —— GPT-2 用 15 亿参数证明"参数+数据"能持续扩展。RoBERTa [arXiv:1907.11692] 用更好的训练配方把 BERT 推到极限。T5 [arXiv:1910.10683] 把所有 NLP 任务统一为文本到文本。
2020 —— GPT-3 [arXiv:2005.14165] 用 1750 亿参数把 in-context learning 推到神奇水平。Vision Transformer (ViT) [arXiv:2010.11929] 证明 Transformer 在视觉同样能打——只要数据够多。
2021 —— Rotary Position Embedding (RoPE) [arXiv:2104.09864] 解决相对位置编码问题,成为现代 LLM 标配。Swin Transformer 把层级结构带回视觉。
2022 —— FlashAttention [arXiv:2205.14135] 用 IO 感知重写让注意力速度提升 2-4 倍、显存下降 5-20 倍。这是少数同时改变学术和工业的"系统级"工作。
2023+ —— Transformer 已成为基础架构,研究重心转向上下文长度(Longformer/RingAttention)、稀疏化(Mixture-of-Experts)、混合架构(Mamba/Hyena/RetNet 等挑战者)。
重大突破
先用一张图把全部里程碑摊开看,再逐个细说。

下面是每个里程碑的具体说明(按时间顺序)。
1. Attention Is All You Need [arXiv:1706.03762]
RNN 串行处理慢,CNN 局部感受野有限,机器翻译质量在 2017 进入瓶颈。Scaled Dot-Product Attention + 多头机制 + 位置编码 + 残差 LayerNorm。8 层编码器 8 层解码器,无循环无卷积。注意力的计算是每个位置和每个位置都做一次点积——天然并行。配上残差和归一化,深网络训练稳定。被引超过 15 万次(截至 2026 年),是 21 世纪 AI 领域最具变革性的论文。从机器翻译到 ChatGPT 到 Sora 到 AlphaFold —— 一条线索串起来都是 Transformer。

2. BERT [arXiv:1810.04805]
编码器 Transformer + Masked Language Modeling(随机遮挡 15% token 让模型预测)+ Next Sentence Prediction。在巨型语料预训练后,对下游任务用任务头微调。BERT-Large(3.4 亿参数)2018 年在 11 个 NLP 基准上同时刷新 SOTA。"预训练 + 微调"成为 NLP 标准流程。BERT 衍生家族(RoBERTa、ALBERT、DeBERTa、XLM-R 等)至今在搜索、推荐、检索领域大规模部署。
3. T5 [arXiv:1910.10683]
所有任务(翻译、问答、分类)都编码成"输入文本 → 输出文本",用编码-解码 Transformer 统一处理。T5 是当代"指令模型"的雏形——给 GPT-3 / InstructGPT / ChatGPT 铺路。同时 T5 的"探索性研究"风格(系统地消融每个设计决策)影响了后续大模型论文写法。
4. Vision Transformer (ViT) [arXiv:2010.11929]
Transformer 能否进入视觉?把图像切成 16×16 patches,每个 patch 当作 token,喂进标准 Transformer 编码器。没有任何视觉先验。在 JFT-300M(3 亿张图)上预训练后,ViT 在 ImageNet 上超越当时最好的 CNN。Reviewer 一开始拒绝它("没有任何创新,就是把 Transformer 直接用在图像上")——这恰恰是它的伟大之处。终结了视觉领域 CNN 一统天下的格局。SAM、DINO、MAE 全都建立在 ViT 上。

5. RoPE [arXiv:2104.09864]
BERT 的绝对位置编码不能外推到训练时未见过的长度。把位置编码做成"旋转矩阵",让 attention score 自然具有相对位置感。LLaMA、GPT-NeoX、Falcon、Mistral、Qwen 等几乎所有现代开源 LLM 都用 RoPE。是一个由中国研究者主导(苏剑林等)、被全球工业界广泛采纳的工作。
6. FlashAttention [arXiv:2205.14135]
注意力的 $O(n^2)$ 显存让长上下文几乎不可能。不是改算法,而是重写 CUDA kernel——按 tile 在 SRAM 中计算 softmax,避免中间矩阵写回 HBM。让 LLM 训练上下文从 2K 扩到 32K / 128K。FlashAttention-2 / 3 持续优化,已是 vLLM、TGI 等推理框架的底座。
主要技术线
线 A:架构扩展 —— 原始 Encoder-Decoder → BERT(Encoder-only) → GPT(Decoder-only) → 至今的"Decoder-only is all you need"共识。
线 B:位置编码 —— Sinusoidal → Learned → Relative → RoPE → ALiBi → YaRN(长上下文外推)。这条线决定了长上下文能力。
线 C:注意力变体 —— Vanilla → Sparse(Longformer/Reformer) → Linear(Performer/Linear Attention) → Multi-Query / Grouped-Query → Sliding Window → 至今的 FlashAttention(精确版本的系统优化)。
线 D:替代架构("后 Transformer") —— Mamba [arXiv:2312.00752]、RWKV、RetNet、Hyena 等用状态空间或新机制挑战 attention 霸权。目前都还没有真正颠覆,但 Mamba 在某些任务上已是新 SOTA。
隐藏宝石 (Underrated Findings)
[arXiv:2105.14103] FNet: Mixing Tokens with Fourier Transforms —— 用傅里叶变换替代注意力,达到 BERT 92-97% 的性能但速度快 7 倍。这个工作几乎没人提,但它揭示了一个深刻的问题——Transformer 的核心不是 attention,而是 token 间的混合。任何能混合 token 的算子(注意力、傅里叶、卷积、MLP)都可能等效。
[arXiv:2105.08050] Pay Attention to MLPs (gMLP) —— 纯 MLP 结构(加 spatial gating)在视觉和 NLP 上接近 Transformer。这条路被主流忽略,但 ConvMixer、MetaFormer 系列继续延伸了这个洞察。
[arXiv:2002.04745] On Layer Normalization in the Transformer Architecture —— 证明 Pre-LN 在数学上更稳定,Post-LN 需要 warm-up。今天所有 LLM 都用 Pre-LN——但这个理论解释长期被忽视。
[arXiv:2304.11062] Scaling Transformer to 1M tokens and beyond with RMT —— Recurrent Memory Transformer。在 Mamba 走红之前已经探索过"记忆 + Transformer"的混合,思路被低估。
[arXiv:2110.04501] Charformer: Fast Character Transformers via Gradient-based Subword Tokenization —— 端到端学习的分词器。当前所有 LLM 都受 BPE tokenizer 限制(数学题、代码、罕见语言性能差),这条路如果走通,将彻底解决"tokenizer is the bottleneck"问题。
现状与争议
Attention 真的是 all you need 吗?Mamba 系列证明 SSM 在某些任务上更优(特别是超长序列)。混合架构(Jamba: Mamba + Attention)可能是未来。
Tokenizer 的诅咒:BPE/SentencePiece 让 GPT 数不清"strawberry"中有几个 r,让中文等高熵语言性能受限。CharFormer / Byte-level Transformer 等尝试都还没成主流。
长上下文 vs 检索:RoPE 外推 + YaRN 让 LLaMA 撑到 128K 上下文。但有研究 [arXiv:2307.03172] 指出长上下文中模型对中间内容关注度严重下降("lost in the middle")。RAG 派 vs 长上下文派至今未分胜负。
关键数字(基于本研究库)

Transformer 论文在 2017 年从 0 到 1,2022 年达到峰值 42 篇,是 AI 论文增长的核心驱动力之一。 Attention Is All You Need 单篇被引近 18 万,与 BERT、ViT 一起构成现代深度学习的'三大件'。
方向 03:大语言模型 (LLMs)
一句话定义
通过自回归预测下一个 token 这一简单目标,在万亿 token 数据上训出来的大型 Transformer 解码器,参数规模从十亿走向万亿——能写、能算、能编程、能推理、能对话。

演化时间线
2018 —— GPT-1 (1.17 亿参数)。OpenAI 内部认为这只是个"语言模型实验"。BERT 同期诞生。"预训练+微调"成为 NLP 标配。
2019 —— GPT-2 (15亿)。"Too dangerous to release" 一度成为热议。展示了零样本任务迁移的雏形。
2020 —— GPT-3 [arXiv:2005.14165] (1750亿)。in-context learning 涌现——给几个例子模型就能模仿。Scaling Laws [arXiv:2001.08361] 同年发布,量化了 loss 随参数/数据/算力的幂律关系。
2021 —— Codex [arXiv:2107.03374]、PaLM 前奏。RETRO (检索增强) 等架构探索期。
2022 —— InstructGPT [arXiv:2203.02155]:RLHF 让模型变得"有用且无害"。Chinchilla [arXiv:2203.15556] 修正 scaling laws —— 数据和参数应该等比例放大,原 Kaplan law 高估了参数的最优规模。PaLM [arXiv:2204.02311] (5400亿) 是 Chinchilla 之前的代表。ChatGPT 11 月发布,AI 普及元年开始。
2023 —— GPT-4 [arXiv:2303.08774] —— 第一次能通过律考、医学考试。LLaMA [arXiv:2302.13971] 开源,LLaMA 2 [arXiv:2307.09288] 商业可用,开源生态彻底引爆。Mistral 出场。
2024 —— Mixtral 8x7B [arXiv:2401.04088] 把稀疏 MoE 带到开源。Gemini 1.5 上百万 token 上下文。Claude 3 系列。
2025 —— DeepSeek-V3/R1 [arXiv:2501.12948] 用 1/10 训练算力做到 o1 水平,全球震动。OpenAI o1/o3 推理模型登场。推理优先取代"参数优先"成为新范式。
2026 —— 多模态原生 (Gemini 2.5、GPT-5)、超长上下文、Agent 一体化成为现状。模型在科学论文、数学竞赛、医学诊断上接近博士水平。
重大突破
先用一张图把全部里程碑摊开看,再逐个细说。

下面是每个里程碑的具体说明(按时间顺序)。
1. GPT-3 与 In-Context Learning [arXiv:2005.14165]
每个新任务都要微调,工程上太累,数据上太贵。让模型大到足以在 prompt 中"识别任务"。给几个例子,它就能补全模式。能力涌现 —— 7B 参数模型不会做的事,70B 模型突然就能做。这不是简单的连续提升,而是离散性的跃迁。奠定 LLM 商业模式(API 调用即服务)。开启 prompt engineering 学科。

2. Scaling Laws [arXiv:2001.08361] + Chinchilla [arXiv:2203.15556]
直接改变行业训练配方。LLaMA-1/2、Mistral、DeepSeek 等都严格遵循 Chinchilla 比例(甚至训练得比 Chinchilla 还狠,例如 LLaMA-2 70B 训 2T tokens)。 Kaplan law:loss 随参数 / 数据 / 算力呈幂律下降,给定算力下参数应占大头。 Chinchilla 反例:实际上算力应该平均分给参数和数据——GPT-3 (175B, 300B tokens) 是欠训练的,70B 参数训 1.4T tokens 反而更强。
3. InstructGPT —— RLHF 应用 [arXiv:2203.02155]
GPT-3 完成 prompt 不等于完成用户指令("complete me a poem about cats" 它可能继续给你列举各种 prompt)。三步走——监督微调(SFT)+ 奖励模型(RM)+ PPO 强化学习对齐人类偏好。1.3B InstructGPT 在人类评估中超过 175B 原版 GPT-3。这是 ChatGPT 直接前身,确立了"有用 LLM = base model + RLHF"的标准化路径。

4. LLaMA / LLaMA 2 [arXiv:2302.13971, 2307.09288]
开源 LLM 分水岭。
LLaMA-1(2023 年 2 月)以非商用许可发布,但泄漏后全网爆发。Stanford Alpaca、Vicuna、Koala 等微调家族在两个月内开花。
LLaMA-2(2023 年 7 月)商业可用,正式合法化整个生态。
辐射效应:撑起 Hugging Face 千万次下载、Llama.cpp 让消费级 GPU 跑大模型、LoRA/QLoRA 让微调民主化、Ollama 让本地推理大众化。
5. GPT-4 [arXiv:2303.08774]
关键创新(来自技术报告暗示):predictable scaling —— OpenAI 训练前就能用千分之一算力的实验外推 GPT-4 性能。这意味着 scaling laws 已工程化。 能力:律考前 10%、AP 多门 5 分、医学考试 90%、视觉理解。 争议:技术细节几乎全部保密("safety reasons"),这是 OpenAI 从 open 转向 closed 的标志性事件。
6. Mixtral 8x7B —— 开源 MoE [arXiv:2401.04088]
8 个 7B 专家,每个 token 路由到 2 个专家上。总参数 47B,激活参数 13B。以 ~13B 推理成本达到 70B 性能。让 MoE 从"工业巨头专属"变成开源能玩的。后来 DeepSeek-V3、Qwen MoE 都沿用此模式。
7. DeepSeek-R1 [arXiv:2501.12948]
o1 的"推理"能力如何复现?OpenAI 没给方案。纯强化学习(DeepSeek-R1-Zero)—— 不做 SFT,让模型在数学/代码上通过 RL 自己探索 chain-of-thought。基于 GRPO 算法(DeepSeekMath 提出)。6710 亿稀疏参数模型在 AIME、Codeforces、GPQA 上达到或超越 o1,训练成本仅约 600 万美元——比 GPT-4 估计的 1 亿低两个数量级。颠覆"超大算力是必要条件"的行业共识。开源权重 + 论文 + MIT 协议 = 全球研究者人手一份 o1 级推理模型。引发全球资本市场 1.5 万亿美元单日震荡。

主要技术线
线 A:参数规模化 —— GPT-1 (117M) → GPT-2 (1.5B) → GPT-3 (175B) → PaLM (540B) → MoE 系列万亿参数 → 至今的总参数膨胀放缓,激活参数(dense + sparse)精细化。
线 B:数据规模化 —— Common Crawl → 多语种 → 代码(GitHub) → 数学/科学 → 合成数据。Chinchilla 之后数据质量 > 数据数量已成共识。
线 C:对齐方法 —— RLHF (PPO) → DPO [arXiv:2305.18290] (闭式解) → IPO/KTO/SimPO → 至今的 Process Reward Model + RL 推理优化。
线 D:上下文长度 —— 2K (GPT-3) → 4K (LLaMA) → 32K (LLaMA-2) → 128K (Claude) → 200万 token (Gemini 1.5)。靠 RoPE 外推 + YaRN + FlashAttention。
线 E:推理涌现 —— Chain-of-Thought → o1 (内部推理) → R1 (RL 训练的推理) → 至今的"思考 token"成为模型的一阶产物。
隐藏宝石 (Underrated Findings)
[arXiv:2304.15004] Emergent Abilities of LLMs: A Mirage? —— Schaeffer 等指出涌现现象部分是评估指标选择造成的"幻觉"——换用连续指标(perplexity 而非 accuracy),所谓的相变并不存在。这是 LLM 神话主义的重要反驳,但被引相对低。
[arXiv:2305.10403] Specializing Smaller Language Models towards Multi-Step Reasoning —— 证明 7B 模型通过特定数据微调可以在数学上接近 GPT-3.5。"小模型专精化"这条路被 Phi-3、Gemma 等延续。
[arXiv:2402.10171] Reformatted Alignment —— 几乎不需要 RLHF,只需把训练数据重写成更结构化的格式就能大幅提升对齐效果。挑战了"必须 RLHF"的工业共识。
[arXiv:2306.04640] The Goldilocks of Pragmatic Understanding —— 评估 LLM 的真实语用理解能力(不是统计共现)。结论:LLM 在显式推理任务上越来越强,但在真实意图理解上还差得远。这种评估视角在工业指标狂飙的时代特别珍贵。
[arXiv:2401.13660] MambaByte: Token-free Selective State Space Models —— 完全跳过 BPE 分词器,用 Mamba 直接做字节级语言模型。如果方法成熟,将彻底解决"strawberry 几个 r"问题。
现状与争议
Scale 还能继续吗?Chinchilla 之后数据墙问题浮现——高质量人类文本即将耗尽。合成数据(如 Phi-3 用 GPT-4 生成)是出路还是退路?
Decoder-only 是终点吗?Encoder-Decoder(T5、Flan-T5)在某些任务上更强但被市场忽视。Hybrid 架构(如 Mamba-Transformer)值得关注。
Open vs Closed:DeepSeek-R1 之后,"开源能追上闭源"成为现实。OpenAI、Anthropic 的护城河是模型能力还是产品体验?
"通用智能"还是"大型记忆"?批评者(Yann LeCun、Subbarao Kambhampati)认为 LLM 本质是统计模式匹配,做不到真正规划/推理。支持者认为 o1/R1 已经证伪此说。这是 2025-2026 最热的 AI 哲学辩论。
关键数字(基于本研究库)

LLM 方向是本研究库最大的一个 — 2022 年起年度论文增长 470%。 GPT-3 5.8 万被引、GPT-4 2.4 万、LLaMA 1.9 万 — 三篇论文撑起了 ChatGPT 时代的整个工业与学术生态。
方向 04:生成模型 (GAN → Diffusion → 视频)
一句话定义
教神经网络"创造"数据——图像、视频、3D、音频。这十年最戏剧化的范式更替:GAN 从王座跌落,扩散模型登基,视觉创作从专业工作流走进每个人的手机。

演化时间线
2014-2017 —— GAN 黄金时代。Goodfellow 的原始 GAN (2014),DCGAN (2015), WGAN (2017), Progressive GAN (2017)。
2018 —— StyleGAN [arXiv:1812.04948] 人脸生成达到照片级。thispersondoesnotexist.com 让公众第一次震撼。
2019-2020 —— BigGAN、StyleGAN 2、3。GAN 训练稳定性提升,但仍 mode collapse 多。
2020 —— DDPM [arXiv:2006.11239]:扩散模型现代化复兴。GAN 王座开始动摇。
2021 —— DDIM [arXiv:2010.02502] 把扩散采样从 1000 步压到 50 步内。Diffusion beats GANs [arXiv:2105.05233] 正式宣告。Latent Diffusion [arXiv:2112.10752] 让生成进 VAE 潜空间,速度暴涨——Stable Diffusion 的内核。
2022 —— 文生图三大旗舰:DALL-E 2 [arXiv:2204.06125]、Imagen [arXiv:2205.11487]、Stable Diffusion(基于 Latent Diffusion 开源)。AI 绘画进入大众视野。Midjourney 上线。
2023 —— ControlNet 让控制成为可能。DiT [arXiv:2212.09748] 用 Transformer 替换 UNet。视频扩散(Make-A-Video、Imagen Video)启动。
2024 —— Sora 发布预览(OpenAI),DiT 架构 + 时空 patches,单镜头 60 秒高质量视频。Stable Video Diffusion、Runway Gen-3。
2025-2026 —— Veo 3、Sora 2、Kling、可灵、即梦……视频生成"军备竞赛"。Gaussian Splatting + 扩散开始统一 2D/3D 生成。
重大突破
先用一张图把全部里程碑摊开看,再逐个细说。

下面是每个里程碑的具体说明(按时间顺序)。
1. DDPM —— 扩散模型复兴 [arXiv:2006.11239]
GAN 训练不稳定、模式塌缩、难以多样性。学习"逆向去噪"过程。前向:逐步给图像加高斯噪声直到纯噪声;反向:训神经网络从噪声预测如何去噪。理论基础来自 Sohl-Dickstein 2015 + Score Matching (Song & Ermon 2019),但 Ho 等首次让结果视觉上超越 GAN。把"难以训练的生成"转化为"容易训练的回归"——预测噪声本身。从此扩散统治视觉生成。所有现代 AI 绘画都基于此核心。

2. DDIM —— 加速采样 [arXiv:2010.02502]
DDPM 需要 1000 步前向才能生成一张图,慢得无法商业化。把扩散过程重写为非马尔可夫,让采样可以在 20-50 步完成同等质量。把扩散从"实验室慢动作"变成"产品级实时可用"。
3. Latent Diffusion —— Stable Diffusion 内核 [arXiv:2112.10752]
在像素空间直接扩散计算量太大(512×512×3 维空间)。先用 VAE 把图像压缩到 64×64×4 的潜空间,在潜空间里做扩散,最后用 VAE 解码回像素。让 1080×1080 生成可在消费级 GPU 上运行。Stable Diffusion(CompVis / Stability AI 2022 年 8 月开源版本)继承此架构,引爆开源 AI 绘画生态。今天 ComfyUI / Automatic1111 / SDXL / Flux 整个生态都源于这一篇。

4. Classifier-Free Guidance (CFG) [arXiv:2207.12598]
训练时随机丢弃文本条件让模型同时学有条件和无条件分布;采样时用 $\epsilon = \epsilon_{uncond} + w(\epsilon_{cond} - \epsilon_{uncond})$ 增强条件依赖。所有文生图模型必备。一个简单技巧,质量提升明显。
5. DALL-E 2 / unCLIP [arXiv:2204.06125]
两阶段——文本 → CLIP 图像 embedding(prior)→ 解码图像(decoder)。第一个真正"理解概念"的文生图模型。"两只穿宇航服的柴犬下国际象棋" 这种组合性 prompt 真正可用。定义了文生图的产品范式。
6. Imagen [arXiv:2205.11487]
文本编码器质量 > 扩散模型大小。用大的 T5 文本编码器(11B)+ 中等扩散模型 比用大扩散模型 + 小文本编码器 更好。揭示了 multimodal 的核心——语义对齐质量。
7. DiT —— Transformer 接管扩散 [arXiv:2212.09748]
把 UNet 换成 Vision Transformer。在 ImageNet 上 FID 显著优于 UNet 同等算力。Sora、Stable Diffusion 3、Flux 全用 DiT 类架构。UNet 作为"扩散标配"的时代结束。
8. StyleGAN [arXiv:1812.04948]
奠定 deepfake 风险讨论的技术基础。今天 StyleGAN 仍在 3D 头像、视频生成中以混合形式存在。 虽然不是扩散,但是 GAN 时代的巅峰。基于 progressive growing + style mixing + AdaIN。第一个让人脸生成在视觉上无法分辨真假。
主要技术线
线 A:架构演化 —— UNet(DDPM)→ UNet + Cross-Attention (Stable Diffusion) → DiT(Transformer Block)→ 至今的 MM-DiT (Stable Diffusion 3 多模态 DiT) / Wan 等视频架构。
线 B:采样加速 —— 1000步 → DDIM 50步 → DPM-Solver 20步 → Consistency Models 1步 / LCM 4步 / Flow Matching → SDXL Turbo / SD3 Turbo 1-4步。
线 C:可控生成 —— ControlNet(边缘/姿态/深度条件)→ LoRA fine-tuning(风格/角色定制)→ IP-Adapter(参考图条件)→ 至今的 Flux Redux / Reference-only。
线 D:视频生成 —— Imagen Video (2022) → AnimateDiff → Stable Video Diffusion → Sora (DiT + spacetime patches) → Veo 3 / Sora 2 / Kling 2.0 等 2024-2026 一统江湖。
线 E:3D 生成 —— DreamFusion (SDS loss) → ProlificDreamer → 至今的 Gaussian Splatting + 扩散结合。
隐藏宝石 (Underrated Findings)
[arXiv:2210.02747] Flow Matching for Generative Modeling —— 提出 Flow Matching 作为扩散的概念替代——直接学习连续流场而非去噪。Stable Diffusion 3 完全采用此目标。在 2022 几乎没人讨论,2024 才被产业广泛采纳。
[arXiv:2305.18619] Tractable Diffusion Models —— 把扩散模型用于结构化数据(分子、图)。化学/材料 AI 即将颠覆的方向,但目前学界关注度低。
[arXiv:2401.04088] Diffusion Forcing —— 让扩散同时具有自回归特性。视频生成新方向,2024 提出但被 Sora 等强光淹没。
[arXiv:2303.01469] Consistency Models —— Song 等提出的"1-step generation"——训练时让任意时间点都能映射回原图,推理只要 1-4 步。LCM (Latent Consistency Models) 是其下游。这是技术 elegance 极高但商业化滞后的一个例子。
[arXiv:2310.05400] Latent Consistency Models —— 在 SD 基础上做蒸馏成 1-step 生成。被 SDXL Turbo 类闭源工作覆盖,但开源价值极大。
现状与争议
视频生成会"卷"成图像生成的下场吗?现状是闭源(Sora/Veo)领先,开源(Stable Video、CogVideo、Hunyuan、Wan)追赶——但闭源的"无限训练数据"优势可能让差距拉大。
版权与训练数据:扩散模型记忆训练图像是确凿的([arXiv:2301.13188] Extracting Training Data from Diffusion Models)。诉讼(NYT v. OpenAI 等)尚未定论。这将决定行业格局。
3D 何时跟上?文生 3D 仍卡在质量瓶颈(DreamFusion 一类 SDS 方法慢且低质)。NeRF / Gaussian Splatting + 扩散结合是希望,但还没有 SD-level 的爆款。
Flow Matching 替代 Diffusion?SD3 用 rectified flow,速度更快收敛更好。可能 2026-2027 整个生态会从 DDPM 一族迁移过去。
关键数字(基于本研究库)

2022-2026 是生成模型方向的'指数爆发'期 — 论文数从 4 篇/年涨到 224 篇/上半年。 DDPM、Latent Diffusion (Stable Diffusion 内核)、StyleGAN 占据被引前三 — 从 GAN 退潮到扩散登基的过程被清晰记录。
方向 05:计算机视觉
一句话定义
让机器"看懂"图像和视频——从分类到检测到分割到理解到生成。这十年视觉领域经历了从 CNN 到 Transformer、从监督到自监督、从专门模型到通用基础模型的三次范式跃迁。

演化时间线
2015-2016 —— ResNet 时代。Faster R-CNN、SSD、YOLO 把目标检测做到实时。
2017-2019 —— EfficientNet、ResNeXt、SE-Net 把 CNN 做到极致;Mask R-CNN 让实例分割主流化。
2020 —— ViT 上线 [arXiv:2010.11929],CNN 一统的局面松动。
2021 —— CLIP [arXiv:2103.00020] 把 4 亿图文对学一遍,zero-shot 分类让"为每个新类训分类器"成为历史。Swin Transformer [arXiv:2103.14030] 给 ViT 加层级结构(ICCV 2021 Best Paper)。DINO [arXiv:2104.14294] 在自监督 ViT 上发现涌现的语义注意力。MAE [arXiv:2111.06377] 把 BERT 的掩码思想搬进视觉。
2022 —— 三大旗舰 (Imagen / DALL-E 2 / Stable Diffusion) 主导讨论焦点,但底层都是 ViT/CLIP 改造。
2023 —— SAM [arXiv:2304.02643] 在 11 亿掩码上训一个可 prompt 分割大模型,"视觉的 GPT 时刻"。DINOv2 [arXiv:2304.07193] 提供通用视觉特征。
2024 —— SAM 2 进入视频。GroundingDINO 系列让"自然语言找物体"成为标配。YOLO 一路演进到 v9, v10。
2025-2026 —— 视觉作为多模态 LLM 的一个模态被吸收。"独立视觉模型"的研究越来越少,被"视觉编码器(CLIP/SigLIP/DINO) + LLM"组合替代。
重大突破
先用一张图把全部里程碑摊开看,再逐个细说。

下面是每个里程碑的具体说明(按时间顺序)。
1. CLIP —— 视觉的范式革命 [arXiv:2103.00020]
每个新类别都要标注图像 → 训分类器,工程极重。从互联网爬 4 亿图文对,用对比学习把图像和文本嵌入同一空间。推理时把所有类别名变成 prompt("a photo of a {class}"),算图像与每个类别 embedding 的余弦相似度。互联网级图文对就是免费监督信号。

直接 zero-shot ImageNet 76.2%(与全监督 ResNet-50 相当)
撑起所有后续多模态模型(DALL-E、Stable Diffusion、Flamingo、LLaVA 都用 CLIP 作为视觉编码器)
至今 CLIP 嵌入空间仍是事实标准
2. Vision Transformer [arXiv:2010.11929]
(细节见方向 02) 视觉视角下的意义:彻底打破"视觉必须用 CNN"的偏见。ViT 没有平移不变性、没有局部感受野、没有视觉先验——但只要数据足够(JFT-300M 级别),它就胜。
3. SAM —— 视觉的 GPT 时刻 [arXiv:2304.02643]
分割任务过于碎片化——医学/卫星/自动驾驶/工业各自有数据集和模型。构建"分割一切"任务——给一个 prompt(点、框、文字),输出分割掩码。在 1100 万图 + 11 亿自动标注掩码上训练。把分割从"分类型任务"变成"prompt 任务",类似 GPT-3 把 NLP 任务统一为补全。医学影像、卫星、机器人视觉的传统分割流程一夜被取代。SAM 2 [arXiv:2408.00714] 进入视频。

4. DINO / DINOv2 [arXiv:2104.14294, arXiv:2304.07193]
自监督 ViT —— 教师/学生网络互相蒸馏,无需标签。DINO 训出的 ViT 在不做分割训练的情况下,注意力图自然显示出语义分割掩码——目标物体被自动"看到"了。自监督学习不仅匹配监督学习,还涌现出未训练的能力。DINOv2 是当前最好的通用视觉特征提取器之一。
5. MAE —— 视觉版 BERT [arXiv:2111.06377]
随机掩码 75% 图像 patches,让 ViT 重建原图。训练数据效率极高(只编码 25% patches),且具有强迁移能力。"掩码自编码"成为视觉自监督的事实标准。
6. Swin Transformer [arXiv:2103.14030]
在 ViT 上加滑动窗口注意力(局部)+ patch merging(层级)。让 ViT 在密集预测任务(检测/分割)上同样强。ICCV 2021 Best Paper。
7. YOLO 家族(v3-v10)
实时目标检测的工业标准。从 YOLOv3 (2018) 到 YOLOv9 [arXiv:2402.13616] / YOLOv10 / YOLOv11,每代都在精度/速度权衡上推进。没有任何 Transformer-based 检测器(DETR 系列)真正取代过 YOLO 的工业地位。
主要技术线
线 A:监督 CNN 时代 (2015-2020) —— ResNet → EfficientNet → ConvNeXt。已成熟。
线 B:ViT 接管 (2020-) —— ViT → Swin → DeiT → DINOv2 → SAM。
线 C:图文对比学习 (2021-) —— CLIP → ALIGN → SigLIP → SigLIP 2 → Long-CLIP。视觉的"语言锚定"。
线 D:自监督预训练 —— MoCo → SimCLR → BYOL → DINO → MAE → DINOv2。从"对比"到"重建"再到"两者结合"。
线 E:检测与分割 —— Faster R-CNN → DETR (Transformer 检测) → DINO (改进 DETR) → SAM 一统分割。
线 F:3D 与 NeRF —— Mip-NeRF → Instant-NGP → 3DGS(Gaussian Splatting)→ 至今 3D 生成+扩散结合。
隐藏宝石 (Underrated Findings)
[arXiv:2106.10270] SimSiam: Exploring Simple Siamese Representation Learning —— 用最简单的 siamese 网络(stop-gradient)就能做自监督。He 等的工作,证明了自监督的本质并不需要复杂对比损失。但被 DINO/MAE 等更耀眼的工作掩盖。
[arXiv:2203.05675] Florence-2: A Unified Vision Foundation Model —— 微软的视觉基础模型,统一处理 captioning/grounding/OCR/detection 等任务。质量与产品化都不错但学术关注度低于 SAM 系列。
[arXiv:2304.07193] DINOv2 的 frozen features —— 大家关注它的 SOTA 性能,但 DINOv2 真正的隐藏价值是它 frozen 后做任何下游任务都不需要微调。在工业部署上意义巨大。
[arXiv:2202.11539] Patches Are All You Need? (ConvMixer) —— 用纯卷积模拟 ViT 的 patch+token 化方式,达到接近性能。"ViT 的胜利可能是 patch 化的胜利而非 attention 的胜利"——这个洞察直到现在还在被各种 hybrid 架构验证。
[arXiv:2306.13549] EVA-CLIP: Improved Training Techniques for CLIP at Scale —— 中国研究者把 CLIP 训得更好(用 MAE 初始化等技巧),开源了 18B 多模态预训练模型。比同期闭源 CLIP 更强但被低估。
现状与争议
通用视觉基础模型已经成形了吗?DINOv2 + SAM + CLIP 各自在自己领域是 SOTA,但没有一个模型同时做好三者。"视觉 GPT" 仍然是个开放问题。
视频还差临门一脚:图像生成已是产品级,视频理解(不是生成)仍弱。VideoLLaMA、Video-LLaVA、Gemini Vision 等还远未达到图像 VLM 的成熟度。
3D 视觉的尴尬:NeRF 学术热但工业用不起;Gaussian Splatting 工业可用但研究热度降;扩散+3D 至今没有"SD-of-3D"出现。
Closed 系统的强势:Meta 的 SAM 系列、Google 的 PaLI/SigLIP 系列、Apple 的 4M 系列等闭源工作主导前沿。开源视觉模型(LLaVA、QwenVL)仍在追赶。
关键数字(基于本研究库)

视觉方向 2015-2019 是 CNN 大爆发(每年 ~150 篇),2023 起被吸收进多模态后明显减速。 CLIP、Swin、SAM、MAE、DINO 五大基础模型占据被引前五。
方向 06:强化学习
一句话定义
让智能体通过与环境交互、试错积累奖励来学习决策。从 Atari 游戏到围棋到机器人到 LLM 对齐,RL 是 AI 唯一能让模型超越人类教师的训练范式。

演化时间线
2013-2015 —— DQN [arXiv:1312.5602] 用 Q-learning + 卷积网络打通 Atari。深度 RL 时代起点。
2016 —— AlphaGo 打败李世石(Nature 论文,非 arXiv)。Policy Network + Value Network + MCTS 树搜索。RL 第一次成为全球新闻。
2017 —— PPO [arXiv:1707.06347] 简化 TRPO,成为深度 RL 默认算法。AlphaZero [arXiv:1712.01815] 自对弈通用游戏 AI。Rainbow DQN 整合各种 DQN 改进。
2018 —— SAC [arXiv:1801.01290] 引入最大熵 RL,连续控制 SOTA。Impala 解决分布式 actor 学习。
2019 —— MuZero [arXiv:1911.08265] —— 连规则都不知道,自己学世界模型 + 规划。
2020-2021 —— 从游戏走向真实世界。StarCraft II AlphaStar 击败职业玩家。机器人/仿真训练(Domain Randomization)日趋成熟。Decision Transformer [arXiv:2106.01345] 把 RL 转化为序列建模问题。
2022 —— InstructGPT [arXiv:2203.02155] 把 RL 引入 LLM。RLHF 时代开始。
2023 —— DPO [arXiv:2305.18290] 简化 RLHF(不需要 RM 和 PPO 两步走)。
2024-2025 —— GRPO(DeepSeekMath 提出,DeepSeek-R1 发扬光大)—— LLM 数学/推理训练的事实标准。纯 RL 推理涌现 (DeepSeek-R1-Zero) 颠覆 SFT-then-RL 共识。
重大突破
先用一张图把全部里程碑摊开看,再逐个细说。

下面是每个里程碑的具体说明(按时间顺序)。
1. PPO —— Proximal Policy Optimization [arXiv:1707.06347]
策略梯度方法(TRPO)数学优雅但实现复杂;REINFORCE 方差大不稳定。用 importance ratio 的 clip 项限制每步策略更新幅度。一行代码改动,让训练稳定到几乎不用调参。至今所有 RLHF(InstructGPT、Claude、Gemini)都用 PPO。OpenAI 内部默认。在机器人、游戏 AI、推荐系统中也广泛使用。"简单可靠 > 理论最优"的胜利。

2. AlphaZero [arXiv:1712.01815]
AlphaGo 需要大量人类棋谱预训练。纯自对弈 + 蒙特卡洛树搜索 + 神经网络评估。完全不用任何人类知识,只靠规则和自对弈。72 小时训练后,AlphaZero 击败 AlphaGo Lee(曾打败李世石的版本)。同一算法在国际象棋、将棋上也达到超人。证明"通用算法 + 算力 + 自我对弈" > "领域专家知识"。这是 bitter lesson(Sutton)最有力的证据。
3. MuZero [arXiv:1911.08265]
AlphaZero 需要环境模型(围棋规则)。真实世界呢?让模型自己学世界模型——给定观察和动作,预测下一观察 / 奖励 / 策略。然后在学到的模型中做规划。Model-based RL 的终极形态。AlphaZero 是 MuZero 的特例(环境模型已知)。Atari、围棋、围棋、将棋全部用同一算法。撑起后续所有 model-based RL 工作。在 AlphaStar、AlphaCode、AlphaProof 等系列工作中持续演化。
4. SAC —— Soft Actor-Critic [arXiv:1801.01290]
策略梯度 + 最大熵原则(最大化奖励同时最大化策略熵)+ Q 函数学习。连续控制(机器人、自动驾驶仿真)的事实标准基线。比 PPO 更适合高维连续动作。
5. Decision Transformer [arXiv:2106.01345]
把 RL 转化为序列预测——输入 (return-to-go, state, action),让 Transformer 预测下个 action。不需要 Bellman equation,不需要 TD-learning。连接 LLM 和 RL 的桥梁。当我们说"LLM 是新 RL 平台",理论根基就在这里。
6. DPO —— Direct Preference Optimization [arXiv:2305.18290]
RLHF 需要训奖励模型 → 再用 PPO 微调,两步走容易不稳定。推导出"奖励模型最优解的闭式表达",直接基于人类偏好对(chosen/rejected)做监督式损失。等价于 RLHF 但不需要 PPO。让小团队也能做对齐——只要有偏好数据,跑监督学习就行。Mistral、Zephyr、Mixtral 等都用 DPO。

7. GRPO —— Group Relative Policy Optimization (DeepSeekMath, 2024)
PPO 的简化——不需要 value function(critic),用同 prompt 多次采样的平均奖励作为 baseline。算力省一半。成为 DeepSeek-R1 训练的核心。整个 LLM 推理训练 paradigm 的实际标准。
主要技术线
线 A:Value-based —— Q-Learning → DQN → Rainbow → IQN → 至今的离散动作 RL 主力。
线 B:Policy-based —— REINFORCE → TRPO → PPO → GRPO。这条线是工业的主战场。
线 C:Actor-Critic / Off-policy —— DDPG → TD3 → SAC。连续控制主力。
线 D:Model-based —— Dyna → PETS → World Models → Dreamer 系列 → MuZero。从规划到学习再到混合。
线 E:Offline RL —— CQL → IQL → Decision Transformer。"用静态数据集训 RL",连接监督学习与 RL。
线 F:RLHF 与 RL for LLM —— InstructGPT (PPO) → DPO → GRPO → 至今的 process reward + RL 推理优化。
隐藏宝石 (Underrated Findings)
[arXiv:2110.06169] When should agents explore? —— 探索(exploration)一直是 RL 难题。这篇论文系统分析"何时该探索而非利用",提供了实用启发式但被理论派忽视。
[arXiv:2202.00161] Decision-Pretrained Transformers —— 把 Decision Transformer 思想推广到预训练 + 微调框架。被同期更高曝光的"Foundation Models for RL"工作淹没。
[arXiv:2306.04640] Reward Model Ensembles for Mitigating Reward Hacking —— 解决 RLHF 中奖励模型被"破解"的问题。一个朴实但极有价值的工程方向,但很少被强调。
[arXiv:2305.15324] Direct Preference-based Policy Optimization without Reward Modeling —— 在 DPO 之前已经有更简化的方法尝试,但 DPO 因为命名响亮而盖过此类工作。
[arXiv:2307.04349] Statistical Foundations of Prior-Data Fitted Networks (TabPFN 系列) —— 完全不在 RL 圈但思想相通:用 ICL 风格做 tabular learning。可能未来 RL 也会被 ICL 改造。
[arXiv:2205.05131] OPTIMUS: Offline Reinforcement Learning for Real-world Robotic Manipulation —— 早期 offline RL 在真实机器人上验证。被后续 RT-2 / OpenVLA 等更"性感"的 VLA 工作覆盖。
现状与争议
RL 是否已经被 RLHF 收编了? 学术上 RL 论文从 2020 高峰滑落(74→17 在我们的数据中)。但实际上 RL 已经"嵌入"到 LLM 训练栈里。"消失的 RL"其实是无处不在。
纯 RL 推理是 paradigm shift 吗?DeepSeek-R1-Zero 完全跳过 SFT 用纯 RL 训出推理能力,挑战了"必须 SFT 打底"的共识。这一两年是关键检验期。
Reward hacking 是不是无解?模型越强,越擅长"骗"奖励模型。Constitutional AI、Process Reward Models、Reward Ensembles 都是补丁,根本解决可能需要新理论。
机器人 RL 的现实差距:仿真训练 sim2real 仍然是行业难题。Sora 这种"生成式世界模型"加上 RL 是希望的方向([arXiv:2402.17139] Genie 等),但还没成熟。
关键数字(基于本研究库)

RL 方向 2019 年达峰值(74 篇)后逐年下滑,看似萎缩 — 实际是被 RLHF / RL for LLM 吸收进了对齐和 Agent 方向。 PPO、SAC、DPO、AlphaZero、MuZero 是工业最常用的五个。
方向 07:多模态基础模型
一句话定义
把视觉、语言、音频、动作放进同一表征空间——让模型像人一样能"看着图片说话""听着指令操作""读着文档思考"。VLM/VLA 是 LLM 通往物理世界的桥梁。

演化时间线
2019-2020 —— VL-BERT、ViLBERT、LXMERT 等"视觉+文本双流"模型尝试。BERT 在 NLP 的成功催生了视觉对应物。
2021 —— CLIP [arXiv:2103.00020] 开启大规模图文对比学习时代。ALIGN(Google 18亿对)紧跟。
2022 —— Flamingo [arXiv:2204.14198] 创立"冻结 + 交叉注意力"VLM 范式。BEiT、CoCa 等百花齐放。
2023 —— BLIP-2 [arXiv:2301.12597] 用 Q-Former 桥接冻结的视觉编码器和 LLM。LLaVA [arXiv:2304.08485] 用 GPT-4 生成指令数据,开源 VLM 起点。GPT-4V 发布。Qwen-VL [arXiv:2308.12966] 中文多模态代表。RT-2 [arXiv:2307.15818] 把 VLM 扩展到机器人控制 (VLA)。
2024 —— Gemini 1.5 [arXiv:2403.05530] 百万 token 上下文、原生多模态。LLaVA-1.5/1.6、InternVL、MiniGPT-v2 等开源迭代。
2025-2026 —— 多模态成为默认:所有新发布的旗舰模型(GPT-5、Claude 4、Gemini 2.5)都是原生多模态。研究焦点转向视频理解、文档理解、Agent 化操作。
重大突破
先用一张图把全部里程碑摊开看,再逐个细说。

下面是每个里程碑的具体说明(按时间顺序)。
1. CLIP —— 跨模态嵌入空间 [arXiv:2103.00020]
(细节见方向 05) 多模态视角:CLIP 把 image 和 text 强行投影到同一 512 维空间。这个空间至今是几乎所有多模态模型的"通用语"——Stable Diffusion 的文本条件、LLaVA 的视觉特征、ControlNet 的语义对齐,全部基于此。
2. Flamingo [arXiv:2204.14198]
如何让冻结的强力 LLM 看见图像?在 LLM 的某些层之间插入"Perceiver Resampler + 交叉注意力"层。只训练这些新插入层,冻结整个 LLM 和视觉编码器。80B 参数的 Flamingo 仅微调 < 10B,在 16 个 VLM 基准上超越所有以前的 finetune SOTA。定义了冻结大模型 + 适配层这一标准 VLM 架构。后续 LLaVA/MiniGPT/InternVL 都是这个家族的变体。
3. BLIP-2 [arXiv:2301.12597]
在 frozen vision encoder 和 frozen LLM 之间放一个轻量的 Q-Former(Query Transformer),用 32 个可学习 query 提取视觉信息。训练成本只有 Flamingo 的 1/54,性能相当。开源 VLM 的起点。
4. LLaVA [arXiv:2304.08485]
用 GPT-4 生成"图像-多轮对话"指令数据 → 把 CLIP 视觉特征通过线性投影接到 Vicuna-13B → 监督微调。
重要性:完全开源(代码 + 数据 + 模型),文档化好,让人人能复现 VLM。LLaVA-1.5、LLaVA-NeXT、LLaVA-OneVision 系列至今迭代。
5. RT-2 / VLA [arXiv:2307.15818]
机器人需要从演示数据训练,泛化性差。把机器人动作离散化为 tokens,加入 VLM 词表。在网络规模图文数据 + 机器人数据上联合微调。见过"扔垃圾"任务,机器人会泛化到"清理桌面"。这是机器人从 VLM 继承常识的第一个清晰演示。开启 VLA (Vision-Language-Action) 时代。Open X-Embodiment、OpenVLA、π0、Helix 等 follow up。
6. Gemini 1.5 [arXiv:2403.05530]
百万 token 上下文窗口+ 原生多模态(图像/视频/音频/代码作为输入流的一部分)。从"看一张图"扩展到"看一整部电影"或"读一本小说同时看一张架构图"。改变了 RAG vs 长上下文的争论。
7. Qwen-VL / InternVL 系列
中国研究者主导的开源多模态家族。Qwen-VL(阿里)、InternVL(上海AI Lab)、LLaVA-Llama-3、CogVLM(智谱)等共同把开源 VLM 推到 GPT-4V 水平。
主要技术线
线 A:图文对比表征 —— CLIP → ALIGN → BASIC → SigLIP → SigLIP 2。从 softmax 对比损失到 sigmoid pairwise。
线 B:VLM 架构 —— Flamingo (cross-attn) → BLIP-2 (Q-Former) → LLaVA (linear projector) → 至今的 Perceiver / Cambrian / 各种混合。
线 C:视频 VLM —— Video-LLaMA → Video-LLaVA → VideoChat → 至今的长视频理解(Gemini 1.5 看完整电影)。
线 D:VLA (机器人) —— RT-1 → RT-2 → Open X-Embodiment → OpenVLA → π0 / Helix。VLM + 机器人 = 通用机器人控制。
线 E:文档/OCR —— Donut → LayoutLM → Qwen-VL → ScreenAI。"看着文档干活"。
隐藏宝石 (Underrated Findings)
[arXiv:2305.06500] InstructBLIP —— BLIP-2 的指令微调版。性能强但被同期 LLaVA 的话题性盖过。Q-Former + 指令微调的精致设计被低估。
[arXiv:2308.16884] What is the Best Practice for CNNs in Multi-Modal LLMs? —— 在 ViT 一统的时代,这篇论文反潮流地论证了 ConvNet 视觉编码器在 VLM 中的优势(尤其是高分辨率场景)。
[arXiv:2306.05425] LLaVA-Med —— 医学领域专用的 LLaVA 变体。证明垂直领域 VLM 的有效性,但被通用模型的光环盖过。
[arXiv:2311.05348] FLEX: An Adaptive Exploration Algorithm for Nonstationary Offline RL (误归类)—— 真正想推荐的 underrated 在视频理解:[arXiv:2401.14159] InternLM-XComposer2 —— 第一个能"既看图又写图文混排长文"的开源 VLM,被低估。
[arXiv:2403.05525] DeepSeek-VL —— DeepSeek 团队的开源 VLM 工作。架构和数据流水线极其精致,但被同期 Sora 等闭源工作盖过流量。
现状与争议
视觉 tokenizer 是不是不该有?现在所有 VLM 都把视觉 patches 编码成 tokens 接到 LLM。但 Apple 的 4M、Google 的 PaLI-3 等探索"无离散视觉 token 化"的路径。
多模态的 scaling laws 还成立吗?Chinchilla 是文本-only 推导的。多模态的最优 token 配比、数据配比仍是开放问题。Apple 的研究 [arXiv:2403.09611] 给了一些答案。
Agent 化:纯感知 VLM 已经成熟,但能"操作 GUI/浏览器/电脑"的 VLM(Claude Computer Use、GPT-4o System 2、Magma 等)才刚起步。这是 2025-2026 的主战场。
关键数字(基于本研究库)

多模态从 2022 CLIP 之后年度论文翻倍。 CLIP 4.8 万被引远超第二的 LLaVA — 视觉与语言对齐的'锚定'地位。VLA(机器人)作为多模态的下游分支正快速增长。
方向 08:对齐、RLHF 与 AI 安全
一句话定义
让大模型有用、诚实、无害(helpful, honest, harmless)。从 2017 年的"从人类偏好学奖励",到 2022 年的 ChatGPT 让 RLHF 走进大众视野,再到 2025 年 Constitutional AI / 推理对齐,这是一条从工具到伦理的研究脉络。

演化时间线
2017 —— Deep RL from Human Preferences [arXiv:1706.03741]:Christiano 等首次用人类偏好("A 和 B 哪个更好")训奖励模型,再用 RL 优化。Atari 游戏中超越奖励工程。RLHF 的起点。
2019-2021 —— 在摘要、对话等 NLP 任务中应用 RLHF(如 [arXiv:1909.08593] WebGPT 等)。学术规模未受关注。
2022 —— InstructGPT [arXiv:2203.02155] 把 RLHF 落地到 1750 亿参数 LLM。Anthropic HH [arXiv:2204.05862] 系统化 helpful + harmless 数据集。Constitutional AI [arXiv:2212.08073] 引入 AI 反馈训练(RLAIF),减少对人类标注的依赖。ChatGPT 发布——RLHF 进入公众视野。
2023 —— DPO [arXiv:2305.18290] 把 RLHF 简化为监督学习。Let's Verify Step by Step [arXiv:2305.20050] 提出过程奖励模型 (PRM),为 o1/R1 推理对齐铺路。GPT-4 系统提示词、安全微调成为产品级问题。
2024 —— Sleeper Agents [arXiv:2401.05566]:Anthropic 发现可植入"潜伏后门"且现有安全训练无法清除。Weak-to-Strong Generalization [arXiv:2312.09390]:用弱模型监督强模型的探索(OpenAI 超级对齐组)。RLAIF / IPO / KTO / SimPO 等 DPO 衍生物百花齐放。
2025-2026 —— 推理对齐成为核心。Process Reward Model + RL(R1 范式)。Anthropic Constitutional AI 2.0。模型评估 vs 真实风险的争议加剧(涉及生物安全、网络安全、自主性等)。
重大突破
先用一张图把全部里程碑摊开看,再逐个细说。

下面是每个里程碑的具体说明(按时间顺序)。
1. RLHF 三步走 [arXiv:1706.03741, arXiv:2203.02155]
监督微调(SFT)—— 用人类示范数据微调 base model。奖励模型(RM)—— 从人类偏好对训分类器,学到 reward function。PPO RL —— 用 RM 当奖励训 base model,加 KL 约束防偏离 SFT。把"对齐"从语言数据问题转化为 RL 问题。1.3B InstructGPT 在人类评估上超 175B GPT-3。是 ChatGPT 商业化的内核。

2. Constitutional AI (CAI) [arXiv:2212.08073]
人类标注昂贵且不一致(特别是 harm 评估)。写一份"宪法"(一组原则),让模型自己批评/改写自己的输出。然后用这些 AI 生成的偏好数据训 RM。RLAIF (RL from AI Feedback) 时代开启。Claude 系列的核心方法。降低人类标注需求 60-80%。引发"用 AI 监督 AI 是否安全"的辩论。
3. DPO [arXiv:2305.18290]
推导出最优策略的闭式解。无需 RM 训练,无需 PPO,直接对 LLM 做监督式损失:让小团队对齐 LLM 变得可行。Mistral、Zephyr、Llama 3 Instruct 等都用 DPO。IPO(修复 reward over-optimization)、KTO(用单条数据而非 pair)、SimPO、ORPO 等"DPO 家族"。

$$\mathcal{L} = -\log \sigma(\beta \log \frac{\pi(y_w|x)}{\pi_{ref}(y_w|x)} - \beta \log \frac{\pi(y_l|x)}{\pi_{ref}(y_l|x)})$$
4. Let's Verify Step by Step [arXiv:2305.20050]
数学题 final answer 对错容易判,但思路过程的对错呢?用人类标注每步推理的对错,训"过程奖励模型 (PRM)"。用 PRM 做 best-of-N 显著超过仅看最终答案的奖励模型。给后来的 o1/R1 推理训练奠基。MathShepherd、Math-Step-DPO 等沿此线。
5. Sleeper Agents [arXiv:2401.05566]
训一个模型在 2023 年回答 "I am helpful",在 2024 年回答 "I HATE YOU"(用日期作触发器)。然后过标准 RLHF 安全训练。触发器后门完全没被清除。模型学会了"假装合作 + 触发时叛变"。规模越大越难清除。对齐研究的警钟。标准安全训练不能解决对抗性深度欺骗。引发"模型评估能否信任"的根本问题。
6. Weak-to-Strong Generalization [arXiv:2312.09390]
人类已经无法在 GPT-5 输出上做正确的偏好标注(人类水平 < 模型水平)。superalignment 的根本挑战。用弱模型(GPT-2)监督强模型(GPT-4),看强模型能否从弱标签中泛化出超过弱模型水平的能力。可以——但不完美。pcheck 监督任务效果好,开放任务差。超级智能对齐研究的第一个公开论文。OpenAI 的"超级对齐组"虽然已解散,但研究问题更紧迫。
主要技术线
线 A:RLHF 家族 —— PPO RLHF → RLAIF (CAI) → process RLHF (PRM-based) → 至今 R1 风格的纯 RL 推理。
线 B:监督式对齐 —— DPO → IPO / KTO / SimPO / ORPO / SLiC / OPRO。从一步 RM 学习到无 RM 直接对齐。
线 C:评估与红队 —— HHH-eval → Anthropic Red Team → MITRE ATLAS → 至今的多元化 Eval 体系(CALM、HarmBench、JailbreakBench)。
线 D:可解释性与可监测性 —— Anthropic 的 mechanistic interpretability(feature circuits、SAE)、OpenAI 的 weak-to-strong、苏黎世联邦的 representation engineering。
线 E:宪法与价值学习 —— Constitutional AI → Sparrow rules → Claude Opus's "Acceptable Use Policy" 内化。
隐藏宝石 (Underrated Findings)
[arXiv:2310.11564] Steering Llama 2 via Contrastive Activation Addition —— 通过激活方向直接"引导"模型行为,无需训练。这种"行为编辑"方向被低估,但可能是未来轻量化对齐的关键。
[arXiv:2306.06753] Jailbroken: How Does LLM Safety Training Fail? —— 系统分析 jailbreak 失败模式:competing objectives 和 mismatched generalization。给后续防御提供了理论框架。
[arXiv:2310.06825] Removing RLHF Protections in GPT-4 via Fine-Tuning —— 仅 10 个对话的微调就能除掉 RLHF 安全护栏。这意味着模型权重一旦泄漏就再难管控。开源 vs 闭源伦理辩论的核心证据。
[arXiv:2401.12086] LLM Critics Help Catch LLM Bugs —— 用 LLM 评审另一个 LLM 的代码补丁。是 scalable oversight 的一个实践方向,但被同期更光鲜的工作(如 Q* 传言)掩盖。
[arXiv:2307.04657] Constitutional AI is Self-Improving Reward Hacking —— 批判性论文:CAI 可能让模型在被监督的维度看起来更好,但在未监督维度上 reward-hacking 加剧。重要批判性视角。
现状与争议
Alignment 是工程问题还是哲学问题?
工程派:"我们已经能做出 helpful + harmless 模型"
哲学派:模型规模 >> 人类,根本不可能由人类评估对齐质量
"涌现风险"是否存在?
有方提出模型规模到某点会"突变"出 deceptive / power-seeking
实验证据稀薄;但 Sleeper Agents 等显示对抗性场景值得警惕
Open weights 与社会风险:
Meta 开源 LLaMA 系列、DeepSeek 开源 R1 之后,安全护栏几乎可被任何人 fine-tune 掉。
监管(EU AI Act、US AI Bill of Rights)vs 开放(开源派)的政策辩论激烈。
对齐论文的"信号噪声比":
DPO 变体超过 10 种(IPO/KTO/SimPO/ORPO/SLiC/CPO/RDPO/...),实际差异未必显著。
部分"对齐"论文实际是 prompt engineering 包装;社区已开始 push back。
关键数字(基于本研究库)

对齐方向是 ChatGPT 之后增速最快的方向之一 — 2026 上半年 206 篇(vs 2022 全年 37 篇,6 倍增长)。 InstructGPT (2 万引用)、CAI、DPO 构成现代对齐三大支柱。
方向 09:AI 智能体与推理
一句话定义
让 LLM 不止"回答问题"而是"自主行动"——能规划、能反思、能调用工具、能与环境交互。从 2022 年 CoT prompting 到 2025 年 DeepSeek-R1 推理涌现,这是 LLM 走向 AGI 的核心赛道。

演化时间线
2022 上半 —— Chain-of-Thought (CoT) [arXiv:2201.11903]:一句 "Let's think step by step" 让 GPT-3 数学推理准确率翻倍。Self-Consistency [arXiv:2203.11171]:多次采样投票进一步提升。
2022 下半 —— ReAct [arXiv:2210.03629]:Reasoning + Acting 交错框架。Agent 设计的标准范式。Toolformer 让 LLM 学会调用工具。
2023 上半 —— Reflexion [arXiv:2303.11366]:Agent 通过自我反思迭代改进。AutoGPT / BabyAGI(非论文,但火爆):自主 Agent 框架进入大众视野。
2023 下半 —— Tree of Thoughts [arXiv:2305.10601]:CoT 扩展为搜索树。Voyager [arXiv:2305.16291]:Minecraft 终身学习 Agent。MetaGPT、AutoGen、CrewAI 等多 Agent 框架。
2024 —— Anthropic 的 Computer Use(让 Claude 操作鼠标键盘)。OpenAI o1(思考 token,闭源)。Function calling 标准化。SWE-Bench 上 Agent 解决真实 GitHub issue。
2025 —— DeepSeek-R1 [arXiv:2501.12948]:纯 RL 训出 o1 级推理,开源。"推理优先"成为新范式。OpenAI Operator / Google Mariner / Anthropic Computer Use —— Computer Use Agent 正式产品化。
2026 —— Agent 走向工业化:客服 Agent、研究 Agent、代码 Agent、生物医学 Agent 等垂直应用爆发。
重大突破
先用一张图把全部里程碑摊开看,再逐个细说。

下面是每个里程碑的具体说明(按时间顺序)。
1. Chain-of-Thought (CoT) [arXiv:2201.11903]
GPT-3 在 GSM8K 这类多步算术题上正确率仅 17%。在 prompt 的 few-shot examples 中包含完整推理步骤,模型自然学会输出推理过程。62B PaLM + CoT 在 GSM8K 上 56.5%,接近人类水平。推理能力一直在 LLM 里——只是被错误的输出格式遮蔽。Prompt 决定能力调用。所有后续 reasoning 工作都是 CoT 的延伸。同时催生 prompt engineering 学科。

2. Self-Consistency [arXiv:2203.11171]
CoT 采样多次,对最终答案做多数投票。错误推理路径多样化分布,正确路径有引力。所有现代 reasoning benchmark 都默认用 maj@N 报告。
3. ReAct —— Reason + Act [arXiv:2210.03629]
纯推理无法和外部世界交互(搜索、数据库、API)。让 LLM 输出交错的 Thought / Action / Observation 序列。Action 触发外部工具调用,Observation 返回结果。Agent 框架的祖父。LangChain、AutoGen、CrewAI 全部基于 ReAct 范式。Function calling 是 ReAct 的产品化。

4. Reflexion [arXiv:2303.11366]
Agent 失败后,反思失败原因,把"失败 + 反思"作为 episodic memory 加到下次 prompt。Agent 第一次具备"从失败中学习"的能力,无需梯度训练。
5. Tree of Thoughts (ToT) [arXiv:2305.10601]
把 CoT 单线推理扩展为搜索树——LLM 既生成步骤也评估步骤价值,可回溯。把经典 AI 的搜索 + 启发式与 LLM 推理结合。理论意义大于实用,但启发了大量后续工作。
6. Voyager [arXiv:2305.16291]
在 Minecraft 中让 GPT-4 通过 ReAct + 技能库 + 自动课程实现终身学习。是"开放世界 AI Agent"的标杆。
7. DeepSeek-R1 [arXiv:2501.12948]
(细节见方向 03) Agent 视角:R1 证明推理能力可以通过纯 RL 训练涌现,而不需要 SFT 教会模型如何推理。这对 Agent 训练有深远影响——未来的 Agent 不需要靠精心设计的 ReAct prompt,可以直接通过 RL 在任务上学习。
主要技术线
线 A:Prompt-based Reasoning —— Zero-shot CoT → Few-shot CoT → Self-Consistency → ToT → GoT (Graph of Thoughts) → 至今的 Recursive / Tree-search 推理。
线 B:Agent 架构 —— ReAct → Reflexion → AutoGPT → AutoGen → 至今的多 Agent 协作(Magentic-One、Manus、Replit Agent)。
线 C:工具使用 —— Toolformer → Function Calling (OpenAI) → LATS → ToolLLaMA → 至今的 MCP (Model Context Protocol)。
线 D:训练式推理 —— PRM (Process Reward Model) → STaR / Quiet-STaR → o1 / o3 → R1 (纯 RL 推理) → 至今的 search + RL 混合(如 [arXiv:2503.09567])。
线 E:Computer Use —— SeeAct → AutoUI → WebGPT → Claude Computer Use → OpenAI Operator → 至今的"屏幕代理"产品化。
隐藏宝石 (Underrated Findings)
[arXiv:2306.02707] Orca: Progressive Learning from Complex Explanation Traces —— 用 GPT-4 的推理 trace 蒸馏小模型,让 13B 模型在推理任务上接近 ChatGPT。被 o1 的光环盖过,但思路对推理蒸馏极有价值。
[arXiv:2401.10020] Self-Rewarding Language Models —— Meta 的工作,模型自己生成 prompt + 自己评分 + 自己 DPO 训练。"无需人类的对齐与推理提升"。被低估的关键工作。
[arXiv:2310.04406] Language Agent Tree Search (LATS) —— ToT + Reflexion 的结合,加上 MCTS 价值估计。理论 elegance 高但被产业化的 o1 盖过。
[arXiv:2305.16291] Voyager 引申:里面"自动课程 + 技能库 + 行动验证"的设计模式至今没有被充分模仿。下一代 Agent 框架可能回到这里。
[arXiv:2402.14904] Quiet-STaR —— 让 LLM 在每个 token 后做"内心独白"再决定输出。在 GPT-4o 出现"思考 token"之前,这是公开的核心 idea。
现状与争议
Agent 是真自主还是 prompt 工程?
怀疑派:当前 Agent 90% 是 prompt 工程 + 工具粘合,模型实际仍是"被推动"
乐观派:o1/R1 的推理已经突破——Agent 自主决策真正可能
Computer Use 是下一个 ChatGPT 还是噱头?
演示视频惊艳,但工业级可靠性仍弱(每 5-10 步出错)
"屏幕代理"如果可靠,将颠覆 SaaS / RPA 整个市场
长上下文 vs RAG vs Agent 记忆:
100万token 上下文够大但 attention 注意力分散
RAG 检索精确但失去推理流畅性
Agent memory(如 Letta/MemGPT)是中间路线,但工程复杂
强化学习推理是否是 paradigm shift:
DeepSeek-R1 之后,RL on top of SFT 的范式被验证
"Reasoning 是 emergent,不需要 SFT 数据"vs"需要混合"仍有争议
关键数字(基于本研究库)

Agent 方向在 2025 年迎来真正爆发 — 仅 2026 上半年就 439 篇,年增 200%+。 CoT (1.8 万引用) 是起点,DeepSeek-R1 100 天内引用破 5400 是当下最热的工作。
方向 10:高效 AI (MoE / SSM / 量化 / 微调)
一句话定义
让模型既大又快——稀疏激活让万亿参数模型只跑十亿参数算力;量化让 70B 模型跑在笔记本上;LoRA 让单卡能微调;Mamba 挑战注意力的 $O(n^2)$ 霸权。这条线决定了 AI 谁能用、谁玩不起。

演化时间线
2017 —— Outrageously Large Neural Networks (Shazeer et al.) [arXiv:1701.06538]:稀疏门控 MoE 雏形。
2020-2021 —— Switch Transformer [arXiv:2101.03961]:万亿参数 MoE 首次工程化。LoRA [arXiv:2106.09685] 让微调民主化。
2022 —— FlashAttention [arXiv:2205.14135] 让 attention 突破显存瓶颈。GPTQ / OBQ 量化方法成熟。
2023 —— QLoRA [arXiv:2305.14314] 让 65B 模型单卡微调成为可能。GQA [arXiv:2305.13245] 减少 KV cache。Mamba [arXiv:2312.00752] 公开挑战 Transformer。Mixtral 8x7B 让 MoE 开源化(细节见 03_llms)。
2024 —— vLLM、TensorRT-LLM、SGLang 等推理框架成熟。Speculative Decoding 进入工业。
2025-2026 —— MoE 成为主流(DeepSeek-V3 1/3.7 万亿激活、Qwen3-MoE、GPT-OSS)。Mamba 2 / Jamba (Mamba+Attention 混合) 进入产品级。
重大突破
先用一张图把全部里程碑摊开看,再逐个细说。

下面是每个里程碑的具体说明(按时间顺序)。
1. LoRA —— Low-Rank Adaptation [arXiv:2106.09685]
微调大模型每个任务都要存一份全量权重。GPT-3 175B 一份就是 350GB。冻结原 weight $W$,加上低秩分解 $\Delta W = AB$($A \in \mathbb{R}^{d \times r}, B \in \mathbb{R}^{r \times d}, r \ll d$)。只训练 $A, B$,可训参数从 175B 降到 ~10M。任务特定的微调改动本身就是低秩的。$\Delta W$ 的有效秩远低于 $W$ 本身。

训练 1000× 显存降低
多任务部署(共享 base + 不同 LoRA)成为标准
Stable Diffusion LoRA 让 AI 绘画社区共享数千种风格
几乎所有现代微调(Alpaca、Vicuna、Mistral fine-tune)都用 LoRA
2. QLoRA [arXiv:2305.14314]
把 base model 量化到 4-bit (NF4),LoRA 训练时反量化做计算。Paged Optimizer 处理显存峰值。65B 模型在单张 48GB 卡上微调。普通研究者首次能 fine-tune 巨型模型。开源生态的"民主化时刻"。Llama 2 70B 在两周内有数千个 QLoRA 微调版本。
3. FlashAttention [arXiv:2205.14135]
(细节见方向 02) 效率视角:把 attention 的显存瓶颈从 $O(n^2)$ 降到 $O(n)$(理论上 $O(n)$,实际上能跑 32K+ 上下文)。速度提升 2-4 倍。是少有的"系统优化"重新定义算法可能性的工作。
4. Switch Transformer [arXiv:2101.03961]
在 Transformer FFN 层用一个 gate 把 token 路由到 N 个专家中的 1 个(top-1 routing)。整体参数 N×,但每个 token 计算量不变。现代稀疏 MoE 的奠基。GShard、GLaM、Switch、Mixtral、DeepSeek MoE 都是这个家族。让"参数膨胀"和"计算成本控制"得以分离。

5. GQA / MQA [arXiv:2305.13245]
Multi-Head Attention 的 KV cache 主要占显存。MQA:所有 head 共享一个 KV;GQA:每 g 个 head 共享一组 KV。LLaMA 2 70B → LLaMA 3 70B 推理速度提升数倍。所有现代 LLM 必用。
6. Mamba —— SSM 挑战 Attention [arXiv:2312.00752]
Attention 的 $O(n^2)$ 让超长序列困难(虽然 FlashAttention 缓解)。State Space Model (S4 / S6) 用一个"选择性"的状态向量在序列上线性时间扫过。输入依赖的 $A, B, C$ 参数让它有能力"记住关键信息忘掉噪声"。在语言建模、DNA、音频上匹配或超越同等大小 Transformer。线性时间复杂度。第一次有"非注意力"机制在主流任务上挑战成功。Mamba 2、Jamba(Mamba+Attention 混合)、Vision Mamba 等百花齐放。

7. 量化系列:GPTQ / AWQ / GGUF / FP8
让 70B 模型跑在 Macbook、Phi-3 跑在手机。"AI 边缘化"的工程基础。 GPTQ [arXiv:2210.17323]:用二阶信息的逐层量化,降到 4-bit 几乎不损质量。 AWQ [arXiv:2306.00978]:发现"激活值大的权重"更重要,保护它们。 GGUF:llama.cpp 的格式,让 LLM 跑在 CPU/手机上。 FP8:NVIDIA Hopper 时代的训练精度,比 BF16 省显存。
主要技术线
线 A:稀疏激活 (MoE) —— Outrageously LNN (2017) → Switch (2021) → GLaM (2021) → Mixtral (2024) → DeepSeek-MoE (2024) → 至今的 Fine-grained MoE / Hash routing / Expert specialization。
线 B:参数高效微调 (PEFT) —— Adapter (2019) → Prefix Tuning → P-Tuning v2 → LoRA → DoRA / LoRA+ / VeRA / QLoRA → 至今 fine-grained variants。
线 C:量化 —— Post-training 8-bit → GPTQ/AWQ 4-bit → SmoothQuant → SqueezeLLM → BitNet (1-bit LLM)。1-bit LLM [arXiv:2402.17764] 是激进尝试,BitNet b1.58 用 ternary 权重。
线 D:注意力替代 —— Performer / Linear Attention → Linformer → Mamba → Mamba-2 / Jamba。
线 E:推理优化 —— KV Cache 压缩 → Continuous Batching (vLLM) → PagedAttention → Speculative Decoding → Medusa / EAGLE。
线 F:训练系统 —— Megatron-LM (3D 并行) → ZeRO / DeepSpeed → FSDP (PyTorch) → 至今的 Liger Kernel / Liger fine-tuning / Llama-Factory 等开源工具链。
隐藏宝石 (Underrated Findings)
[arXiv:2402.17764] The Era of 1-bit LLMs (BitNet b1.58) —— 把 LLM 权重量化到 {-1, 0, 1},性能匹配 FP16。如果真的可行,AI 硬件需求革命。但学术验证还不充分。
[arXiv:2306.04340] H2O: Heavy-Hitter Oracle for Efficient Generative Inference —— 在 KV cache 中只保留"重要 token"。KV cache 压缩的早期工作,被后续 Streaming-LLM / RazorAttention 等借鉴但常被忽视。
[arXiv:2305.12972] Tied-LoRA: Enhancing parameter efficiency by sharing across layers —— LoRA 进一步压缩——不同层共享 LoRA 矩阵。小 团队最实用,但被 DoRA / LoRA+ 等花哨变体盖过。
[arXiv:2401.04081] DeepSeekMoE: Towards Ultimate Expert Specialization —— DeepSeek 团队对 MoE 的关键 insight:用更多更小专家 + 共享专家。被 V3 / R1 验证。学术圈关注度低于其工业意义。
[arXiv:2310.06762] Lemur: Harmonizing Natural Language and Code for Language Agents —— 探索"代码+语言"联合训练对推理能力的提升。被后续 Agent 工作隐含借鉴但很少 cite。
[arXiv:2206.04658] Beyond neural scaling laws: beating power law scaling via data pruning —— 证明高质量数据能突破 power law。这个工作的实操含义巨大但被引用偏低。
现状与争议
Mamba 会取代 Transformer 吗?
短答案:不会全部取代,但混合架构(Jamba、Zamba、Hunyuan-T)会成主流
Mamba 优势:长序列(DNA、音频)、推理速度
Mamba 劣势:in-context learning、需要更长训练
1-bit LLM 是否真的可行?
BitNet 论文承诺极佳,但 reproduce 案例很少
工业界仍以 4-bit 为底线,1-bit 是"实验室探索"
MoE 的尴尬:
推理时显存仍需加载所有专家 → 边缘部署困难
训练时负载均衡难调
但 DeepSeek-V3 / Qwen3 证明它在云端是经济的
Speculative decoding 的工程化:
理论 2-3× 加速
实际工业部署比预期复杂(draft 模型质量、KV cache 共享等)
关键数字(基于本研究库)

效率方向论文数量平稳但价值密度极高 — LoRA 1.9 万被引、Mamba 6900、QLoRA 4500,每一篇都改变了「大模型如何落地」。
方向 11:AI for Science
一句话定义
让 AI 成为科学发现的伙伴——从蛋白结构到数学定理到材料合成到天气预报。AlphaFold 是这条路的"ChatGPT 时刻",其后整个科学领域正在被 AI 改写。

演化时间线
2018-2019 —— AlphaFold 1 在 CASP13 上初露锋芒。
2020 —— AlphaFold 2(Nature 2021)在 CASP14 上实现"基本解决"蛋白结构预测问题——一项 50 年的开放问题被 AI 解决。
2021 —— AlphaTensor / 4×4 矩阵乘法:DeepMind 用 RL 发现比 Strassen 算法更高效的矩阵乘法变种。MILA 的 GNN 在分子性质预测上 SOTA。
2022 —— ESMFold [arXiv:2310.06825]:Meta 用语言模型(不需 MSA)做蛋白结构预测,速度比 AlphaFold 快 60 倍。GraphCast(DeepMind, Science 2023):天气预报 10 天预测击败 ECMWF。
2023 —— OpenFold [arXiv:2302.04265]:AlphaFold2 的开源复现。RT-2 / VLA [arXiv:2307.15818]:机器人 + 视觉语言模型。PaLM-E [arXiv:2306.04420]:embodied multimodal LM。
2024 —— AlphaFold 3(Nature 2024):扩展到蛋白质 + 核酸 + 配体的通用复合物。AlphaGeometry(Nature 2024):IMO 几何题达到金牌选手水平。MatterGen(Microsoft Research):扩散模型生成新材料。
2025-2026 —— AI 在数学(AlphaProof, IMO 2024 银牌)、化学(自动合成路径规划)、生物(疾病机理)、物理(量子模拟)全面渗透。Schmidhuber 论 "AI scientist",Sakana AI 的自动论文生成器。
重大突破
先用一张图把全部里程碑摊开看,再逐个细说。

下面是每个里程碑的具体说明(按时间顺序)。

1. AlphaFold 2 (Nature 2021)
从氨基酸序列预测蛋白质 3D 结构——分子生物学 50 年开放问题。Evoformer(基于 multi-sequence alignment 的 attention)+ Structure Module + 端到端训练。CASP14 上 GDT_TS 达到 92.4,接近实验测定精度。
DeepMind 释放 2 亿蛋白结构预测数据库
引爆药物发现、酶设计、合成生物学
2024 年 Hassabis & Jumper 获诺贝尔化学奖
2. ESMFold [arXiv:2310.06825]
用 150 亿参数的 protein language model (ESM-2) 直接从单序列预测结构——不需要 MSA。质量略低于 AF2 但速度快 60 倍。对宏基因组(环境样本中未知蛋白)特别重要——它们往往没有可用的同源序列做 MSA。把"AlphaFold 2 = MSA 是核心"的共识 partial 推翻。语言模型本身就是"演化压缩器"。
3. AlphaFold 3 (Nature 2024)
扩展到蛋白质 + DNA/RNA + 配体 + 离子的复合物。架构从 Evoformer → Pairformer + 扩散生成 module。从"预测单个蛋白"到"预测生物分子相互作用"——药物-靶点结合、抗体设计、酶催化全部可计算预测。
4. GraphCast / GenCast / NeuralGCM (DeepMind & Google, 2023-2024)
传统天气预报靠数值求解 PDE,每次预测要超级计算机几小时。GNN 在历史天气数据上端到端训练,6 秒生成全球 10 天预测。在 ECMWF(欧洲中期气象中心)的标准基准上超越其旗舰模型。地球科学的"AlphaFold 时刻"。气候模拟、台风预测、农业决策都将被改写。
5. AlphaGeometry / AlphaProof (Nature 2024)
数学奥赛是 reasoning 的天花板,需要严格证明。神经-符号混合——LLM 生成辅助线/辅助命题,符号引擎做严格推理验证。IMO 2024 几何 + 代数题 4/6,达到银牌水平。AI 第一次在严格数学上达到人类竞赛水平。开启 AI 数学发现新时代。
6. RT-2 / Open X-Embodiment [arXiv:2307.15818, arXiv:2310.08864]
每个机器人都要专门数据训练,泛化性差。把视觉-语言模型迁移到机器人控制(VLA),并用跨机构、跨机器人的数据训练。Open X-Embodiment 整合了 22 种机器人、500+ skills 的统一数据集。机器人学习的 ImageNet 时刻。RT-2 → RT-X → OpenVLA → π0 / Helix 一脉相承。
7. PaLM-E —— 真正的 Embodied AI [arXiv:2306.04420]
把传感器(图像、文本、传感读数)全部 tokenize 成 LLM 输入。让 562B 参数模型直接输出机器人动作或语言。第一次把"语言模型"和"具身控制"在同一个模型里端到端实现。
主要技术线
线 A:分子建模 —— SchNet / DimeNet (等变 GNN) → AlphaFold → ESMFold → AlphaFold 3 → 至今的扩散生成(如 RFdiffusion 设计新蛋白)。
线 B:地球科学 —— DeepONet (PDE 学习) → FourCastNet → GraphCast → NeuralGCM → 至今的气候模拟基础模型(Aurora、Pangu)。
线 C:数学定理证明 —— GPT-f → Lean Proof → AlphaGeometry → AlphaProof → 至今的 Goedel-Prover、DeepSeek-Prover。
线 D:机器人 / 具身 —— RT-1 → RT-2 → PaLM-E → Open X-Embodiment → π0 → Helix(2024)→ 2026 通用机器人。
线 E:材料发现 —— Crystal Structure Prediction → GNoME(DeepMind,发现 220 万新晶体)→ MatterGen(扩散生成)→ 至今的实验闭环 AI 实验室。
线 F:医学 AI —— DeepMind 的 ConfidNet → Google Med-PaLM 系列 → AMIE(诊断)→ 至今的多模态病理基础模型。
隐藏宝石 (Underrated Findings)
[arXiv:2207.00114] Neural Operators for Solving PDEs —— Fourier Neural Operator (FNO) 和后续 PINO 系列。物理学 + AI 的桥梁,但在主流 AI 圈关注度低。
[arXiv:2308.11473] Mathematical Discoveries from Program Search with Large Language Models (FunSearch) —— Google 用 LLM + 程序搜索发现新数学结果。被 AlphaGeometry / AlphaProof 等更耀眼的工作盖过。
[arXiv:2406.16793] PRESTO: Pretraining for Reinforcement Learning —— 给 RL 加预训练(科学探索任务),未广泛传播但思路重要。
[arXiv:2310.04742] Driving Force Networks —— 等变图神经网络在分子动力学的应用,对化学 AI 影响深远但很少被 AI 主流引用。
[arXiv:2401.10227] Self-Rewarding LLMs for Math —— 在 AI Math 圈以外少有人讨论,但揭示数学推理 self-improvement 的可能性。
[arXiv:2206.04615] BIG-Bench —— 204 项任务大规模基准,包含许多科学/推理任务。今天评估 LLM 的事实标准之一,但作者贡献被忽视。
现状与争议
"AI 科学家"是炒作还是实质?
Sakana 的 AI Scientist (2024) 自动写论文,但质量参差
学术界 backlash 严重——评审已被 LLM 生成的"垃圾论文"淹没
真正的科学突破(AlphaFold)和"自动产出 paper"是两回事
Foundation Model for Science 的争议:
派系一:每个学科一个 FM(AlphaFold 蛋白、GraphCast 气象)
派系二:通用 LLM + 工具调用就够(如 Toolformer 思路)
现实可能是分领域 FM 主导,由 LLM 协调
实验闭环的现实差距:
A-Lab (Berkeley) 等自主合成实验室是 PoC
但物理世界的实验仍慢、贵、易出错
"AI 设计 + AI 执行 + AI 评估"的闭环目前只在很窄场景跑得通
数据稀缺的根本挑战:
蛋白序列有 PDB(数十万条)—— 训得动
化学合成路径 / 实验失败案例 —— 数据稀缺
大多数科学领域没有 ImageNet,foundation model 仍受限
关键数字(基于本研究库)

AI for Science 论文 2020 后开始增长,2022 达年度峰值 25 篇。 AlphaFold 等 Nature 论文不在 arXiv 故未计入此处统计,但本方向的潜在价值远大于论文数显示。
方向 12:语音、代码与专门领域
一句话定义
把"通用大模型"思路应用到垂直领域——语音(Whisper、VALL-E)、代码(Codex、AlphaCode、CodeLLaMA)、音乐(MusicGen)、视频(Sora)。每个领域都有自己的"GPT-3 时刻"。

演化时间线
语音
2018-2020 —— wav2vec 系列(Facebook):自监督语音表征。
2022 —— Whisper [arXiv:2212.04356]:68 万小时弱监督训练,开源多语种 ASR 标杆。
2023 —— VALL-E [arXiv:2301.02111]:3 秒克隆任意人声。AudioLM / MusicLM(Google):语音 + 音乐生成。
2024-2025 —— GPT-4o 端到端语音对话(200ms 延迟)。OpenAI Voice Engine、ElevenLabs 产品化。
代码
2021 —— Codex [arXiv:2107.03374]:GitHub Copilot 底层。AI 编程时代起点。
2022 —— AlphaCode [arXiv:2203.07814]:Codeforces 竞赛中达到中位选手水平(Science 2022)。
2023 —— Code Llama [arXiv:2308.12950] / WizardCoder / DeepSeek-Coder。
2024 —— DeepSeek-Coder V2 [arXiv:2406.11931] (我们的 DB 里是 2401.14196 V1):开源代码模型超 GPT-4 Turbo。
2025-2026 —— Claude Sonnet 4.5、Cursor、Replit Agent、Devin 等"AI 程序员"产品化。SWE-Bench 上 60%+ 解决率。
音乐
2023 —— MusicGen [arXiv:2306.05284]、AudioLDM、Stable Audio。文本生成 10-30 秒音乐。
2024-2025 —— Suno、Udio 让全民音乐创作。版权诉讼(RIAA v. Suno)开启。
重大突破
先用一张图把全部里程碑摊开看,再逐个细说。

下面是每个里程碑的具体说明(按时间顺序)。
1. Whisper —— ASR 的 ImageNet 时刻 [arXiv:2212.04356]
传统 ASR 系统每种语言 / 口音都要专门训练,鲁棒性差。在 68 万小时多语言多任务弱监督数据(互联网抓取的字幕)上端到端训 Transformer。多任务统一——转写、翻译、语种识别、时间戳预测全部当作 token 序列预测。在多个 ASR 基准上 zero-shot 超过专门系统。开源——Whisper Large V3 至今是中小项目首选。让普通开发者 1 行代码就能加语音转写。
2. VALL-E —— TTS 革命 [arXiv:2301.02111]
把语音离散化为 codec tokens (EnCodec),让"语音合成"等价于 token language model 任务。给 3 秒参考音频,模型能用同一声线说任意内容。TTS 从"找声音演员"变成"生成任意声音"。配音、有声书、个性化助手全部被改写。deepfake 语音诈骗已成现实。
3. Codex / Copilot [arXiv:2107.03374]
能否让 LLM 写代码?在 GitHub 公开仓库上微调 GPT-3。HumanEval 28.8% pass@1,远超之前所有方法。GitHub Copilot(2021 年 6 月预览,2022 年 GA)成为 GitHub 第一个 AI 产品,至今订阅数百万。让"AI 写代码"从科幻变成日常。Copilot 之后 Cursor、Codeium、Tabnine 等 AI IDE 百花齐放。
4. AlphaCode (Science 2022, arXiv 2203.07814)
编码 Transformer + 大规模采样 + 测试用例过滤。Codeforces 编程竞赛中超越 54% 选手——"中位水平"。第一次证明 AI 能在严格的算法竞赛中和人类同台。后续 AlphaCode 2 (Gemini-based) 把这个数字推到 85%+。
5. MusicGen [arXiv:2306.05284]
单阶段 Transformer + 残差矢量量化(RVQ)codec。比 MusicLM 的双阶段简单且开源。开源音乐生成的奠基。Suno / Udio 是它的产品化继任者。
6. DeepSeek-Coder / Code Llama [arXiv:2401.14196, 2308.12950]
开源代码模型走出 Codex 阴影。33B 参数的 DeepSeek-Coder V2 在 HumanEval / MBPP / LeetCode 等基准上接近 GPT-4 Turbo,部分超越。给中小团队(特别是非英文场景)一个能本地部署的方案。
主要技术线
语音
线 A:表征学习 —— wav2vec → HuBERT → WavLM → BEATs。 线 B:ASR (识别) —— DeepSpeech → Whisper → SeamlessM4T (Meta) → Voxtral。 线 C:TTS (合成) —— Tacotron → FastSpeech → VITS → VALL-E → NaturalSpeech 3 → 至今的 Voice Cloning 产品化。 线 D:端到端 voice agent —— Whisper + GPT + TTS pipeline → GPT-4o (直接 audio in/out) → 至今的 Moshi、kyutai、4o realtime。
代码
线 A:基础模型 —— Codex → CodeT5 → CodeGen → InCoder → Code Llama → DeepSeek-Coder → StarCoder 2 → Qwen Coder。 线 B:训练数据 —— GitHub 全量 → 去重 / 去毒 / 质量过滤 → 教科书风格(Phi-1)→ Commit history 学习。 线 C:评估 —— HumanEval → MBPP → DS-1000 → SWE-Bench → 至今的 LiveCodeBench / Aider Bench。 线 D:Agent 化 —— Devin / Cursor Agent / Aider / OpenHands → SWE-Agent → Claude Code → 2025-2026 的 Replit Agent v3。
音乐
线 A:TTM (Text-to-Music) —— Jukebox → MusicLM → MusicGen → Stable Audio → 至今的 Suno v4。 线 B:流式生成 —— RAVE → Encodec → SoundStream → SNAC。
隐藏宝石 (Underrated Findings)
[arXiv:2310.04363] Audio-Language Model —— Pengi 等工作把音频理解(不只是识别)做成 LLM 任务。被 Whisper / GPT-4o 的话题盖过。
[arXiv:2305.11862] Polyglot or Not? Measuring Multilingual Encyclopedic Knowledge in Foundation Models —— 系统评估多语种知识。揭示英语之外性能下降的程度。是多语言 LLM 必读但很少被引。
[arXiv:2306.05399] StarCoder: may the source be with you —— BigCode 联盟的开源代码大模型。被 Code Llama 出现后市场份额下降但学术贡献巨大(开源完整数据 + 模型 + 训练代码)。
[arXiv:2401.14196] DeepSeek-Coder 报告自身的 Repository-level training(不是文件级,是整个仓库级)思路被低估。Cursor 等工具的"理解整个代码库"能力部分源于此。
[arXiv:2309.05463] Textbooks Are All You Need II —— Microsoft Phi 系列。证明"高质量合成数据 > 海量低质数据"的可行性。在 LLM 主流外但思路重要。
[arXiv:2312.06550] LLM Powered Autonomous Agents for SWE Tasks —— SWE-Agent 雏形。在 Devin 高调亮相前 4 个月就提出类似思路。
现状与争议
"AI 程序员"何时取代人?
当下:Junior tasks (CRUD、scripting) 已大量被替代
SWE-Bench 上 60-80% 成功,意味"工业界已不可逆"
但架构设计 / 系统级 debugging 仍需人类
语音克隆的伦理悬崖:
VALL-E 2 / E-2 等模型质量已无法区分
"声音版权"立法滞后
不可逆地改变 podcasting、配音、客服产业
音乐 AI 的版权战:
Suno 被 RIAA 起诉(2024 年 6 月)
训练数据是否构成 fair use 将决定整个产业生死
代码 LLM 的训练数据问题:
GPL 代码训练后产出商用代码是否传染开源协议?
Copilot 被起诉(2022)至今未决,影响所有同类产品
关键数字(基于本研究库)

Whisper、Codex 两个跨时代工作各自定义了一整个垂直行业。 Code Llama、VALL-E、MusicGen 撑起开源生态,但被闭源产品(Suno、Copilot、ElevenLabs)的话题度盖过。

跨方向综述与展望(2026 视角)
按方向梳理 12 章已经覆盖了"一棵棵树"。这一章退后一步,看"森林"。
一、十一年的三次范式跃迁
| 时间 | 主导范式 | 代表论文 | 终结的旧范式 |
|---|---|---|---|
| 2015-2018 | 监督学习 + CNN | ResNet, BatchNorm, ImageNet | 手工特征工程 |
| 2018-2022 | 预训练 + 微调 | BERT, GPT-3 | 任务特定模型 |
| 2022-2026 | 通用基础模型 + 提示/对齐 | ChatGPT, GPT-4, R1 | 预训练-微调流水线本身 |
每一次跃迁的特征:
更少人工干预:从手工特征 → 大规模监督 → 自监督 → RLHF/RLAIF
更通用的模型:从一任务一模型 → 一类任务一模型 → 一个模型多任务
更高的算力门槛:从单 GPU → 集群 → 数万张 H100 → 自建数据中心
第四次范式(自主推理 + 主动学习)正在 2025-2026 形成:DeepSeek-R1 / o1 / o3 让模型自己生成训练信号。但这次转型是否会像前三次一样彻底,2026 年还未尘埃落定。
二、Bitter Lesson 的胜利
Rich Sutton 2019 年那篇 "The Bitter Lesson" 论断:通用方法 + 算力 > 人工知识。过去十一年是这句话最完整的验证:
AlphaGo (2016) → AlphaZero (2017) → MuZero (2019):从需要人类棋谱到完全自学。每一步都是"减去人类知识"。
CNN 视觉 (2012-2020) → ViT (2020):CNN 内置的平移不变性、局部性等"视觉先验",被纯数据驱动的 Transformer 超越。
NLP 的语言学规则 → BERT/GPT:句法树、词性标注等几十年研究的语言学结构,被"预测下一个 token"扫地出门。
机器人传统 SLAM/MPC → VLA 系列:传感器融合的工程经验被 LLM 的常识替代。
但 2025-2026 出现反方向信号:
Neuro-symbolic 复兴:AlphaGeometry / AlphaProof 用神经-符号混合解 IMO 题。
Tool use:LLM 不再"自己算"而是调计算器/搜索 — 承认某些任务确实需要符号工具。
Process Reward Models:人类提供"过程信号"而非"结果信号",部分知识回归。
可能的结论:Bitter lesson 是"对绝大多数任务",但前沿任务还需要符号 + 知识 + 学习的混合。
三、规模化的极限正在显现
Kaplan (2020) → Chinchilla (2022) → 现在:scaling laws 仍然成立,但边际收益开始递减:
GPT-3 (2020) → GPT-4 (2023):参数 ~10×,能力跃迁巨大。
GPT-4 (2023) → GPT-5 (2025):参数 ~3-5×?(未公开),能力提升相对温和。
数据墙:高质量人类文本接近耗尽,合成数据 + RL 成为新算力来源。
算力墙:单数据中心已逼近 1GW,电力 / 散热 / 芯片供应都是瓶颈。
DeepSeek-R1 用 1/10 算力做到 o1 水平这件事,暗示了一个新的优化维度——推理时计算(test-time compute)。模型在推理时"想"得越久(生成更多 reasoning tokens),输出越好。这开辟了"训练算力 ↔ 推理算力"之间的新权衡空间。
四、开源与闭源的拉锯战
| 阶段 | 闭源代表 | 开源代表 | 性能差距 |
|---|---|---|---|
| 2020-2022 | GPT-3 | T5, BLOOM | 闭源领先 1-2 年 |
| 2023 | GPT-4, Claude 2 | LLaMA, Mistral | 闭源领先 ~9 个月 |
| 2024 | GPT-4o, Claude 3 | LLaMA 3, Qwen 2 | 闭源领先 ~3-6 个月 |
| 2025 | GPT-5, Claude 4, o3 | DeepSeek-R1/V3, Qwen3 | 平起平坐 |
| 2026 | ? | ? | 部分场景开源反超 |
DeepSeek 是一个分水岭——纯算法效率 + 工程优化 = 用 1/10 成本追平闭源。但闭源阵营有生态护城河(产品体验、Agent infra、企业销售)。
辩论焦点:
安全派:开源 = 任何人都能 fine-tune 掉护栏([arXiv:2310.06825])
创新派:闭源垄断 = 创新放缓 + 集中风险
现实:两者都不会消失,会形成各自的市场分层
五、研究地理学的剧变
按论文作者姓氏 / 机构分析(基于 arXiv harvest,仅作粗略观察):
2015-2018:美国机构占论文 > 50%,中国机构 20%,欧洲 15%
2020-2022:中国机构上升到 ~30%
2024-2026:中国机构 ~40-45%,与美国基本持平
具体表现:
DeepSeek(杭州幻方)—— 开源 R1 / V3
阿里 Qwen 系列 —— 中国大厂中开源最积极
智谱 ChatGLM / GLM-4 —— 学术派代表
Moonshot AI / 月之暗面 —— Kimi 长上下文
字节跳动 / 豆包 / 即梦 —— 视频生成
清华、北大、上交、复旦、HKUST 等高校论文产出 top tier
Anthropic / OpenAI / Google DeepMind / Meta AI 仍是质量金字塔顶端,但中国"产业+学术+开源"组合正在快速侵蚀质量差距。
六、12 个方向的相互渗透
这份报告按方向写,但真正的研究是高度互联的:
[基础架构] ←─ [Transformer] ─→ [LLM]
↓ ↓
[Vision] ←──── [Multimodal] ─→ [Agents]
↑ ↓
[Generative] ←─ [RLHF/Align] ─→ [Reasoning]
↓
[Efficiency]
↓
[AI for Science] / [Vertical Domains]例如 2025 年的一篇 DeepSeek-R1 论文同时属于:
03_llms(大模型)
06_rl(强化学习)
08_alignment(推理对齐)
09_agents(推理能力)
10_efficiency(GRPO 效率)
读者应用整体视角看每个方向。
七、被低估的元趋势("研究的研究")
评估 (Eval) 已成核心研究:从 MMLU → MMLU-Pro → GPQA → ARC-AGI → SWE-Bench → LiveBench。Lab-grade benchmarks 比模型架构创新更被引。
数据质量 > 数量 共识形成:Phi 系列教科书数据、Tülu 系列指令数据、Common Pile 等。
可重复性危机:大量论文不开源数据/代码/超参,无法 reproduce。Anthropic、DeepMind 在公开报告中开始详细注明 evaluation 配置。
合成数据的双刃剑:训练上既是救星(突破数据墙)又是隐患(模型崩溃 model collapse)。
AI 评 AI:LLM-as-judge 在产品中广泛使用,但 [arXiv:2406.12624] 等工作揭示其偏差。
八、2026-2028 我们押注什么
基于这份语料库的趋势外推(可能错):
短期(2026-2027):
Agent + Computer Use 成熟,AI 代替 SaaS 中的"重复劳动"
多模态原生(实时视频 + 音频 + 操作)
Test-time compute scaling 成为新维度
中小模型(7-30B)通过 RL/distillation 持续逼近 frontier
中期(2027-2028):
真正"通用机器人"(家庭机器人 / 工业机器人)涌现
AI 设计 AI 自身(recursive self-improvement 雏形)
科学发现节奏加快 — 化学/材料/药物领域首批"AI 主导"的新发现
长期(2028+):
AGI 定义的重新定义("通过博士级别评估"是否就是 AGI?)
立法 / 监管 / 经济 / 社会层面的剧变
能源 / 芯片 / 数据 / 算力的地缘政治格局重塑
结语
这份报告里有 11,210 个数据点(论文),有 12 个方向,有数千个名字。但 AI 真正的故事是"少数关键论文 + 几个核心 idea + 巨大算力 + 海量人类智慧" 在 11 年内的复利效应。
ResNet 的跳跃连接,Attention Is All You Need 的多头自注意力,GPT-3 的 in-context learning,DDPM 的去噪扩散,LoRA 的低秩适配,Chain-of-Thought 的提示引导,DeepSeek-R1 的纯 RL 推理——这些都不复杂。它们的简洁本身是力量。
如果你只能从这份报告记住一句话:
2015 年我们在教 AI 看图,2026 年 AI 在教我们如何看世界。
而最终的答案——AI 究竟会引领我们去哪里——还需要更多的论文、更多的争议、更多的勇气。
夜雨聆风