乐于分享
好东西不私藏

《AI大模型技术革命全景叙事》02:规模定律与ChatGPT时刻:从GPT-3到全球浪潮

《AI大模型技术革命全景叙事》02:规模定律与ChatGPT时刻:从GPT-3到全球浪潮
渔者投研 · AI大模型技术革命全景叙事
第 02 篇 / 共 11 篇

规模定律与ChatGPT时刻:从GPT-3到全球AI浪潮

1750亿参数验证了"大力出奇迹",RLHF解决了对齐难题,对话界面降低了使用门槛——三者在2022年末的汇聚,引爆了全球AI浪潮

约 3500 字  ·  阅读约 10 分钟  ·  模块一:技术演进史
核心问题

为什么是2022年?ChatGPT的爆红是偶然,还是技术积累的必然?

缩放定律:让"堆大"成为科学

2020年1月23日,OpenAI的研究员Jared Kaplan等人提交了一篇论文——《Scaling Laws for Neural Language Models》。这篇论文回答了一个看似简单但影响深远的问题:语言模型的性能,到底由什么决定?

答案是一个幂律关系。模型的交叉熵损失(loss)与三个因素——模型参数量(N)、数据集大小(D)、训练计算量(C)——之间存在可预测的幂律函数关系。这种关系跨越超过7个数量级依然成立。换句话说,你不需要猜测更大的模型会不会更好——你可以用一条公式预测它好多少。

更关键的发现是:架构细节(如网络宽度或深度)在很大范围内影响极小。这意味着"堆大"比"调架构"更重要。不需要精心调优超参数,只要持续扩大参数量、数据量和计算量,模型能力就会可预测地提升。更大的模型还表现出更高的样本效率——在相同数据量下,大模型学得更好。

Scaling Laws把"规模即性能"从一个经验直觉变成了可定量预测的科学。这直接指导了OpenAI的战略方向:从GPT-2的15亿参数到GPT-3的1750亿参数,不是盲目堆砌,而是基于公式的理性投资。

两年后,DeepMind的Chinchilla论文(2022年3月)对这一定律做了重要修正:对于给定的计算预算,模型大小和数据量应该同步增长,最优比例约为每个参数20个tokens。这意味着当时的许多大模型——包括GPT-3——训练数据严重不足。但Kaplan等人的原始Scaling Laws仍然是这一思想的开山之作,它让整个行业从"试一试"转向"可预测地投资规模"。

GPT-3:1750亿参数的验证

2020年5月28日,OpenAI提交了GPT-3的论文——《Language Models are Few-Shot Learners》。31位作者,40页正文加32页附录,参数量1750亿——是GPT-2的约117倍,是此前任何非稀疏语言模型的10倍以上。

GPT-3的训练数据总计约570GB、4990亿tokens,由五个数据集混合而成:Common Crawl(过滤后4100亿tokens,权重60%)、WebText2(190亿tokens,22%)、Books1(120亿tokens,8%)、Books2(550亿tokens,8%)、Wikipedia(30亿tokens,3%)。Common Crawl用WebText2训练的质量分类器进行了过滤,并做了模糊去重。

少样本学习:不微调,只"举例"

GPT-3论文的核心创新不在于参数量本身,而在于验证了少样本学习(Few-Shot Learning)的可行性。论文测试了三种设置:

设置
输入
是否更新参数
Zero-shot
仅任务描述:"将以下英文翻译为法文:"
One-shot
任务描述 + 1个示例
Few-shot
任务描述 + 少量示例(通常几十个)
传统微调
数千至数万个标注样本
是(梯度更新)

GPT-3在few-shot设置下不进行任何梯度更新或参数微调,任务和示例完全通过文本交互(prompt)输入模型。这颠覆了此前NLP研究的默认范式——为每个任务准备专门的数据集进行微调。GPT-3在翻译、问答、完形填空等任务上表现强劲,生成的新闻文章让人类评估者难以区分是否为人写。

但GPT-3也有明显的局限。它会生成看似合理但完全错误的回答——后来被称为"幻觉"(hallucination)。存在训练数据污染问题。更重要的是,GPT-3本质上是一个"文本续写器",它不理解人类意图,会生成有害、不真实、不遵循指令的内容。这个缺陷,要到两年后才被RLHF解决。

2020年6月11日,OpenAI发布GPT-3 API(邀请制),2021年11月正式公开。这是大模型作为商业产品通过API服务的开端,开创了"模型即服务"(MaaS)的商业模式。但对普通公众来说,GPT-3仍然是一个"开发者工具",而非"消费级产品"。真正的破圈,还需要两年。

RLHF:让模型"听懂人话"

2022年3月4日,OpenAI提交了InstructGPT的论文——《Training language models to follow instructions with human feedback》。论文开篇直言:让语言模型变大并不能使其更好地遵循用户意图。大模型会生成不真实、有毒或对用户无帮助的输出——模型与用户"未对齐"。

RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)就是解决这个"对齐问题"的方法。它分三步:

时间线
第一步:SFT
监督微调——教模型"照着做"

收集标注员编写的prompt和期望输出,用这些数据对GPT-3进行监督学习微调,让模型学会基本的指令遵循能力。

第二步:RM
奖励模型——教模型"分好坏"

对同一个prompt,让SFT模型生成多个不同输出,标注员按质量排序。用排序数据训练一个奖励模型,学习预测人类偏好——给任意输出打分。

第三步:PPO
强化学习——让模型"越做越好"

用奖励模型作为奖励信号,通过PPO算法优化SFT模型。加入KL散度约束防止模型偏离原始分布太远。迭代多轮。

结果令人震惊:13亿参数的InstructGPT输出优于1750亿参数的GPT-3——参数量少了一百多倍,输出质量反而更好。这说明对齐问题的解决比单纯堆参数更有效。RLHF让模型从"能生成文本"进化为"能理解并遵循人类意图",在真实性方面改善明显,毒性输出减少。

RLHF是ChatGPT能够作为消费级产品成功的核心技术前提。没有RLHF,GPT-3.5只是一个强大的但不可控的文本生成器,无法直接面向大众。RLHF把一个"会续写文本的机器"变成了一个"能对话的助手"。

2022年11月30日:ChatGPT上线

2022年11月30日,OpenAI在官方博客发布了一篇简短的公告——《Introducing ChatGPT》。定位是"研究预览版"(research preview),免费开放使用。基础模型是GPT-3.5系列,训练方法与InstructGPT相同——都是RLHF,只是数据收集设置略有不同。

ChatGPT与GPT-3.5的区别在于:GPT-3.5是基础语言模型,擅长文本续写但不擅长对话;ChatGPT在GPT-3.5基础上经过RLHF微调,采用对话格式,能回答追问、承认错误、质疑错误前提、拒绝不当请求。用OpenAI自己的话说,ChatGPT是InstructGPT的"兄弟模型"。

统计卡片
5天
突破100万用户
2个月
突破1亿用户
史上最快
消费级应用增长纪录

5天突破100万用户,2个月突破1亿——ChatGPT成为史上增长最快的消费级应用。日峰值请求数达到数亿级别,服务器多次宕机。作为对比,Instagram达到1亿用户用了2.5年,TikTok用了9个月。

为什么是2022年:三重汇聚

ChatGPT的爆红不是一夜之间的突破,而是技术、产品、时机三者在2022年末的汇聚。

技术:RLHF成熟

2022年3月InstructGPT论文发表,RLHF技术成熟。它解决了大模型"能力强大但不可控"的核心问题,使消费级AI对话产品成为可能。没有这一步,GPT-3.5无法直接面向大众。

产品:对话界面

ChatGPT的聊天界面把AI的使用门槛降到了最低。用户不需要学习prompt engineering,不需要写代码调API,只需要像跟人聊天一样打字。这是技术到产品的关键一跃——同样的能力,包在API里只有开发者能用,包在对话框里所有人都能用。

时机:AIGC预热

2022年上半年,AI图像生成领域的突破为ChatGPT做了重要的公众心理铺垫。DALL-E 2(4月)、Midjourney(7月)、Stable Diffusion(8月)相继发布,让"AI能创造内容"的概念深入人心。公众对生成式AI的认知和期待,在ChatGPT发布前已被充分建立。

叠加后疫情时代数字化加速——远程办公培养了用户对AI辅助工具的需求,公众对在线工具的接受度空前提高。当ChatGPT出现时,用户已经准备好了。

时间线
2020年1月 · Scaling Laws发表

确立"规模即一切"的技术路线,性能与规模呈幂律关系。

2020年5月 · GPT-3发布

1750亿参数验证大规模模型能力,few-shot学习颠覆微调范式。

2022年3月 · InstructGPT/RLHF发表

解决对齐问题,13亿参数模型超越1750亿GPT-3。让模型可控可用。

2022年4-8月 · AIGC图像生成爆发

DALL-E 2、Midjourney、Stable Diffusion相继发布,公众被AIGC预热。

2022年11月30日 · ChatGPT发布

技术(RLHF)+产品(对话界面)+时机(AIGC预热)三重汇聚,5天破百万用户。

2023年1月 · 微软100亿美元投资

ChatGPT爆红后资本市场的标志性事件,OpenAI估值接近290亿美元,AI军备竞赛全面升级。

2023年1月,微软正式宣布对OpenAI的"多年期、数十亿美元"投资(广泛报道为100亿美元),使OpenAI估值接近290亿美元。这是ChatGPT爆红后资本市场的标志性事件,标志着AI军备竞赛全面升级。微软随后将GPT技术整合进Bing搜索引擎和Office办公套件,Google拉响"红色警报",Meta、亚马逊纷纷跟进——全球AI浪潮正式引爆。

核心判断:不是偶然,是必然

认知增量

ChatGPT的爆红不是一次偶然的病毒传播,而是OpenAI数年技术积累在合适产品形态和时机下的集中爆发。从Scaling Laws(2020年1月)到GPT-3(2020年5月)到RLHF(2022年3月)到ChatGPT(2022年11月),这是一条清晰的因果链——每一步都建立在前一步的基础上。

对投资者而言,这条因果链揭示了一个重要规律:AI的突破不是"灵光一现",而是"可预测的积累"。Scaling Laws让规模投资有了科学依据,GPT-3验证了规模路线,RLHF解决了对齐问题,ChatGPT找到了产品形态。理解这条链条,有助于判断未来的AI突破会从哪里出现——不是来自意外,而是来自技术积累到达临界点后的自然释放。

但ChatGPT也留下了一个悬而未决的问题:规模扩展能走多远?当参数量从1750亿增长到万亿、十万亿,性能是否还会遵循同样的幂律?这个问题,要到推理模型的出现才有新的答案。

思考题

如果RLHF让13亿参数的模型超越1750亿参数的模型,那么"规模即一切"的叙事是否需要修正?规模和对齐,哪个更重要?

下篇预告 · 第 03 篇

推理模型的觉醒——从o1到DeepSeek-R1

2024年9月,OpenAI发布o1模型,AI从"快速直觉"转向"慢速推理"。2025年1月,DeepSeek用极低成本开源R1,动摇了"算力即一切"的逻辑。推理模型不是更大的模型,而是会"思考"的模型——它如何改变AI的能力边界和竞争格局?