规模定律与ChatGPT时刻:从GPT-3到全球AI浪潮
1750亿参数验证了"大力出奇迹",RLHF解决了对齐难题,对话界面降低了使用门槛——三者在2022年末的汇聚,引爆了全球AI浪潮
为什么是2022年?ChatGPT的爆红是偶然,还是技术积累的必然?
缩放定律:让"堆大"成为科学
2020年1月23日,OpenAI的研究员Jared Kaplan等人提交了一篇论文——《Scaling Laws for Neural Language Models》。这篇论文回答了一个看似简单但影响深远的问题:语言模型的性能,到底由什么决定?
答案是一个幂律关系。模型的交叉熵损失(loss)与三个因素——模型参数量(N)、数据集大小(D)、训练计算量(C)——之间存在可预测的幂律函数关系。这种关系跨越超过7个数量级依然成立。换句话说,你不需要猜测更大的模型会不会更好——你可以用一条公式预测它好多少。
更关键的发现是:架构细节(如网络宽度或深度)在很大范围内影响极小。这意味着"堆大"比"调架构"更重要。不需要精心调优超参数,只要持续扩大参数量、数据量和计算量,模型能力就会可预测地提升。更大的模型还表现出更高的样本效率——在相同数据量下,大模型学得更好。
两年后,DeepMind的Chinchilla论文(2022年3月)对这一定律做了重要修正:对于给定的计算预算,模型大小和数据量应该同步增长,最优比例约为每个参数20个tokens。这意味着当时的许多大模型——包括GPT-3——训练数据严重不足。但Kaplan等人的原始Scaling Laws仍然是这一思想的开山之作,它让整个行业从"试一试"转向"可预测地投资规模"。
GPT-3:1750亿参数的验证
2020年5月28日,OpenAI提交了GPT-3的论文——《Language Models are Few-Shot Learners》。31位作者,40页正文加32页附录,参数量1750亿——是GPT-2的约117倍,是此前任何非稀疏语言模型的10倍以上。
GPT-3的训练数据总计约570GB、4990亿tokens,由五个数据集混合而成:Common Crawl(过滤后4100亿tokens,权重60%)、WebText2(190亿tokens,22%)、Books1(120亿tokens,8%)、Books2(550亿tokens,8%)、Wikipedia(30亿tokens,3%)。Common Crawl用WebText2训练的质量分类器进行了过滤,并做了模糊去重。
少样本学习:不微调,只"举例"
GPT-3论文的核心创新不在于参数量本身,而在于验证了少样本学习(Few-Shot Learning)的可行性。论文测试了三种设置:
GPT-3在few-shot设置下不进行任何梯度更新或参数微调,任务和示例完全通过文本交互(prompt)输入模型。这颠覆了此前NLP研究的默认范式——为每个任务准备专门的数据集进行微调。GPT-3在翻译、问答、完形填空等任务上表现强劲,生成的新闻文章让人类评估者难以区分是否为人写。
但GPT-3也有明显的局限。它会生成看似合理但完全错误的回答——后来被称为"幻觉"(hallucination)。存在训练数据污染问题。更重要的是,GPT-3本质上是一个"文本续写器",它不理解人类意图,会生成有害、不真实、不遵循指令的内容。这个缺陷,要到两年后才被RLHF解决。
2020年6月11日,OpenAI发布GPT-3 API(邀请制),2021年11月正式公开。这是大模型作为商业产品通过API服务的开端,开创了"模型即服务"(MaaS)的商业模式。但对普通公众来说,GPT-3仍然是一个"开发者工具",而非"消费级产品"。真正的破圈,还需要两年。
RLHF:让模型"听懂人话"
2022年3月4日,OpenAI提交了InstructGPT的论文——《Training language models to follow instructions with human feedback》。论文开篇直言:让语言模型变大并不能使其更好地遵循用户意图。大模型会生成不真实、有毒或对用户无帮助的输出——模型与用户"未对齐"。
RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)就是解决这个"对齐问题"的方法。它分三步:
收集标注员编写的prompt和期望输出,用这些数据对GPT-3进行监督学习微调,让模型学会基本的指令遵循能力。
对同一个prompt,让SFT模型生成多个不同输出,标注员按质量排序。用排序数据训练一个奖励模型,学习预测人类偏好——给任意输出打分。
用奖励模型作为奖励信号,通过PPO算法优化SFT模型。加入KL散度约束防止模型偏离原始分布太远。迭代多轮。
结果令人震惊:13亿参数的InstructGPT输出优于1750亿参数的GPT-3——参数量少了一百多倍,输出质量反而更好。这说明对齐问题的解决比单纯堆参数更有效。RLHF让模型从"能生成文本"进化为"能理解并遵循人类意图",在真实性方面改善明显,毒性输出减少。
2022年11月30日:ChatGPT上线
2022年11月30日,OpenAI在官方博客发布了一篇简短的公告——《Introducing ChatGPT》。定位是"研究预览版"(research preview),免费开放使用。基础模型是GPT-3.5系列,训练方法与InstructGPT相同——都是RLHF,只是数据收集设置略有不同。
ChatGPT与GPT-3.5的区别在于:GPT-3.5是基础语言模型,擅长文本续写但不擅长对话;ChatGPT在GPT-3.5基础上经过RLHF微调,采用对话格式,能回答追问、承认错误、质疑错误前提、拒绝不当请求。用OpenAI自己的话说,ChatGPT是InstructGPT的"兄弟模型"。
5天突破100万用户,2个月突破1亿——ChatGPT成为史上增长最快的消费级应用。日峰值请求数达到数亿级别,服务器多次宕机。作为对比,Instagram达到1亿用户用了2.5年,TikTok用了9个月。
为什么是2022年:三重汇聚
ChatGPT的爆红不是一夜之间的突破,而是技术、产品、时机三者在2022年末的汇聚。
技术:RLHF成熟
2022年3月InstructGPT论文发表,RLHF技术成熟。它解决了大模型"能力强大但不可控"的核心问题,使消费级AI对话产品成为可能。没有这一步,GPT-3.5无法直接面向大众。
产品:对话界面
ChatGPT的聊天界面把AI的使用门槛降到了最低。用户不需要学习prompt engineering,不需要写代码调API,只需要像跟人聊天一样打字。这是技术到产品的关键一跃——同样的能力,包在API里只有开发者能用,包在对话框里所有人都能用。
时机:AIGC预热
2022年上半年,AI图像生成领域的突破为ChatGPT做了重要的公众心理铺垫。DALL-E 2(4月)、Midjourney(7月)、Stable Diffusion(8月)相继发布,让"AI能创造内容"的概念深入人心。公众对生成式AI的认知和期待,在ChatGPT发布前已被充分建立。
叠加后疫情时代数字化加速——远程办公培养了用户对AI辅助工具的需求,公众对在线工具的接受度空前提高。当ChatGPT出现时,用户已经准备好了。
确立"规模即一切"的技术路线,性能与规模呈幂律关系。
1750亿参数验证大规模模型能力,few-shot学习颠覆微调范式。
解决对齐问题,13亿参数模型超越1750亿GPT-3。让模型可控可用。
DALL-E 2、Midjourney、Stable Diffusion相继发布,公众被AIGC预热。
技术(RLHF)+产品(对话界面)+时机(AIGC预热)三重汇聚,5天破百万用户。
ChatGPT爆红后资本市场的标志性事件,OpenAI估值接近290亿美元,AI军备竞赛全面升级。
2023年1月,微软正式宣布对OpenAI的"多年期、数十亿美元"投资(广泛报道为100亿美元),使OpenAI估值接近290亿美元。这是ChatGPT爆红后资本市场的标志性事件,标志着AI军备竞赛全面升级。微软随后将GPT技术整合进Bing搜索引擎和Office办公套件,Google拉响"红色警报",Meta、亚马逊纷纷跟进——全球AI浪潮正式引爆。
核心判断:不是偶然,是必然
ChatGPT的爆红不是一次偶然的病毒传播,而是OpenAI数年技术积累在合适产品形态和时机下的集中爆发。从Scaling Laws(2020年1月)到GPT-3(2020年5月)到RLHF(2022年3月)到ChatGPT(2022年11月),这是一条清晰的因果链——每一步都建立在前一步的基础上。
对投资者而言,这条因果链揭示了一个重要规律:AI的突破不是"灵光一现",而是"可预测的积累"。Scaling Laws让规模投资有了科学依据,GPT-3验证了规模路线,RLHF解决了对齐问题,ChatGPT找到了产品形态。理解这条链条,有助于判断未来的AI突破会从哪里出现——不是来自意外,而是来自技术积累到达临界点后的自然释放。
但ChatGPT也留下了一个悬而未决的问题:规模扩展能走多远?当参数量从1750亿增长到万亿、十万亿,性能是否还会遵循同样的幂律?这个问题,要到推理模型的出现才有新的答案。
如果RLHF让13亿参数的模型超越1750亿参数的模型,那么"规模即一切"的叙事是否需要修正?规模和对齐,哪个更重要?
推理模型的觉醒——从o1到DeepSeek-R1
2024年9月,OpenAI发布o1模型,AI从"快速直觉"转向"慢速推理"。2025年1月,DeepSeek用极低成本开源R1,动摇了"算力即一切"的逻辑。推理模型不是更大的模型,而是会"思考"的模型——它如何改变AI的能力边界和竞争格局?
夜雨聆风