ARTICLE · 1109314
Nick See AI|31 一篇论文改变了AI世界
看见,不只是看见。

2017年6月,一篇只有十几页的论文被提交到arXiv。
八位作者。
大多来自Google Brain和Google Research。
论文的标题甚至不像一篇准备改变人工智能技术路线的严肃论文:
Attention Is All You Need。
注意力,就是你所需要的一切。
它讨论的也不是什么“通用人工智能”。
没有ChatGPT。
没有Agent。
没有今天人们熟悉的大模型叙事。
作者试图解决的是一个当时已经研究了很多年的问题:
机器翻译。
怎样让机器更好地把一种语言翻译成另一种语言?
如果故事停在这里,它本来很可能只是自然语言处理历史上的一次重要架构创新。
可后来发生的事情,使这篇论文拥有了完全不同的历史位置。
GPT建立在Transformer之上。
BERT建立在Transformer之上。
此后的大语言模型浪潮,也大规模沿着这条架构路线向前推进。
几年以后,当ChatGPT、Claude、Gemini进入数亿人的工作和生活,人们回头看才发现:
今天AI产业最重要的一部分技术基础,最初并不是为聊天机器人设计的。
更不是为了Agent设计的。
它最初解决的,只是一个远小得多的问题。
这也是技术史里最容易被忽略的一件事:
一种技术第一次出现时解决的问题,和它最终能够承载的问题,可能根本不是同一个问题。
2017年,没有人能够仅凭这篇论文确定后来会发生什么。
但一扇门,确实已经被推开了。
01 机器读一句话,为什么曾经那么麻烦?
先回到Transformer出现之前。
语言有一个非常麻烦的特点:
它有顺序。
“我没有说他偷了钱。”
和:
“我说他没有偷钱。”
使用的词非常接近,意思却完全不同。
所以早期处理语言序列时,一个非常自然的思路是:
按顺序处理。
一个词。
接着一个词。
再接着下一个词。
循环神经网络,也就是RNN,以及后来非常重要的LSTM、GRU等架构,长期都是序列建模的主流方法。
它们并不是“错误路线”。
恰恰相反,它们解决了很多真实问题。
但这种方式天然带来一个麻烦。
假设你要处理一句很长的话。
机器读取后面的内容时,需要不断把前面的信息沿着序列向后传递。
这不仅让长距离关系更难学习,也限制了训练时可以进行多大程度的并行计算。
你可以把它粗略理解成:
有些工作必须排队完成。
前面的计算没有完成,后面的部分就很难完全同时推进。
而神经网络的发展,偏偏越来越依赖另一件事情:
计算规模。
GPU最擅长的并不是耐心地一个接一个做任务。
它更大的价值,在于同时进行大量矩阵运算。
于是一个技术矛盾出现了:
一边是语言天然具有顺序;
另一边,是现代计算基础设施越来越擅长并行。
如果处理语言的方法始终高度依赖逐步递归,那么你拥有越来越强大的计算设备,也未必能够把它们的能力充分释放出来。
这就是2017年那篇论文所处的技术背景之一。
Google团队没有问:
怎样把原来的循环网络再改好一点?
他们做了一件更激进的事情:
能不能把循环本身拿掉?
论文给出的答案是:
可以。
02 Attention早就存在,Transformer做的是另一件事
这里有一个很容易被今天的叙事简化掉的事实。
Attention并不是2017年突然被发明出来的。
在Transformer出现以前,注意力机制已经被应用于神经机器翻译等任务。
它解决的核心问题之一是:
当模型处理当前位置时,应该重点参考输入中的哪些部分?
比如翻译一句话。
生成当前这个词时,输入句子里的不同词显然不应该拥有完全相同的重要性。
Attention允许模型根据当前任务,对不同位置分配不同权重。
这个思想已经存在。
《Attention Is All You Need》更激进的地方在于:
如果Attention不再只是原有网络旁边的辅助机制,而成为整个架构的核心,会怎样?
于是Transformer出现了。
论文明确提出:
不再依赖循环,也不再依赖卷积来完成序列转换,而主要依靠Attention机制构建整个模型。
这里最重要的一个机制叫:
Self-Attention。
自注意力。
不要把它理解成机器突然获得了某种类似人类的“注意力”。
这是一个功能性比喻。
它做的事情更接近:
处理一个词时,让模型计算这个词与序列中其他位置之间的关系。
比如:
“The animal didn’t cross the street because it was too tired.”
这里的“it”到底更可能指什么?
模型需要建立不同位置之间的关系。
Self-Attention提供了一种直接计算这些关系的方法。
而且Transformer还使用Multi-Head Attention,让模型能够在多个表示子空间中同时捕捉不同关系。
技术细节当然比这复杂得多。
但如果站在后来AI产业发展的角度,只抓住一个变化就够了:
不同位置之间的关系,不再必须主要沿着一条漫长的循环链条逐步传递。
论文比较了不同架构连接远距离位置所需要的路径长度。在Self-Attention层中,任意位置之间可以通过更短的计算路径建立联系;同时,Transformer的设计显著提高了训练的并行化程度。
这两个变化放在一起,后来产生了巨大的意义。
因为AI研究很快会进入一个越来越依赖规模的时代。
而规模最怕什么?
不是只有算法不够聪明。
还怕:
算法本身很难把越来越庞大的计算资源有效吃进去。
03 那篇论文当时证明的,其实没有今天这么多
今天回看Transformer,非常容易犯一个错误:
把后来十年发生的一切,重新塞回2017年。
仿佛Vaswani等人发表论文的时候,就已经站在Google办公室里看见了GPT、ChatGPT、Claude、Gemini,以及今天的大模型产业。
事实远没有这么戏剧化。
论文验证的核心任务主要是机器翻译。
在WMT 2014英德翻译任务上,Transformer取得28.4 BLEU;在英法翻译任务上取得41.0 BLEU。论文还报告,后一个模型使用8块GPU训练约3.5天。
这是很强的结果。
Google在2017年介绍这项工作时,强调的同样是Transformer在语言理解、机器翻译上的性能与并行训练优势。
注意:
当时被证明的是——
一种新的架构,在这些任务上表现很好,而且更适合并行训练。
没有证明:
只要不断增加Transformer参数,就一定会产生今天的大语言模型能力。
没有证明:
Scaling最终一定能够走到AGI。
更没有证明:
几年以后数亿普通人会每天和基于这类架构发展的模型聊天。
那些答案,当时都不存在。
这恰恰使这个故事更有意思。
因为很多改变产业的基础技术,刚出现的时候,并不会在脑门上写着:
“下一代基础设施。”
它往往只是比上一种方法:
快一点。
准一点。
便宜一点。
更容易扩展一点。
甚至只在一个很具体的场景里效果特别好。
真正困难的是判断:
这个局部优势,究竟只是局部优势,还是一个更大系统即将建立的起点?
这件事不仅发生在AI。
互联网最初并不是为了今天的移动商业世界设计的。
GPS最初也不是为了外卖、网约车和共享出行设计的。
很多企业面对新技术时,最容易问的是:
它现在能替我节约多少成本?
可有些技术真正危险的地方,并不在于今天提高了10%还是20%的效率。
而在于:
它改变了未来能够建立什么。
Transformer就属于后一种技术。
04 一篇机器翻译论文,为什么后来能够承载大模型?
这里才出现这篇论文更值得商业管理者理解的地方。
技术突破通常有两种价值。
一种叫:
问题价值。
它把眼前这个问题解决得更好。
另一种叫:
架构价值。
它提供了一种可以被迁移、组合、扩大,最终承载远超原问题的新结构。
Transformer最初首先展示的是前一种价值。
后来越来越重要的,是第二种。
原因之一就在于它和计算规模之间形成了非常关键的适配。
上一章我们已经看到:
OpenAI从Dota等实验里越来越清楚地意识到,计算资源不只是研究工作的后台成本,它可能直接参与能力增长。
问题随之而来:
有更多计算,并不意味着一定能有效使用更多计算。
你还需要一种能够把这些资源转化成模型能力的架构。
Transformer提高并行训练效率这一点,因此拥有了超出机器翻译本身的长期价值。
更重要的是,它不是一个只能处理某个固定语言任务的狭窄结构。
它提供了一套处理序列、建立上下文关系的通用机制。
这意味着另一种可能性开始出现:
既然它可以处理翻译中的语言关系,
为什么一定只让它学翻译?
如果给它更大量的文字呢?
如果不首先告诉它:
“你的任务是英译德。”
而是让它通过大量文本学习语言本身的统计结构呢?
这一步一旦发生,问题就从:
怎样把一句英文翻译成德文?
慢慢变成:
能不能先让一个模型从大量文本里学到某种可以迁移的通用表示,再拿去完成许多不同任务?
这并不是Transformer论文单独给出的答案。
但Transformer提供了一块极其重要的基础。
真正把技术变成产业的过程,往往就是这样发生的:
发明者解决第一个问题。
后来者重新定义这个技术究竟属于哪个问题。
技术突破决定一扇门能不能打开,战略判断决定打开以后往哪里走。
05 Google发明了Transformer,然后呢?
这也是这个故事最容易被写成“Google错失AI”的地方。
这种写法很诱人。
也过于简单。
Google并不是发明Transformer以后把它扔进了抽屉。
Transformer来自Google研究团队,Google随后也持续沿着Transformer推进自然语言研究与产品应用。
后来影响巨大的BERT,同样来自Google。
所以如果简单写成:
Google发明Transformer,却完全没有看见它的价值;
并不符合事实。
真正值得研究的问题其实困难得多:
为什么一家公司能够创造一项重要基础技术,却不一定由它率先定义这项技术最终面向普通用户的产品形态?
“发明技术”与“获得技术创造的全部战略价值”,从来不是同一件事。
中间至少还隔着:
技术路线选择。
资源投入。
产品化。
组织激励。
商业模式。
用户入口。
风险承受能力。
以及一个尤其重要的能力:
把原来解决A问题的技术,重新放进B问题里。
这对今天的企业尤其重要。
AI正在进入几乎所有行业。
大多数公司都会观察:
同行正在怎么用AI?
客服能不能提效?
报告能不能自动写?
代码能不能生成?
流程能不能自动化?
这些当然都值得做。
但如果只停在这里,就很容易犯2017年看Transformer时最容易犯的错误:
只按照它今天正在解决的问题,判断它未来的价值。
一个更困难的问题是:
你所在行业今天有没有某项看起来只是提高局部效率的技术,实际上正在改变整个行业未来的基础架构?
如果有,管理者真正需要决定的,就不只是“要不要采购”。
而是:
如果它继续成熟,价值链里的哪个位置会发生变化?
谁会因此拥有新的入口?
什么能力会从稀缺变成标准配置?
自己今天最值钱的资产,到那个时候还值钱吗?
技术研究与战略研究,从这里开始分开。
前者问:
它现在能做到什么?
后者还必须再问一句:
如果它继续成立,接下来什么会变得可能?
06 OpenAI没有发明这张地图,却开始沿着它往前走
现在,把时间重新拨回2018年。
OpenAI正在经历上一章讲过的那场资源危机。
它越来越相信,计算规模可能比创立时预想的重要得多。
与此同时,一种更适合大规模并行训练的语言架构已经出现。
两条原本不同的线开始接近。
一条来自OpenAI自己的实验:
Scale可能带来新的能力。
另一条来自Google研究团队:
Transformer提供了一种非常适合大规模训练序列数据的架构。
接下来发生的事情非常关键。
2018年,Alec Radford、Karthik Narasimhan、Tim Salimans和Ilya Sutskever发表了OpenAI的生成式预训练研究。
他们使用Transformer,把“生成式预训练”和后续针对具体任务的微调结合起来:
先利用大量未标注文本进行语言模型预训练,再把获得的能力迁移到问答、文本蕴含、语义相似度、分类等不同自然语言理解任务。
后来,人们把这个模型称为:
GPT。
Generative Pre-trained Transformer。
最后那个T非常重要。
Transformer。
OpenAI没有发明它。
这件事反而让接下来发生的一切更值得研究。
因为科技竞争从来不只是比:
谁第一个发明。
还要比:
谁能够识别一项技术真正可以迁移到哪里;
谁愿意在别人还把它当成一个局部解决方案的时候,把它放进一个更大的问题;
以及谁最终有能力把这个判断不断扩大。
这也是为什么2017年的《Attention Is All You Need》,放在OpenAI的故事里如此重要。
它不是OpenAI的成果。
却成为OpenAI下一阶段技术路线的重要基础之一。
而这里还剩下一个问题没有回答。
Transformer让训练变得更适合并行,让不同位置之间建立关系变得更加直接。
这些仍然只是架构层面的优势。
它究竟打开了什么?
为什么这种架构后来可以从机器翻译走向语言模型?
为什么“预测下一个词”这样一个看起来甚至有些简单的训练目标,最后会表现出远远超过文本补全的能力?
以及最重要的:
如果一种架构能够不断吸收更多数据和计算,它的能力边界究竟在哪里?
Google画出了这张地图最重要的一部分。
接下来,有人准备沿着它继续往前走。
⸻
下一期:第032章|Transformer到底打开了什么
⸻
关注 Nick See|系统思维
与Nick See 一起,
看见现象,看懂结构,看透本质,看远未来。
不追逐更多答案,只追问真正重要的问题。
Nick See看见,不只是看见。