夜雨聆风学习资料网

ARTICLE · 1109314

Nick See AI|31 一篇论文改变了AI世界

Nick See AI|31 一篇论文改变了AI世界

看见,不只是看见。

2017年6月,一篇只有十几页的论文被提交到arXiv。

八位作者。

大多来自Google Brain和Google Research。

论文的标题甚至不像一篇准备改变人工智能技术路线的严肃论文:

Attention Is All You Need。

注意力,就是你所需要的一切。

它讨论的也不是什么“通用人工智能”。

没有ChatGPT。

没有Agent。

没有今天人们熟悉的大模型叙事。

作者试图解决的是一个当时已经研究了很多年的问题:

机器翻译。

怎样让机器更好地把一种语言翻译成另一种语言?

如果故事停在这里,它本来很可能只是自然语言处理历史上的一次重要架构创新。

可后来发生的事情,使这篇论文拥有了完全不同的历史位置。

GPT建立在Transformer之上。

BERT建立在Transformer之上。

此后的大语言模型浪潮,也大规模沿着这条架构路线向前推进。

几年以后,当ChatGPT、Claude、Gemini进入数亿人的工作和生活,人们回头看才发现:

今天AI产业最重要的一部分技术基础,最初并不是为聊天机器人设计的。

更不是为了Agent设计的。

它最初解决的,只是一个远小得多的问题。

这也是技术史里最容易被忽略的一件事:

一种技术第一次出现时解决的问题,和它最终能够承载的问题,可能根本不是同一个问题。

2017年,没有人能够仅凭这篇论文确定后来会发生什么。

但一扇门,确实已经被推开了。


01 机器读一句话,为什么曾经那么麻烦?

先回到Transformer出现之前。

语言有一个非常麻烦的特点:

它有顺序。

“我没有说他偷了钱。”

和:

“我说他没有偷钱。”

使用的词非常接近,意思却完全不同。

所以早期处理语言序列时,一个非常自然的思路是:

按顺序处理。

一个词。

接着一个词。

再接着下一个词。

循环神经网络,也就是RNN,以及后来非常重要的LSTM、GRU等架构,长期都是序列建模的主流方法。

它们并不是“错误路线”。

恰恰相反,它们解决了很多真实问题。

但这种方式天然带来一个麻烦。

假设你要处理一句很长的话。

机器读取后面的内容时,需要不断把前面的信息沿着序列向后传递。

这不仅让长距离关系更难学习,也限制了训练时可以进行多大程度的并行计算。

你可以把它粗略理解成:

有些工作必须排队完成。

前面的计算没有完成,后面的部分就很难完全同时推进。

而神经网络的发展,偏偏越来越依赖另一件事情:

计算规模。

GPU最擅长的并不是耐心地一个接一个做任务。

它更大的价值,在于同时进行大量矩阵运算。

于是一个技术矛盾出现了:

一边是语言天然具有顺序;

另一边,是现代计算基础设施越来越擅长并行。

如果处理语言的方法始终高度依赖逐步递归,那么你拥有越来越强大的计算设备,也未必能够把它们的能力充分释放出来。

这就是2017年那篇论文所处的技术背景之一。

Google团队没有问:

怎样把原来的循环网络再改好一点?

他们做了一件更激进的事情:

能不能把循环本身拿掉?

论文给出的答案是:

可以。


02 Attention早就存在,Transformer做的是另一件事

这里有一个很容易被今天的叙事简化掉的事实。

Attention并不是2017年突然被发明出来的。

在Transformer出现以前,注意力机制已经被应用于神经机器翻译等任务。

它解决的核心问题之一是:

当模型处理当前位置时,应该重点参考输入中的哪些部分?

比如翻译一句话。

生成当前这个词时,输入句子里的不同词显然不应该拥有完全相同的重要性。

Attention允许模型根据当前任务,对不同位置分配不同权重。

这个思想已经存在。

《Attention Is All You Need》更激进的地方在于:

如果Attention不再只是原有网络旁边的辅助机制,而成为整个架构的核心,会怎样?

于是Transformer出现了。

论文明确提出:

不再依赖循环,也不再依赖卷积来完成序列转换,而主要依靠Attention机制构建整个模型。 

这里最重要的一个机制叫:

Self-Attention。

自注意力。

不要把它理解成机器突然获得了某种类似人类的“注意力”。

这是一个功能性比喻。

它做的事情更接近:

处理一个词时,让模型计算这个词与序列中其他位置之间的关系。

比如:

“The animal didn’t cross the street because it was too tired.”

这里的“it”到底更可能指什么?

模型需要建立不同位置之间的关系。

Self-Attention提供了一种直接计算这些关系的方法。

而且Transformer还使用Multi-Head Attention,让模型能够在多个表示子空间中同时捕捉不同关系。

技术细节当然比这复杂得多。

但如果站在后来AI产业发展的角度,只抓住一个变化就够了:

不同位置之间的关系,不再必须主要沿着一条漫长的循环链条逐步传递。

论文比较了不同架构连接远距离位置所需要的路径长度。在Self-Attention层中,任意位置之间可以通过更短的计算路径建立联系;同时,Transformer的设计显著提高了训练的并行化程度。 

这两个变化放在一起,后来产生了巨大的意义。

因为AI研究很快会进入一个越来越依赖规模的时代。

而规模最怕什么?

不是只有算法不够聪明。

还怕:

算法本身很难把越来越庞大的计算资源有效吃进去。


03 那篇论文当时证明的,其实没有今天这么多

今天回看Transformer,非常容易犯一个错误:

把后来十年发生的一切,重新塞回2017年。

仿佛Vaswani等人发表论文的时候,就已经站在Google办公室里看见了GPT、ChatGPT、Claude、Gemini,以及今天的大模型产业。

事实远没有这么戏剧化。

论文验证的核心任务主要是机器翻译。

在WMT 2014英德翻译任务上,Transformer取得28.4 BLEU;在英法翻译任务上取得41.0 BLEU。论文还报告,后一个模型使用8块GPU训练约3.5天。 

这是很强的结果。

Google在2017年介绍这项工作时,强调的同样是Transformer在语言理解、机器翻译上的性能与并行训练优势。 

注意:

当时被证明的是——

一种新的架构,在这些任务上表现很好,而且更适合并行训练。

没有证明:

只要不断增加Transformer参数,就一定会产生今天的大语言模型能力。

没有证明:

Scaling最终一定能够走到AGI。

更没有证明:

几年以后数亿普通人会每天和基于这类架构发展的模型聊天。

那些答案,当时都不存在。

这恰恰使这个故事更有意思。

因为很多改变产业的基础技术,刚出现的时候,并不会在脑门上写着:

“下一代基础设施。”

它往往只是比上一种方法:

快一点。

准一点。

便宜一点。

更容易扩展一点。

甚至只在一个很具体的场景里效果特别好。

真正困难的是判断:

这个局部优势,究竟只是局部优势,还是一个更大系统即将建立的起点?

这件事不仅发生在AI。

互联网最初并不是为了今天的移动商业世界设计的。

GPS最初也不是为了外卖、网约车和共享出行设计的。

很多企业面对新技术时,最容易问的是:

它现在能替我节约多少成本?

可有些技术真正危险的地方,并不在于今天提高了10%还是20%的效率。

而在于:

它改变了未来能够建立什么。

Transformer就属于后一种技术。


04 一篇机器翻译论文,为什么后来能够承载大模型?

这里才出现这篇论文更值得商业管理者理解的地方。

技术突破通常有两种价值。

一种叫:

问题价值。

它把眼前这个问题解决得更好。

另一种叫:

架构价值。

它提供了一种可以被迁移、组合、扩大,最终承载远超原问题的新结构。

Transformer最初首先展示的是前一种价值。

后来越来越重要的,是第二种。

原因之一就在于它和计算规模之间形成了非常关键的适配。

上一章我们已经看到:

OpenAI从Dota等实验里越来越清楚地意识到,计算资源不只是研究工作的后台成本,它可能直接参与能力增长。

问题随之而来:

有更多计算,并不意味着一定能有效使用更多计算。

你还需要一种能够把这些资源转化成模型能力的架构。

Transformer提高并行训练效率这一点,因此拥有了超出机器翻译本身的长期价值。

更重要的是,它不是一个只能处理某个固定语言任务的狭窄结构。

它提供了一套处理序列、建立上下文关系的通用机制。

这意味着另一种可能性开始出现:

既然它可以处理翻译中的语言关系,

为什么一定只让它学翻译?

如果给它更大量的文字呢?

如果不首先告诉它:

“你的任务是英译德。”

而是让它通过大量文本学习语言本身的统计结构呢?

这一步一旦发生,问题就从:

怎样把一句英文翻译成德文?

慢慢变成:

能不能先让一个模型从大量文本里学到某种可以迁移的通用表示,再拿去完成许多不同任务?

这并不是Transformer论文单独给出的答案。

但Transformer提供了一块极其重要的基础。

真正把技术变成产业的过程,往往就是这样发生的:

发明者解决第一个问题。

后来者重新定义这个技术究竟属于哪个问题。

技术突破决定一扇门能不能打开,战略判断决定打开以后往哪里走。


05 Google发明了Transformer,然后呢?

这也是这个故事最容易被写成“Google错失AI”的地方。

这种写法很诱人。

也过于简单。

Google并不是发明Transformer以后把它扔进了抽屉。

Transformer来自Google研究团队,Google随后也持续沿着Transformer推进自然语言研究与产品应用。

后来影响巨大的BERT,同样来自Google。

所以如果简单写成:

Google发明Transformer,却完全没有看见它的价值;

并不符合事实。

真正值得研究的问题其实困难得多:

为什么一家公司能够创造一项重要基础技术,却不一定由它率先定义这项技术最终面向普通用户的产品形态?

“发明技术”与“获得技术创造的全部战略价值”,从来不是同一件事。

中间至少还隔着:

技术路线选择。

资源投入。

产品化。

组织激励。

商业模式。

用户入口。

风险承受能力。

以及一个尤其重要的能力:

把原来解决A问题的技术,重新放进B问题里。

这对今天的企业尤其重要。

AI正在进入几乎所有行业。

大多数公司都会观察:

同行正在怎么用AI?

客服能不能提效?

报告能不能自动写?

代码能不能生成?

流程能不能自动化?

这些当然都值得做。

但如果只停在这里,就很容易犯2017年看Transformer时最容易犯的错误:

只按照它今天正在解决的问题,判断它未来的价值。

一个更困难的问题是:

你所在行业今天有没有某项看起来只是提高局部效率的技术,实际上正在改变整个行业未来的基础架构?

如果有,管理者真正需要决定的,就不只是“要不要采购”。

而是:

如果它继续成熟,价值链里的哪个位置会发生变化?

谁会因此拥有新的入口?

什么能力会从稀缺变成标准配置?

自己今天最值钱的资产,到那个时候还值钱吗?

技术研究与战略研究,从这里开始分开。

前者问:

它现在能做到什么?

后者还必须再问一句:

如果它继续成立,接下来什么会变得可能?


06 OpenAI没有发明这张地图,却开始沿着它往前走

现在,把时间重新拨回2018年。

OpenAI正在经历上一章讲过的那场资源危机。

它越来越相信,计算规模可能比创立时预想的重要得多。

与此同时,一种更适合大规模并行训练的语言架构已经出现。

两条原本不同的线开始接近。

一条来自OpenAI自己的实验:

Scale可能带来新的能力。

另一条来自Google研究团队:

Transformer提供了一种非常适合大规模训练序列数据的架构。

接下来发生的事情非常关键。

2018年,Alec Radford、Karthik Narasimhan、Tim Salimans和Ilya Sutskever发表了OpenAI的生成式预训练研究。

他们使用Transformer,把“生成式预训练”和后续针对具体任务的微调结合起来:

先利用大量未标注文本进行语言模型预训练,再把获得的能力迁移到问答、文本蕴含、语义相似度、分类等不同自然语言理解任务。 

后来,人们把这个模型称为:

GPT。

Generative Pre-trained Transformer。

最后那个T非常重要。

Transformer。

OpenAI没有发明它。

这件事反而让接下来发生的一切更值得研究。

因为科技竞争从来不只是比:

谁第一个发明。

还要比:

谁能够识别一项技术真正可以迁移到哪里;

谁愿意在别人还把它当成一个局部解决方案的时候,把它放进一个更大的问题;

以及谁最终有能力把这个判断不断扩大。

这也是为什么2017年的《Attention Is All You Need》,放在OpenAI的故事里如此重要。

它不是OpenAI的成果。

却成为OpenAI下一阶段技术路线的重要基础之一。

而这里还剩下一个问题没有回答。

Transformer让训练变得更适合并行,让不同位置之间建立关系变得更加直接。

这些仍然只是架构层面的优势。

它究竟打开了什么?

为什么这种架构后来可以从机器翻译走向语言模型?

为什么“预测下一个词”这样一个看起来甚至有些简单的训练目标,最后会表现出远远超过文本补全的能力?

以及最重要的:

如果一种架构能够不断吸收更多数据和计算,它的能力边界究竟在哪里?

Google画出了这张地图最重要的一部分。

接下来,有人准备沿着它继续往前走。

⸻

下一期:第032章|Transformer到底打开了什么

⸻

关注 Nick See|系统思维

与Nick See 一起,

看见现象,看懂结构,看透本质,看远未来。

不追逐更多答案,只追问真正重要的问题。

Nick See看见,不只是看见。

相关学习资料