ARTICLE · 1111197
AI 大模型到底是什么原理?大模型原理通俗讲解系列第一期 -- 接龙游戏
AI 大模型到底是什么原理?大模型原理通俗讲解系列第一期 -- 接龙游戏AI 大模型这个领域现在是真的火。就算是广大中老年群体,也都开始接触“豆包”这类智能助手了。可以说 AI 大模型这一块确实融入了大家的生活之中,提供了不少便利。 相信大家在第一次接触这类 AI 大模型的时候,都被惊艳了一下。这玩意真的能和你对话,真的能帮你解答问题,而且它的知识面很广,似乎无所不知,这就很神奇。这玩意凭什么这么智能呢?到底是什么原理?它真的无所不能,甚至可以代替人类吗? 我发现网络上能把这些问题讲清楚的人还真不多。所以就萌生了写这个系列的想法,正好赶上国庆假期,准备假期里把这个系列更完。 要讲清楚 AI 大模型(大语言模型,Large Language Model),咱不能上来就甩一堆公式、论文和专业术语,那样大家直接就蒙圈了。我会用尽可能通俗的讲解,争取让中老年群体的大爷大妈们都能看得懂。 不过这玩意确实比较复杂,一篇文章肯定讲不完,我计划分四期来聊: 好的,我们接下来开始第一讲! 直接回答这个最重要的问题:它到底是什么原理? 其实非常简单,不管是豆包还是 ChatGPT、DeepSeek,扒掉那层“高科技”的外衣,它们在和你聊天时,本质上只做了一件事: 文字接龙! 没错,那个能回答问题、能写代码、博古通今的人工智能大模型,本质上就是个文字接龙大师。 想象一下,我给你半句话: 作为一首家喻户晓的唐诗,你的脑子里瞬间会蹦出“光”这个字。 为什么?因为在你的记忆里(唐诗三百首),“光”出现在这里的概率是 99.99%。你几乎不需要思考。 AI 大模型也是这么干的。 当你在聊天框输入一句话时,模型并不是在“思考”这一整句话的意思,而是在疯狂计算:“基于前面所有的字,下一个字出现概率最高的是哪个?” 你说:“我想吃……” AI 的大脑里瞬间生成了一张概率表: 然后,它就像掷骰子一样,根据这些概率选出一个词。一般情况下都是选择概率最高的,但是偶尔也会在排名前几名的词里随机挑一个。这就是为什么对于同一个问题 AI 每次的回答都不一样,这也是它“创造力”和偶尔“胡说八道”的来源。 当它选定“火锅”后,它会把“火锅”填上去,把“我想吃火锅”作为新的开头,继续猜下一个字。 这就是大模型的核心机制:根据前面的内容,猜测下一个字,然后再猜下一个字,就这样一个字一个字地往外蹦。这也是为什么你在用豆包之类的AI,它回答问题时是不断的往外吐字的,而不是一下子把整个回答发给你。 看到这里你可能会问:“文字接龙?这就有点扯淡了吧?我都用它查资料、写代码了,如果它只是单纯猜下一个词,它是怎么理解逻辑的?” 问得好!这就是量变引起质变的地方。 早期的模型确实很笨,它们只看前面那一两个词。看到“苹果”,它只想接“好吃”。但现在的 AI 大模型,他们的“上下文窗口”非常巨大,它能同时看着前面几千甚至几万个字来猜下一个字。 举个例子: 关键点来了:为了准确地猜出下一个字,模型必须被迫学会理解世界。 这种能力,学术术语叫“涌现(Emergence)”,其实说人话就是量变引起质变了。 就像水分子只是简单的 H2O,但无数个水分子聚在一起就能形成河流湖泊,甚至形成海洋。当 AI 大模型学习整个互联网的文本信息以后,简单的“文字接龙”任务逼迫它进化出了逻辑、推理甚至情感模拟能力。 我们经常看到 Token 这个词,但是 Token 到底是个啥东西呢? 其实看懂了前面文字接龙的“猜词”游戏,Token 就很好理解了。因为 AI 猜的不是“字”,而是Token(词元)。 Token 是 AI 处理文本的最小单位。 在英文里,一个 Token 可能是一个单词(apple),也可能是词根(ing)。 在中文里,一个 Token 通常是一个汉字,或者常用的词组。 比如“人工智能”,对 AI 来说可能就是 1 个 Token,而不是 4 个字。 “猜词”游戏其实就是 AI 大模型根据前面的 Token 内容来猜测下一个 Token。 好的,我们总结一下今天的内容: 大模型本质:AI 大模型是一个基于统计学的文字接龙大师,它的全部工作就是预测下一个 Token。 大模型原理:它不理解“道理”,它只理解“概率”。它不理解唐诗三百首的诗词意境,它只知道“床前明月”四个字后面通常 99.99% 的概率跟着“光”字。 量变引起质变:当大模型的资料数据量足够大时,“模仿”变成了“理解”,“概率”变成了“逻辑”。 如果大家听懂了“猜词”这个核心本质,肯定会好奇: “它是怎么记住前面说了啥的?它是怎么知道‘苹果’在这里指手机,在那里指水果的?” 这就是第二讲:Transformer 架构的内容了。各位准备好进入 AI 的最硬的“内核”了吗?
第一期:讲一下 AI 大模型的简单本质,它到底是怎么和你聊天,回答你的问题的。 第二期:讲讲 Transformer 架构,这部分是最硬核最难讲的了。但是这部分太重要了,必须单开一章。 第三期:讲讲 AI 是怎么训练出来的。毕竟人工智能再厉害,它也是人造出来的。 第四期:讲讲 AI 和未来的个人看法,它真的会取代人类吗?
1. 接龙游戏
“床前明月____”
火锅:25% (这届人类比较重口味) 苹果:15% (健康选项) 土:0.0001% (除非你是蚯蚓或者穷疯了) 钢筋:0.0000001% (这不符合正常逻辑)
2. 为什么它显得那么聪明?
句子: “虽然大家都觉得小明是个数学天才,但在面对这道连微积分教授都摇头的难题时,小明还是无奈地摇了摇____”
笨模型只看最后几个字“摇了摇”,它可能会猜:“摇了摇尾巴”、“摇了摇可乐”。 AI 大模型看到了前面的“数学天才”、“难题”、“无奈”这些关键词。它不仅懂语法,还懂语境,甚至懂人类的情绪。 所以 LLM 会猜:“摇了摇头”(正确答案)。
为了补全一段程序代码,它必须被迫学会编程逻辑,否则它猜不对代码怎么写。 为了补全一段侦探小说,它必须被迫学会推理谁是凶手,否则它猜不对结局。