ARTICLE · 1126546
AI到底是什么?揭秘 AI 侃侃而谈的底层秘密
一直想写一篇文章来说说AI大模型,我一直说AI是工具,是一个基于计算机底层原理工作的数据,目前论智能谈不上,它就像原始人打猎手中的那块石头,也像刀耕火种时代突然有一件铁制的工具,也像80年代末90年代初普及的计算机,它能让你的工作效率提升。

我说得不是成年人生存工作赚钱的问题,我说得是孩子教育方面的问题哈。我在给孩子们讲编程课的时候,一直在强调计算机编程语言都一样,计算机编程实现的是更快的数据处理。所以我在编程课方面要求的不是你的代码能力咋样(当然参加竞赛的孩子要练的哈),我是加入了一些数学的知识原理,但更多的时候是让孩子们清楚怎样去处理数据,变量是数据,列表(数组)也是数据,栈、二叉树也是数据,每年暑假我基本都会公益带一些准大一的新生去学几天编程,编程语法的部分很快介绍完,更多的是教孩子们一些数据结构的东西和简单的算法问题。我家崽今年上大一,大类是数学,大学学数学的孩子参加数学建模基本是标配,但孩子跟我说了两句话我很震惊:第一句,数学建模那些老师一上来默认你编程是会的。第二句,我已经用Python编了一个计算器了。暑假的时候我明明给他留了假期作业的:基础语法(循环最重要),容器(重点 列表 list 、元组 tuple、字典 dict),函数(参数和返回值),然后就是NumPy(数组(ndarray),用来做矩阵运算,对接高等代数),有必要的时候了解下SQL语句。我今年想给所有的孩子和家长说一句话,不管是学编程也好学AI也好,底层逻辑是你的思维方式,学编程的最底层逻辑是数据处理,处理的越快越好。
23年前刚到天津的时候,我在一家集团公司信息中心供职,实习期的一个月天天在看无聊的代码,但我发现我的主管几乎每天都把部门核心程序员喊一起开会,那时候年轻有表现的成分哈,有一天我很好奇的问,你们开了快一个月会了,到底在处理什么问题,因为我觉得除非是系统架构的问题可能要反复开会,但我们没有新项目,只是在老系统上做维护。后来我才知道原来是财务核算部门关于一张成本核算报表的问题,不是数据不准确,是因为只要财务一打开这张财务报表,所有数据源访问同一台服务器数据的终端电脑就跟死机一样,大约13分钟后才能恢复正常。因为我们有部分订单是做定制的,那就说制造BOM不是标准的BOM清单,所以日积月累制造BOM表单里的数据大约几亿行,而相关的业务也就涉及到6个表单。我当时是好奇问问,没想到这件5位核心程序员讨论了快一个月的大事儿,突然降临到我的头上。其实也没有任何算法的问题,就这些都号称资深程序员们连最简单的SQL语句工作原理都没搞明白,主管原本给我三天时间,而我只用了一顿中午饭没去食堂的时间,最后以执行结果12秒解决。13分钟——12秒的结果。我不是一个多高深的程序员,好多东西我也只是皮毛而已,但多年的乙方工作经验我知道客户更需要什么,我也能站在客户方面去想问题,但更多的是真正解决问题,而不是去对付客户。说这么个事儿不是为了说什么,而是我想告诉大家,在孩子教育的路上也是这样,我们要想想,最终解决的问题是什么?难道就是考个985吗?或者最终的结果就是你考公考编吗?我儿子是985,他的学校专业在国内高校不说是第一梯队吧,第1.5梯队也应该是可以的,但我给孩子的永远不是你以后做什么工作,而是你要学会解决问题,学习是问题,生活也是问题,未来工作也是问题,这些问题解决起来是有先后顺序的,不论什么社会,你要有安身立命的本身,这才是你的底气。
把话切回到AI来。

计算机在处理数据的时候,检索和运算大量的数据,于是就出现了算法,但算法是基于数学建模符符合计算机更快运算的一套标准机制,就像咱们孩子学数学学物理的模型题,也像语文阅读理解的答题套路和模板,因为这样更快能拿高分。怎样才能有数学模型呢?目前补课市场上都是老师总结灌输给孩子去记忆,然后通过大量的刷题来稳定你的经验值。所以大家看这个过程,这就是大家所谓的大模型的训练,让他基于你常规的工作形成一套固定的模版,以便于在工作中直接执行这套模版,而不是盲猜。而咱们祖国的工程师其实一开始是用来解决GPU算力不够的情况,引入了KV 缓存这个东东,国产大模型用来 “保存中间计算草稿、下次相似问题直接复用” 的核心机制。这就相当于老师教你模型题,你把它记在笔记本上,下次不会的时候打开查一查,这样就稍微显得智能了一些,最近半年如果你用了一些大模型,你就会发现,它能记住你之前说过的一些东西。做个例子哈,之前我问大模型,任海是谁?它会从大量网页上抓取一些叫任海或者任海X的人的信息给我,于是我就把我个人的一些信息给他,当时只要不退出聊天页面,它是能记住的。但几个月前我惊奇的发现,如果你再问他这个问题,他直接能说出来。
很多人跟 AI 聊天,总觉得 AI 很聪明,好像真的能听懂我们说话、会思考。今天用最简单的话告诉你:AI 没有大脑,不懂道理,没有想法。它不会 “理解” 你的话,只会猜字。
AI 的工作分成两大步:提前 “刷题集训”,和你提问的时候现场 “猜答案”。
第一步:训练 —— 提前疯狂看书刷题
在对外开放给大家使用之前,首先是大模型里预置了人类迄今为止几乎所有的知识库,AI 会读网上海量的文字:文章、书籍、新闻等等。它不是把所有内容背下来,而是在里面找规律:一句话前面写了哪些字,后面一般跟着什么字。举个简单例子:看到 “床前明月”,后面大概率跟着 “光”。
AI 里面有上亿个看不见的小数字(专业名叫参数)。看书的过程,就是不断调整这些数字,让它猜字越来越准。它学会的是:人类说话的习惯、词语搭配、常见的常识套路。
这里有个很厉害的功能,大家简单理解就行:它能分清句子里面,哪个词对应哪个。比如句子很长,它能搞懂 “它” 指代的是谁,这就是大家常听到的自注意力。
集训结束之后,这些数字就固定好了。AI 的读书学习阶段,到此结束。
第二步:你提问的时候,现场猜字(推理)
当你发一句话问 AI,它是这么干活的:
先把你的话拆成一小段一小段文字,转换成机器看得懂的数字; 翻看前面所有文字,算一算:接下来最有可能出现什么字? 挑一个合适的字输出; 把刚输出的这个字,加到整段文字后面,再继续猜下一个; 一遍一遍循环,一个字一个字往外猜,直到一整段话说完。
也就是说,AI 不是一次性想好完整答案再发给你。你看到文字一段段跳出来,就是它正在一个字一个字猜。
用 7 个关键词,轻松看懂它的底层玩法!
信息就是世间各种故事、知识、想法。我们人类能读懂信息背后的含义,但计算机看不懂 “道理” 本身。所有内容,都得先变成文字,大模型才能接手处理。
文字是承载信息的符号。汉字对我们有喜怒哀乐,但在大模型眼里,它们只是一堆符号。它会把长长的句子切成一小片一小片文字碎片,准备进行下一步转换。
电脑只认数字,不认汉字。切好的文字碎片,会被翻译成一串串数字,这就是数据。海量书籍、文章、网页内容,全都变成庞大的数字集合,这就是大模型用来 “读书” 的学习素材。之所以叫大模型,核心原因之一,就是它用来学习的数据体量极其巨大。
计算机本质就是一台超快的计算器。CPU、GPU 就是它的运算引擎。大模型内部有海量参数,运算量爆炸,需要大量显卡一起协同工作。它所有的 “聪明表现”,没有一丝一念的思考,全是硬件在疯狂重复做加减乘除。
算法就是一套写好的计算说明书。现在的大模型,核心依靠 Transformer 这套算法。它的任务,就是计算不同文字片段之间的关联,分清长句子里谁和谁有关系,读懂上下文的指代。
概率统计这可是大模型的看家本领!训练阶段,大模型啃完海量数据,默默统计文字搭配规律:出现某几个字之后,后面最常跟着哪些字。它不会背诵整篇文章,只是记住文字组合出现的概率。大模型里数以亿计甚至上万亿的隐藏数字(参数),存的就是这些统计结果。模型越大,存储的这类统计规律就越多。
推测,这就是你提问时,大模型现场答题的全过程!你输入问题,文字转成数据,算法调取之前学到的概率,推测下一个最有可能出现的文字。选出这个字,接到句子末尾,再继续猜下一个…… 循环往复,一字一字 “攒出” 完整回答。
AI Agent(智能体):会主动干活的数字员工前面聊的大模型,属于被动应答:你提问,它才生成文字。而最近大火的 Agent(智能体),是以大模型作为大脑,具备自主规划、调用工具、自我校验的能力。
你只需要下达一个最终目标,Agent 会自动把任务拆分成多个步骤。它还能主动调用外部工具,比如搜索引擎、SQL 数据库,自动写查询语句,去数据库里读取真实数据,拿到结果之后继续完成后续工作。
底层上,Agent 依然依靠大模型、GPU 算力、KV 缓存机制运行。它并不是拥有独立思想,只是可以自动循环 “思考→调用工具→拿到结果→再思考”,完成多步骤复杂任务。当然,Agent 也会判断失误,复杂任务依旧需要人工核验最终结果。
敲黑板!大模型的推测≠人类的逻辑推理。它不会理解句子含义,只是根据统计规律猜文字。所以它偶尔会一本正经胡说八道,也就是大家常说的AI 幻觉,语句看着通顺,事实却是编出来的。因为它只是按概率猜字,不是查真实资料。有时候猜出来的句子看着通顺,内容却是编的假信息,这就是AI幻觉。
一句话看懂整条链路:信息化作文字,文字转为数据;大模型依靠计算机硬件、数学算法,在海量数据里学习概率规律,使用时一步步推测,输出我们看到的文字答案。
说到底,大模型不是拥有思想的智者,只是一个擅长文字接龙的超强工具。好用,但不能盲从。遇到关键信息,一定要自己核对验证哦!
