ARTICLE · 1092735
用 AI 的人,一定要懂这个底层逻辑
用 AI 的人,一定要懂这个底层逻辑你有没有遇到过:向AI要几本参考书,它一口气列出好几本,书名、作者、出版社、年份一样不缺,说得十拿九稳;拿去一查,有的书根本不存在。 它不是故意骗人。 用AI的人一定要懂的底层逻辑,就这一句:AI从来不是在“回答”问题,它是在“续写”文字。 就像手机输入法的联想:打出“今天天气”,它会跳出“真好”“不错”,因为很多人打完“今天天气”,接着打的就是这几个词。 AI做的是同一件事:看着前面已有的字,猜后面最可能接什么字。只不过输入法只看你刚打的几个字,AI会把你的整个问题,连同它自己已经写出的话,都当成依据;它见过的文字,也比输入法多得多。 要的是参考书,它就续写出最像参考书目的样子:书名带书名号,作者像个作者,年份像个年份。至于这本书存不存在,不在它算的范围里。 所以,AI的笃定,是学来的口吻,不是查过的底气。 懂了这一条,就知道AI的回答什么时候能直接用,什么时候必须自己去查。而要真正看懂AI怎么猜,最好先看看人自己怎么猜。 人其实也一直在猜:出门时笃定门外是楼道,不是悬崖;听见“喵”就判断附近有只猫;端起杯子,从不怀疑它会突然消失。 这些“确定”,都是大脑凭经验做出的猜测,只是把握大到一定程度,我们感觉不到自己在猜。区别在于,人猜的是一件事是真是假、会不会发生,AI猜的是下一个字写什么。 加上科学研究,三者都在算概率,用处却各不相同:人为了做事,科学是为了探究真相,AI则是为了把下一个字接顺。 大脑天生就在做预测。 它算的从来不是精确的数字,而是一个判断有多大把握、够不够让我们放心去做下一步。这个“把握”,专业上叫“置信度”。 比如听到门外有脚步声,大脑会马上调出过往的经验:这个钟点,家人回来的可能最大,快递员其次,陌生人最小。它不会算到小数点后,只会粗略地分成“几乎肯定”“很可能”“说不定”几档。如果脚步声停在门口,接着响起掏钥匙的声音,判断马上更新:基本就是家人,可以准备开门了。 这种判断方式,可以叫“粗略的贝叶斯推理”。贝叶斯是18世纪英国的一位数学家,他留下的一条公式讲的正是这个过程: 在门外脚步声的例子里,“这个钟点多半是家人”是先验,掏钥匙的声音是新信息,“基本就是家人”是后验。 人算概率,有两个特点。 第一,永远是为了决定自己下一步怎么做。 判断是不是猫叫,是为了决定要不要去看一眼;判断路安不安全,是为了决定要不要往前走。概率的高低直接关系到自己的安危和要办的事,不是一个跟自己无关的数字。也正因为判断完要自己去做,猜错了,吃亏的也是自己。一个孩子被刚烧开的水壶烫过一次,以后再拿水壶,都会先用手背试试温度。每吃一次亏,下一次的判断就修正一次。 第二,够用就行,不求精确。 对决定要不要动手来说,90%和95%没有区别,都是“基本靠谱,可以行动”。非要等到百分之百确定再行动,只会浪费精力,错过时机。 所以,人算概率,是为了活下去、为了做事,不是为了追求终极真理。 科学里也离不开概率,这些概率有两个来源:一个是科学得出结论的方法,一个是科学研究的事情本身。 科学得出的结论,没有一条能百分之百确定;可科学研究的事情,并不都是随机的。 1. 方法上:所有科学定律都是“高概率结论” 科学定律是从一次次观察和实验里总结出来的,这叫归纳法。做了一百次实验,结果都一样,就总结成一条定律;可第一百零一次会不会不一样,谁也不能打包票。 牛顿力学用了两百多年都算得很准,直到研究的物体速度接近光速才对不上,得换成爱因斯坦的相对论;可今天造桥、造汽车,用的还是牛顿力学。 科学有一整套专门找错的办法:实验要让别人能照着重做,结论要拿新的数据去检验,检验不过就改。所以,科学从来没有给过我们“绝对真理”,给的都是“现有证据下把握最大的答案”。 2. 对象上:有的是我们测不全,有的是事情本身就随机 判断一件事本身是不是随机的,有个简单的办法:假设把影响它的条件全都弄清楚,看结果能不能算准。 第一种,能算准,事情本身不随机,是我们测不全才用概率。天气预报说“明天降水概率70%”,可明天下不下雨,是由空气的温度、湿度、流动决定的,只是气象部门不可能把每一处空气都测到、算清。这70%,是预报对“明天会下雨”有七成把握,不是明天的天气本身还没定。炮弹落在哪、流行病怎么传开,也属于这一种。 第二种,条件全弄清楚了,结果还是算不准,事情本身就是随机的,这要到原子这么小的尺度才会遇到。一大批碳-14原子多久衰变掉一半,算得很准;可其中某一个原子哪天衰变,把它测得再清楚也算不出来。按照量子力学,这个原子本来就没有定好的衰变时间。 日常生活里碰到的概率,几乎都是第一种;第二种只出现在原子这样的微观世界里,不能拿来推出“整个世界本质上都是随机的”。 人算概率、科学算概率,算的都是现实里的事,猜错了,由后果和实验来纠正。 AI算概率,算的是人们通常会怎么写;它猜得对不对,也只拿人写的文字来判断。开头那几本查无此书的参考书,单靠AI自己是查不出来的:它只管写得像不像,不管那本书是否真的存在。 今天我们用来聊天、写材料、查问题的AI,大多是“大语言模型”,一种专门学习和生成文字的AI。它从头到尾都在算概率,而且算的东西是三种里最单一的:只算哪些字常跟着哪些字出现,不管这些字说的事在现实里是不是真的。 它和输入法联想一样,干活分两步:先学,再猜。 1. 先学:从海量文字里学会“什么后面常跟什么” 大语言模型会的一切,都是从文字里学来的。训练时,工程师给它准备的文字,一个人读几辈子也读不完。 学的办法说起来很简单:拿一段文字,遮住后面的字,让它猜;猜完和原文对照,对不上,就把它内部的参数调一点。参数是模型内部可以调节的数值,大的模型有上千亿个。这样的对照在海量文字上反复进行,它就慢慢学会了:什么样的前文后面,通常跟着什么字。 学到的东西存在这些参数里。存下的主要是从原文里总结出的规律,不是一字不差的原文。所以它答问题,不是去翻一本背下来的书,而是每次按规律现算。 也正因为是从原文里学的,它读过什么,就决定了它会什么:原文写对了,它学到对的;原文写错了,它连错的一起学进去;没读到过的,它就不会。 参考书目该长什么样,它见过成千上万份,学得极熟;某一本具体的书存不存在,它未必读过。 像OpenAI公司的ChatGPT这样的聊天AI,读完海量文字还不算完。工程师先拿人写好的示范回答教它怎么答,再请人给它的不同回答打分,把高分回答那种写法的概率调高,低分的调低。它说话有条理、有分寸,也容易顺着提问的人说,都来自这轮调整。但这轮调整只让它更会说话,没有给它添上核对事实的本事:它拿到的只有人写的示范和人打的分数,自己从来没有去现实里核对过一件事。 训练结束后,参数就固定下来了。在对话里指出它错了,它会在这次对话里改口,但参数不会因此改变;换一个人来问同样的问题,它还可能给出原来那个答案。它改口了,不等于它学会了。 2. 再猜:看着前文,给下一个字算概率 学完之后,它才开始干活。它认识的“字”列在一张固定的表里,少则几万个,多则二十来万个。严格讲,这些“字”是它切分文字的最小单位,可能是一个字、一个词,也可能是一个标点。 这种切法,有时会闹出笑话。2025年,美国OpenAI公司的研究人员在一篇论文里记录过一件事:他们问DeepSeek“DEEPSEEK这个词里有几个字母D”,问了十次,它答的是2或3,正确答案是1。别的几个常用AI也好不到哪去,有的答到6、7个。原因是它看这个词,不是一个字母一个字母地看,而是切成D、EEP、SEE、K几块来看。单个字母它没有直接看到,只能按概率报一个像样的数,口气照样笃定。 每写一个字,它都要看着眼前的前文,也就是提问的人说了什么、它自己已经写了什么。它用学到的规律,给表里的每一个候选算出一个概率,再从中挑一个,接到前文后面,然后接着算下一个。 所以它写出的每一个字,取决于两样东西:训练时学到了什么,眼前的前文是什么。前一样在训练结束时就定了;后一样每次对话都不同。同一个问题,换个问法,或者多交代一句背景,每个字的概率都会跟着变,回答也就跟着变。 它看前文的能力,是这几年AI变准的一个关键原因。 手机输入法联想,一般只看刚打的几个字;更早的模型能看得远一些,可读到后面,前面的就记不太清了。 2017年,谷歌的研究团队提出一种新结构,叫Transformer,ChatGPT名字最后那个T指的就是它。它的核心是“自注意力机制”:每写一个字,都回头查看前文里的每一个字,看哪个字和现在要写的这个字关系大,关系大的多参考,关系小的少参考。 谷歌当年介绍这项技术时举过一个例子。“那只动物没有过马路,因为它太累了”,这句里的“它”是动物;把“太累了”换成“太宽了”,“它”就成了马路。模型读完这句要往下写,得先弄清“它”指谁:读到“累”,就更多地参考“动物”;读到“宽”,就更多地参考“马路”。 这和人听到“喵”时的判断很像。人会结合所处的环境:家里养着猫,多半是猫;一屋子小孩在闹,多半是哪个孩子在学猫叫。自注意力机制让模型也能结合完整的前文来算概率。但它算的依然是“下一个字写什么”,不是“屋里到底有没有猫”。 挑字的时候,它也不总是挑概率最高的那个。聊天AI通常是按概率抽签:概率高的更容易被抽中,但不是每次都中。所以同一个问题问两次,回答常常不一样。 我们看到的长篇大论、代码、诗歌、看似严谨的推理,都是这样一个字一个字算出来的。 3. 本质:它的概率是“空”的 打个比方。如果真实世界是一片大地,人写下的文字就是一张地图。AI对这张地图熟得不能再熟,每条路、每个地名之间的关系它都清楚,从任何一点出发,都能画出一条最通顺的路线;但它从来没有走出过地图一步,没见过真的山和河。现在有的模型也能看图片、听声音,可图片和录音同样是人留下的记录,仍然属于地图的一部分。 它学到的,是“什么常跟着什么出现”,不是“什么引起了什么”。它学到了“火”和“烫”总连在一起,也能把火为什么烫讲得头头是道,因为讲这些道理的文字它读过很多。但它能写出“火是烫的”,靠的是文字怎么搭配,不是被烫过。用专业的话说,它掌握的是相关,不是自己检验过的因果。 数据多,也不等于离真相近。一个说法写的人多,它就更可能这样说,哪怕这个说法是错的;写的人都带着同一种偏见,它也跟着带上。 AI算出的概率,依据只有文字。它算出的高概率,只说明“人们常这样写”,不说明“事情就是这样”。它没有自我,没有切身的利害,也没有求真的动机;训练对它的要求,只是写得更像人写的、更容易得高分。 说它的概率是“空”的,意思是:这些数字算的是“下一个字怎么写更常见”,不是“这件事有多大可能是真的”。算得再精确,也对应不到任何一件它自己核对过的事。 4. 幻觉:它为什么会一本正经地编 所谓“AI幻觉”,指的是AI一本正经地说出不存在的事,开头那几本查无此书的参考书就是。它写对的时候和写错的时候,用的是同一套办法:挑最像人会写的字。 记录那个数字笑话的论文,正是专门解释这件事的。论文题为《语言模型为什么会产生幻觉》(原题Why Language Models Hallucinate),由OpenAI公司的三位研究人员和美国佐治亚理工学院的一位教授合写,2025年9月发布。 论文里,他们还拿第一作者、OpenAI研究员亚当·卡莱的事去问AI,正确答案他们自己最清楚:问生日时特意加了一句“知道才回答”,DeepSeek三次报了三个不同的日期,全是错的;问博士论文题目,三个常用的AI各编了一个,也没有一个对。 论文给出了两个原因,都出在它的学法上。 第一个原因出在它读的材料上。一件事在它读过的文字里被写得越多,它越不容易错。爱因斯坦的生日到处都写着,它几乎不会答错;一个普通研究者的生日,可能只在一篇文章里出现过一次,它学不牢,要答的时候,就用一个“看起来像生日”的日期补上。论文还用数学推导说明了一点:哪怕它读的文字一个错都没有,只要有些事只被写过一次,它照样会编。 第二个原因出在考查它的方式上。AI公司和研究机构会拿一套套考题测模型、给模型排名,这些考题大多只看对错:答对得一分,答错和答“不知道”都是零分。这样算下来,没把握的时候猜一个,总比说“不知道”划算。论文作者的说法是,AI就像一个永远待在考场里的学生,不会的题也要蒙一个。人在考场外面会吃亏:随口编一个生日,很快就会被人拆穿、闹笑话,于是慢慢学会了说“不知道”。AI却一直被按考试的办法训练和打分,编错了不会被人笑话,也就不容易学会说“不知道”。 一个人一辈子能碰到的事有限,单凭自己的经验,常常不够用。AI读过的文字比任何一个人都多,它给出的回答,相当于把很多人写下的经验汇成了一个初步判断。这正好就是贝叶斯所说的“先验”:有用,但只是起点。 拿到这个初步判断之后,还要用新的证据去修正它:去查原始出处,去问懂行的人,去现实里试一试。修正过的判断,才是“后验”,才能拿来做事。 所以AI的分工很清楚:写,交给它;核对和拍板,留给自己。不必迷信它,也不必神化它。 1. 提问:把背景说全,别让它按最常见的情况猜 输入法只能照着已经打出来的字联想,AI也一样,只能照着前文往下续写:提问的人写了什么,直接影响它每个字的概率。只问一句“我该不该换工作”,前文里没有别的信息,它只能按最常见的情况答,给出谁都适用的几条。把年龄、行业、手头的积蓄、家里的情况都写清楚,前文变了,回答才会针对自己的处境。背景写得越具体,它需要猜的就越少。 2. 查事实:回答只当线索,永远不当标准答案 AI给出的,是统计上最通顺的回答,不一定是正确的回答。它口气再笃定,也只是在算概率,不是真的“知道”。口气本身也是它按概率写出来的,和答对的可能有多大是两回事。 三种情况尤其要核对: 问的是冷门的人和事。它读得少,最容易编。 要的是书名、论文、法条、人名、数字这类具体信息。它编出来的这类信息,看上去和真的一模一样,像开头那几本查无此书的参考书就是。 问的是医疗、法律、财务、学术这类要紧的事。错了代价大。 提问时加一句“不确定就说不知道”,有时管用,但不能指望:OpenAI那篇论文里问生日的例子,就特意加了这句话。它的回答只能当线索和起点,要找权威来源逐条核对。 3. 找点子:放开用,多要几个版本 头脑风暴、写文案、想点子、理思路,可以放开用。它读过的东西比任何一个人都多,一下子就能摆出很多自己没想到的方向。这时候对不对不要紧,能不能带来启发才要紧。按概率抽签带来的随机,查事实时是毛病,找点子时正好是长处。 它第一次给出的,往往是最常见的想法,因为最常见的,概率最高。想要不常见的,就让它多给几个版本,或者直接说明不要最常见的那几种。 4. 做决定:让它摆理由,拍板留给自己 让AI帮忙分析一件事,别只要一个结论,要它把理由、依据和每个选项的利弊都摆出来。这样做,不是因为它的推理比结论可靠,推理和结论一样,都是一个字一个字算出来的;而是因为理由可以一条一条核对,结论没法核对。 它还容易顺着提问的人说:问题里要是带着提问人自己的倾向,它往往会顺着这个倾向往下论证。想听不同的意见,就先别说自己怎么想,或者直接让它替反对的一方说话。拿着它摆出来的理由自己做判断,别把它的结论当圣旨。拍板的必须是自己:用AI写的方案出了错,挨批的是交方案的人,不是AI。 5. 验模型、要出处:拿知道答案的问题试它,拿原文核对它 模型的参数多、读的文字多,不等于在具体某个领域就更准。它读哪个行业的文字多,在这个行业就答得细;读的文字截止到哪天,就只知道到哪天。训练用了哪些文字,普通用户看不到,但可以测:拿几个自己行业里、自己知道答案的问题问它,再拿几件最近发生的事问它,看它答得准不准、会不会把不知道的说成知道。 别问它“你是不是这么想的”“你有没有骗我”“你确定吗”。它没有“想”,也没有“骗”的动机,这类问题得到的,只是又一段接得顺的话:它可能坚持,也可能马上认错改口,两种回答本身都说明不了对错。 更有用的,是要它给出依据和出处,再自己去查:出处是不是真的存在,原文是不是真的这么说。开了联网搜索也一样,要点开它给的链接看原文,再看网页本身靠不靠得住;搜不到确切答案的时候,它照样可能猜一个。 把它当工具用,而不是当人看,就不会被它笃定的口气、诚恳的态度迷惑,也不会对它抱不切实际的期待。 最后 我们说话笃定,是因为被烫过、吃过亏、做过实验,判断一次次被修正过;AI说得笃定,靠的是从人写下的文字里学到的规律。AI手里这张地图要跟着真实世界更新,也要靠人:有人去现实里核对过,把看到的写下来,下一代AI才有对的东西可学。 我们知道了自己的“确定”只是把握很大,才会在AI说得最笃定的时候,多问一句“这是真的吗”,然后自己去查。 所以,记住三句话: AI不是在回答问题,是在续写文字。 AI的笃定,是学来的语气,不是查过的底气。 写,交给AI;核对和拍板,留给自己。 下次再用AI,做三件事:提问前,把背景说全;拿到书名、数字、出处,查到原件再用;要做决定,让它把理由摆出来,拍板的是自己。 身边要是有人天天拿AI查资料、写材料、做方案,这篇文章值得转给他。 肯去核对、能被事实纠正,是人和工具最大的区别。
一、人的概率:为了做事而猜
先根据经验有一个初步判断,统计学上叫“先验概率”;
再用新得到的信息去修正它,得到更准确的判断,叫“后验概率”。