AI真的会"思考"吗?
从多步推理,到思维链与计算边界
会列步骤、会反思、会纠错,就等于像人一样思考吗?
它把每一步都写出来了,这就是思考吗?
你给AI出一道题:一个项目原计划20天完成,前5天完成了25%,之后效率提高20%。按新的效率,还需要多少天?
AI没有立刻报出一个数字,而是先写下几行步骤:算出前5天每天完成的进度,算出效率提高后的每日进度,再算出剩余工作量,得出所需天数,最后检查一遍单位和结果。
结构完整,前后连贯,看起来就像一个人在草稿纸上解题。换一道更复杂的题,它还会把问题拆成几个子问题,比较不同的方案,排除不符合条件的选项,发现前一步可能有错就换一条路线,甚至调用计算器或代码来验证结果。
到这一步,"AI在思考"几乎是最自然的说法。
但我们紧接着要问:它展示的这些文字,真的就是它思考时发生的内部过程吗?没有展示步骤的时候,它是不是就没有推理?写得越长,是不是就代表想得越深入?
上一期我们讨论了AI是否理解语言。这一期继续追问:一个能够理解任务、分解问题并修正答案的系统,究竟在什么意义上可以被称为"思考"?
一句话讲清
大语言模型能够通过连续计算、中间步骤和工具调用完成多步推理,但它展示的推理文字不一定是内部计算过程的完整、忠实记录,也不能据此证明它拥有人类式的主观思考。
一条简化关系是:
问题输入 → 内部计算与状态更新 → 形成中间结果 → 比较、分解或修正 → 生成答案 → 输出可阅读的解释
有一点要弄清楚:内部计算、中间推理文字和最终解释,三者并不一定一一对应。
"能够解决需要推理的问题",与"像人一样体验自己的思考过程",不是同一个问题。
和"理解"一样,"思考"也没有唯一标准
日常语言里的"思考"至少能指六种不同的东西。
在回答前进行内部计算。系统不是直接输出第一个结果,而是先处理更多中间信息。
把复杂问题分成小问题。先识别条件,再分别计算,最后汇总结论。
比较多个可能方案。提出几条路径,再判断哪条更符合条件。
保留和更新中间状态。前一步的结果,成为后一步的输入。
检查并修正错误。发现条件冲突、结果异常或计算不一致后,重新处理。
具有主观的内在思维体验。人类说"我正在想"的时候,通常还伴随意识、注意力、意图、犹豫、感受和自我体验。
问题在于,讨论AI会不会思考时,一方可能指的是前五种计算能力,另一方却在讨论第六种主观体验。两边说的根本不是同一件事。
AI是否会思考,首先取决于我们问的是问题解决能力,还是具有意识的内在思维。
每一个中间结果,都会改变下一步计算
模型生成答案时,前面已经生成的Token会进入新的上下文。
如果它先生成一句"第一步,先确定剩余工作量",这句话连同结果,就会成为后续生成的条件。多步推理因此可以形成一条不断延伸的链:当前问题变成子问题一,子问题一产生中间结果,中间结果引出子问题二,子问题二再产生新的中间结果,最后汇总结论。
这些中间步骤承担着不同的工作。它可以保存临时信息,记住一个计算结果、条件或候选方案;也可以降低单步难度,把一个复杂判断拆成几个较简单的判断;还可以暴露冲突,让前后条件不一致的地方更容易被发现。
有些中间步骤是为工具准备入口。模型先决定要算什么,再调用计算器、代码或检索工具;某条路线失败后,还能回到较早的步骤,换一种方案重新尝试。
多步推理的价值,不只是让答案变长,而是为问题提供可以持续更新和检查的中间状态。
一段可以被读出来的中间推理文字
"思维链"通常指模型在给出最终答案之前,生成的一系列中间推理步骤:已知条件是什么,应使用什么规则,先计算哪一项,得到什么中间结果,最后得出什么结论。
2022年的一项研究让模型在给出答案前先写出推理步骤,结果发现,这种分步提示能明显改善大语言模型在复杂算术、常识和符号推理任务上的表现[1]。
但这里必须划清三个边界。
思维链不等于所有内部计算。模型内部还有大量数值表示、注意力关系和参数计算,并不会全部转换成可读文字。
不是所有模型都向用户展示完整思维链。用户看到的可能是简要解释、推理摘要、整理过的步骤或结果依据,而不是原始推理轨迹。
步骤合理也不代表答案正确。思维链中完全可能出现错误前提、计算错误、逻辑跳跃、遗漏条件,甚至为错误答案补充的事后解释。
思维链是一种中间推理表达形式,而不是一扇能够完整看见模型内部计算的透明窗口。
它给模型增加的,不只是更多文字
分步骤推理为什么有时更有效?可能的机制有几种。
把复杂任务拆开。一次完成十个判断很难,逐项完成通常容易一些。
延长可用于解决问题的计算过程。模型不必立即给出结论,可以先形成并利用中间结果。
减少隐藏的逻辑跳跃。关键条件和推导关系被显式写出来,少了一些"想当然"。
支持多路径比较。先尝试方案A和方案B,再比较两者的结果。
为检查提供结构。人和工具可以逐步核对事实、公式、条件和计算结果。
也更容易连接外部工具。当某一步是"计算金额"或"查找法规"时,可以交给更合适的工具执行。
边界同样要保留:思维链提示并非对所有任务都必然有效,自动生成的推理步骤本身也可能包含错误[2]。
分步骤推理的价值在于组织计算、保留中间状态和创造检查节点,而不是因为步骤越多就一定越聪明。
看起来合理的解释,可能并不完全忠实
这是全文最重要的认知边界。
人们很容易这样想:AI先按照这些步骤思考,然后才得到答案。实际情况要复杂得多。
有研究发现,模型生成的思维链有时会受到输入中偏置因素的影响,却不在解释里提及这些影响;模型还可能为一个已经受到偏置影响的答案,生成一段看似合理的事后说明[3]。另一项研究通过删除、改写或加入错误步骤来观察答案变化,发现模型在不同任务中对思维链的依赖程度差别很大,有时高度依赖,有时可能主要忽略已有的推理文字[4]。
也就是说,一段可见的推理,可能是三种情况之一。它可能是较忠实的中间过程,推理步骤确实参与了答案形成;可能是完整度有限的过程说明,只展示了部分关键步骤,省略了大量内部计算;也可能是事后合理化,模型先受到其他因素影响形成了答案,再生成一段能够支持这个答案的解释。
模型的推理说明可以帮助检查答案,但不能默认被视为内部决策过程的完整录像。
内部计算、推理表达和可验证过程
把"AI的思考"分成三个层次,很多争论会清晰起来。
最底下的一层是内部计算,包括参数计算、注意力关系、隐藏状态、Token概率变化,以及多步生成中的状态更新。这些是真正发生在模型内部的数值计算,但大部分无法直接被人类阅读。
中间一层是推理表达,包括模型输出的分析步骤、原因解释、方案比较、自我检查和推理摘要。这些内容可以帮助用户理解答案,但不保证与全部内部计算完全对应。
最上面一层是可验证的问题解决过程,包括明确输入、分解任务、引用证据、执行代码、查询数据、检查中间结果,并由工具或人工复核。这一层不要求我们"读懂模型的内心",而是要求每个关键环节都能被检查。
对实际任务而言,最可靠的不是得到最长的"思考过程",而是建立可验证的问题解决过程。
它不只是列步骤,也能改变解决问题的方式
把AI表现出的推理能力分成六类。
任务分解。把复杂目标拆成若干子任务。
规则应用。根据给定条件进行逻辑判断、分类和推导。
多方案比较。分析各方案的优点、限制和适用条件。
规划与排序。决定先做什么、后做什么,以及步骤之间的依赖关系。
检查与修订。发现明显冲突后重算、改写或更换路线。
工具协调。决定何时搜索、计算、执行代码或读取文件。
这些能力是真实存在的。但完成这些任务,并不自动说明模型始终使用正确规则,能准确判断自己是否出错,拥有长期稳定的目标,或者具有主观的思维体验。
从功能角度看,AI能够执行多种真实的推理操作;从意识角度看,这些操作仍不能直接证明人类式思考。
错误也会沿着步骤一步一步展开
推理步骤完整,不等于过程正确。错误有自己的展开方式。
起点理解错误,模型误解问题目标或采用错误前提,后面的步骤全部跟着偏。遗漏关键条件,推理看似完整,却没有使用某个重要限制。中间计算错误,某个数字、变量或逻辑判断发生偏差。错误逐步放大,前面的错误中间结果进入后续上下文,后面的步骤继续保持"连贯"。
选择了错误的解题路线,每一步局部上合理,整体方法却不适用。自我检查流于形式,模型可能写出"让我们检查一下",随后只是重复原来的结论,并没有真正用独立方法验证。为结论补充理由,答案先受到提示偏置或错误模式影响,解释随后才形成。
步骤越完整,可能越容易检查;但如果没有检查,完整步骤也可能只是更长的一条错误路径。
更多计算是一种资源,不是正确保证
思考得越久,答案就越好吗?
更多中间步骤可能带来好处:尝试更多方案,处理更多条件,修正明显错误,使用工具验证,对复杂问题进行更充分的分析。
也可能带来代价:重复相同的思路,在错误假设上越走越远,引入新的无关内容,把简单任务过度复杂化,增加响应时间和使用成本,甚至用更长的文字掩盖证据不足。
所以,不应把"思考时间"简单理解为越长越聪明。更准确的说法是:复杂任务可能需要更多计算,但这些计算是否有效,仍要看过程是否使用了正确的条件、证据和工具。
更多推理步骤可以增加解决问题的机会,也可以增加制造新错误的机会。
把一部分"想",变成可以执行和检查的动作
纯语言推理有一个天然限制:所有步骤都停留在文字里。
工具可以让部分步骤产生外部结果。计算工具负责精确计算、方程求解、数据统计和单位换算;代码执行负责处理大量数据、重复运算、测试算法和验证结果;搜索与知识库负责查找事实、获取最新信息、定位原始来源和补充专业材料;外部系统负责查询真实业务状态、创建日程、发送消息和执行工作流程。
把自然语言步骤与可执行程序结合起来,也是提高推理忠实性的一条研究路线:能运行、能查证的步骤,比纯文字更容易验证[5]。
工具同样有边界。输入参数可能错误,数据范围可能选错,来源质量可能不足,执行可能失败,模型还可能错误解读工具返回的结果。
工具不会让模型自动变得正确,但能把部分推理步骤变成可执行、可留痕和可复核的过程。
不要求它展示"全部想法",而要建立检查点
对普通用户来说,与其逼着AI展示"全部思考过程",不如给任务建立几个检查点。
先让模型复述任务,确认目标、条件、口径和限制。要求它分解问题,先列子任务,再逐项完成。要求它区分事实、假设和推断,输出时建议采用这样的结构:已知事实、当前假设、推理结果、待验证事项。
要求展示关键步骤,而不是无限长的思考文字,重点说明用了什么条件、采用什么方法、得到什么中间结果、哪一步需要外部验证。对计算和事实使用工具,不要只让语言模型凭文字完成精确计算和事实查证。用独立方法复核,重新计算、反向验证、换一个公式、检查边界条件、对照原始来源。
先做小样,复杂任务先处理一小部分,确认方法后再扩大。最后根据风险设置人工审核,涉及财务、法律、医疗、科研和重要经营决策时,保留专业复核节点。
可靠推理的重点不是让AI写出最长的思维链,而是让关键条件、方法、中间结果和证据能够被检查。
关于AI思考,最容易出现的九个误解
AI列出了步骤,就证明它像人一样思考?不能这样推断。步骤是推理表达,不等于主观体验。
思维链就是模型内部过程的完整记录?不准确。内部计算远比可见文字复杂。
思维链都是事后编出来的?也过于绝对。在某些任务中,中间步骤确实会影响答案形成,忠实程度因任务和模型而异[4]。
步骤越长,答案越可靠?不一定。错误也可以被写成很长的推导。
没有展示步骤,就说明模型没有推理?不一定。产品可能只展示结果或推理摘要。
AI能自我检查,就能知道自己什么时候出错?不一定。它可能遗漏错误,或者重复原有判断。
让AI"认真思考"就能保证正确?提示可以改变输出方式,但不能替代数据、工具和验证。
推理模型不再预测Token?不准确。多步推理仍然通过模型计算与序列生成完成。
会推理就证明有意识?推理表现与主观意识是两个不同问题。
面对AI的推理结果,可以问六个问题
延续"墨识"的判断框架。
它是否正确理解了问题?错误起点会让后面的步骤全部偏离。
它使用了哪些已知条件?检查是否遗漏了重要限制,或添加了不存在的条件。
中间结果能否独立验证?数字、法规、数据和引用,应由工具或原始来源核对。
解释是否真的支持最终答案?不要只看解释是否流畅,要检查结论能否从前面的步骤中成立。
它是否尝试过另一种方法?独立的路线,比简单重复原答案更有核验价值。
错误的代价有多高?风险越高,越不能把模型的思维链当作最终证明。
不要把一段流畅的推理文字当成正确性的证书。要检查条件、步骤、工具与结论能否相互支持。
它可以推理,但我们不必把它想象成另一个人
大语言模型已经能够分解复杂问题,保留中间结果,应用规则,比较方案,修正部分错误,调用工具,完成多步任务。这些能力是真实存在的,也具有重要的应用价值。
但它展示的一段"思考过程",不一定等于完整的内部计算,不一定等于唯一的真实原因,不一定等于忠实的决策记录,更不等于有意识的主观体验。
因此,最稳妥的结论不是"AI只是机械输出,完全不会推理",也不是"AI已经像人一样在头脑中思考",而是:AI能够通过不同于人类的计算机制执行多步推理;我们可以评价它的推理能力,却不能仅凭推理文字推断它拥有人类式的内在思维。
真正值得信任的,不是AI说自己想了多久,而是它能否把问题、依据、关键步骤和验证结果清楚地连接起来。
夜雨聆风