夜雨聆风学习资料网

ARTICLE · 1069294

AI觉醒30天|Day 43:ReAct——让AI在推理中行动,在行动中推理

AI觉醒30天|Day 43:ReAct——让AI在推理中行动,在行动中推理

一个尴尬的场景

你让AI帮你规划一次旅行。AI秒回:建议你3月去日本,机票便宜,天气好。你问:那东京住哪里方便?AI又秒回:推荐住在新宿,交通便利,购物方便。你继续追问:新宿有没有适合家庭入住的酒店,预算500以内?AI这次卡住了——因为它根本没有查过酒店信息,它只是在"生成"看起来合理的回答。这不是AI不努力,而是它被困在了一个"只输出文本"的世界里。今天介绍ReAct,让AI能够推理、行动、再推理、再行动,像人一样在交互中不断接近正确答案。

先理解"推理"和"行动"的割裂

我们之前学过思维链(CoT):让AI把推理过程说出来,答案更准确。但思维链有一个局限——它只推理,不行动。AI可以分析一个问题,可以计算,可以推理出答案——但它不能:查航班价格、搜索论文结论、计算代码执行结果、获取天气情况。这就是"推理"和"行动"的割裂。ReAct要做的,就是把这两个能力接起来:Reasoning + Acting = ReAct。让AI在推理的过程中,主动调用工具去获取信息,然后基于新信息继续推理,再决定下一步行动——循环往复,直到得出最终答案。

ReAct是怎么工作的

一个典型的ReAct循环:第1步推理(Think)——用户问了一个需要信息的问题,AI先思考:我现在知道什么?需要查什么?第2步行动(Act)——AI调用工具(比如搜索工具),获取需要的信息。第3步观察(Observe)——把工具返回的结果,加入到AI的已知信息里。第4步再推理(Reason)——基于新信息,继续思考下一步怎么办。第5步循环——直到AI判断答案已经足够可靠,给出最终回答。关键点:AI不只是生成文本,它在生成"下一步行动"的指令。

先看一个对比

不用ReAct(直接回答):问2024年诺贝尔物理学奖得主是谁?答:是John Hopfield和Geoffrey Hinton。虽然这次AI答对了,但它有没有"查过"?没有。它只是根据训练数据"生成"了一个答案。用ReAct:AI推理这个问题需要查证最新信息,调用搜索工具查询2024年诺贝尔物理学奖,搜索结果显示授予了John Hopfield和Geoffrey Hinton。AI再推理信息已获取,可以给出准确答案了。你一眼就能看出——AI是经过验证的,不是胡编的。

ReAct的核心结构

一个完整的ReAct提示,包含三个部分:第一部分任务说明:你是一个ReAct Agent。对于每个问题,你需要按照格式逐步思考和行动——Thought分析当前问题、Action执行工具调用、Observation记录结果、Final在收集足够信息后给出完整答案。第二部分可用工具说明:search搜索互联网、calculate执行数学计算、code执行Python代码、browse访问指定URL。第三部分示例演示:展示一个信息查询案例和一个计算执行案例的完整Thought-Action-Observation-Final流程。

什么情况下ReAct最有用

最适合ReAct的场景:第一,需要实时信息的任务——查股价、天气、新闻,查产品最新价格,确认法规最新更新。第二,需要精确计算的任务——大数运算、财务建模、数据分析、代码执行结果验证。第三,需要多步骤研究的任务——论文综述、市场调研、旅行规划。第四,需要工具调用才能完成的任务——发邮件、写文件、调API、操作数据库。

ReAct实操模板

模板一信息查询型:设定ReAct Agent角色,定义Thought-Act-Observe-Final格式,然后输入用户问题让AI分步处理。模板二多步研究型:设定ReAct研究助手角色,明确可用工具(search、browse、calculate),分四步执行——搜索背景、筛选来源、深入阅读、整合结论,每步输出Thought-Action-Obvervation-Final Report。模板三任务执行型:设定任务目标与约束条件,分解任务为子步骤,对每个子步骤执行Thought-Action-Observe循环,最终输出交付物。

ReAct + 思维链:双剑合璧

ReAct和思维链天然互补:思维链只推理不行动,ReAct是推理加行动加观察加再推理。两者结合的提示模板:先让用户描述问题,第一阶段用思维链分析问题结构和所需信息,第二阶段用ReAct格式逐步执行工具调用获取验证信息,最后整合所有验证后的完整答案。

一个真实案例

帮用户分析是否应该买入某只股票。不用ReAct:AI根据训练数据给出泛泛分析,可能不包含最新信息。用ReAct:先搜索当前股价,再搜索最新财报,再搜索分析师评级,整合三个维度的信息后给出综合分析——包括估值判断、风险提示、投资建议。这比AI闭着眼睛分析,可靠多了。

ReAct的三个关键原则

原则一工具要选对:ReAct效果取决于工具质量,搜索返回垃圾信息再好的ReAct也救不了。优先选择实时数据工具、官方数据源、有结构的数据。原则二循环要有退出条件:ReAct容易陷入无限循环,设置明确退出条件——收集到X条关键信息后停止搜索,或最多执行N个步骤。原则三观察结果要利用:很多AI在ReAct循环中工具返回了重要信息但下一步推理时忘了用,好的ReAct Agent会把关键观察结果显式记录作为下一步推理的输入。

今天给你的作业

基础练习:选一个你之前问AI答不上来或答得明显不对的问题,用ReAct格式重新问一遍,让AI分步搜索验证信息,看信息充分后答案有什么不同。进阶练习:用ReAct帮自己完成一个实际任务——规划周末出行、对比两款产品、或做简单的投资分析,记录每个Thought-Act-Observe步骤,看它如何一步步接近最终答案。Bonus:把ReAct变成你的AI研究标准流程,遇到需要查证的重要问题不直接要答案,而是让AI一步步来——你告诉它工具,它替你跑腿,信息更可靠。

Day 43,小结

今天聊的是ReAct(Reasoning + Acting)——让AI在推理中行动,在行动中推理。核心思想:AI不只是生成文本,而是在推理过程中主动调用工具去获取信息,再基于新信息继续推理,直到得出可靠答案。ReAct解决的是AI信息不足却硬撑着回答的问题。三个关键原则:工具要选对、循环要有退出条件、观察结果要利用。ReAct和思维链是互补关系——思维链让推理过程显性化,ReAct让推理过程加外部交互,两者结合就是让AI不只动脑还动手。信息时代,让AI去查比让AI去猜可靠一万倍。

「AI觉醒30天」—— Day 43。系列继续,旅程不停。

相关学习资料