你让一个 coding agent 修 bug。它的计划是:读代码、跑测试、查日志、改文件、再跑测试——一共要调 30 次工具。
第 3 步,它本该先跑一遍测试、看失败的输出到底在哪一行。它跳过了,直接去改配置文件。不是致命错误,只是方向偏了一点。
但后面 27 步,全在错误的方向上打转。最后它交上来一份"修好"的代码——测试还是红的。
我第一次盯 agent 的长任务日志,满眼都是"一步错、步步错"。心里只有一个念头:它怎么就不能回头看看自己走过的路?
后来才明白,这不是 agent 笨,是序列决策的宿命:每一步都影响后面,而你永远不知道当前这一步是不是最优的。
这是「强化学习原理」系列的第一篇。之前我们在PPO、GRPO、RLVR 几篇里见过强化学习算法的样子,但没见过它们的地基。
这个系列把地基补上:随机过程、Bellman 方程、多维高斯、Actor-Critic 打底。TRPO、PPO、GAE、GRPO 的完整数学盖楼。总共十篇,从地基讲到屋顶。
今天先立第一块砖:为什么 AI 做决策不能只看眼前。
一、为什么不能只看眼前
先分清两种决策。
单步决策:中午吃什么。选了就完了,不影响明天。
序列决策:修 bug、下棋、写代码、开车。每一步的选择,都会改变你下一步面对的处
推理模型的思维链是最直观的例子。你问它一道数学题,它先写"等等,我要重新读题",再写"设未知数为 x",一路想 5000 个字才给出答案。这 5000 个字里,任何一个中间的推理错误,都可能把最终答案带沟里。
所以序列决策的难点在于:你不能只优化眼前这一步。眼前最优的一步,可能是全局最差的一步。
那怎么办?数学家的回答是:给"序列决策"造一套语言。

二、随机过程:世界是随机的
这套语言的第一块,是随机过程。
先说"随机"为什么躲不掉。机器人决定迈一步往前走,动作发出去了,结果可能因为气流,留在原地,甚至倒退一步。围棋里你落一子,对手怎么应,你控制不了。agent 调工具,工具返回什么结果,不是它能完全预料的。
每一步的结果都不确定,这就是随机过程要描述的:一个状态序列,随时间演化,而每一步的走向带着概率。
用记号说,就是一串状态 ,每个 是时刻 智能体所处的状态(棋局、代码库、机器人坐标)。
我们人类学东西也是这个套路。婴儿学说话,先蹦单字,错了被纠正,再试,慢慢地组词、造句。每一次尝试都是一次"状态转移"——从"说错了"到"被纠正"到"说对了"。试错,就是随机过程里走出来的。
三、马尔可夫性质:健忘
现在到了这套语言最关键的一个词:马尔可夫。
我承认,我第一次看到"马尔可夫过程"这个术语时,以为是什么高深的数学发明。后来发现,它的核心就两个字——健忘。
马尔可夫性质说的是:下一步的状态,只依赖当前状态,和更早的历史无关。
左边是"只看当前状态,下一步去哪的概率"。右边是"看完整个历史,下一步去哪的概率"。马尔可夫性质说:这两个相等。历史里该记的,都已经记在当前状态里了。
这个性质用状态转移矩阵表示更直观。矩阵的每一行是一个状态,每个格子是从这个状态转移到另一个状态的概率。因为是概率,每一行加起来必须等于 1——从任何状态出发,下一步总要去某个地方。
举个具体的例子。把修 bug 的过程简化成三个状态:A = 刚读完代码,B = 正在改,C = 测试通过。
从 A 出发,下一步 70% 概率去 B,30% 概率回到 A(没读懂,还得再看一遍);从 B 出发,60% 去 C,40% 留在 B(改完还得改)。写成矩阵:
每一行加起来都是 1:第一行 0.3+0.7,第二行 0.6+0.4,第三行 1.0。这就是随机矩阵——从任何状态出发,下一步总要去某个地方。
我在这里卡过一阵:真实世界哪来这么干净的"健忘"?下棋时对手的棋风、修 bug 时代码的演进历史,都影响下一步啊。
答案是:马尔可夫性质不是世界的真相,是工程抽象。做法是,把"影响下一步的所有相关信息"都塞进状态里。棋风塞不进去?那就把状态定义成"最近 N 步的棋局"。这就是高阶马尔可夫——状态里装下足够长的历史,让"健忘"不再丢信息。

这套抽象的好处是巨大的:数学上只需要处理当前状态,动态规划、收敛证明才有了立足点。你付出的代价是状态空间变大,但那是下一篇 Bellman 方程要操心的事。
四、反常识:大模型算不算马尔可夫?
现在问你一个问题:大模型生成文本,是不是一个马尔可夫过程?
模型每生成一个 token,只依赖当前上下文——就是它窗口里装的那些 token。窗口外的历史?它完全"健忘"。
所以答案是:大模型是一种"上下文窗口内的高阶马尔可夫过程"。窗口内的历史,全塞在状态里(高阶);窗口外的历史,一概不记(健忘)。
这个思路其实不新鲜。N-gram 语言模型就是显式的高阶马尔可夫——状态是最近 N−1 个词,转移概率是从语料里数出来的统计表。
大模型是同一个思路的升级:状态不再是一串词,而是神经网络压出来的隐表示,窗口从几十个词扩到 128K。
一个 128K 上下文的模型,相当于一个 128K 阶的马尔可夫过程——而经典语言模型研究里,5 阶就算很高了。骨架没变,变的只是"状态"的记法。
这个视角能解释一个困扰很多人的现象:agent 长任务为什么容易崩。
KV 缓存落盘那篇 里我们算过一笔账:SWE-Marathon 任务动辄上千步,8K 上下文的模型 5 步就"失忆"了。
现在你明白了——不是模型笨,是它的"状态"里装不下那么长的历史。马尔可夫性质要求"该记的都记在状态里",状态装不下,健忘就从优点变成了缺陷。

健忘让大模型高效:不用重新读一遍全部历史。健忘也让大模型脆弱:历史一长,该记的记不住。同一个性质,两面。
五、MDP:给随机过程加上决策
随机过程描述了"世界怎么变",但还没回答"智能体怎么选"。
马尔可夫决策过程(MDP)补上这一块。它用五个要素描述一个决策问题:
• :状态集合 • :动作集合 • :状态转移概率 ——在状态 做了动作 ,转移到 的概率 • :奖励函数——做了动作后,环境给的反馈 • :折扣因子——下一篇的主角之一,先认识一下
智能体怎么选动作?靠策略 :给定状态 ,选动作 的概率。策略可以是确定性的( 到了就选固定的 ),也可以是随机的——随机性不是缺点,探索需要它。
奖励是环境给的反馈,可正可负。AlphaGo 下围棋,中间每一步都没有奖励,只有终局才有:赢了 +1,输了 -1,平局 0。agent 修 bug 也是:中间调工具没有奖励,测试全绿才有 +1。
从开始到终止,智能体走过的一串状态叫轨迹(trajectory)。修 bug 的 agent,轨迹就是它调过的 30 次工具、看过的每一份日志。
请在微信客户端打开
现在回头看开头那个场景:agent 修 bug,就是一个 MDP。状态 是代码库加测试日志,动作 是"调哪个工具"——读文件、跑测试、grep 日志、改代码。
转移概率 是工具返回什么结果,奖励 是测试全绿 +1。 取 0.99——让 30 步之外的奖励还能传回来。
它的轨迹长这样: 读完代码, 跑测试(红), grep 日志, 改了一行。一路走到 ,测试全绿。
每一步的循环只有四拍:带着当前状态,选一个动作,等一个结果,收一个奖励。
剩下的问题是:奖励只有最后才有,中间怎么知道哪一步走对了? 这就是折扣回报要解决的。
六、回报与折扣:长远账的数学
智能体的目标不是最大化眼前这一步的奖励,而是最大化整条轨迹的回报(Return)。
是第 步的奖励, 是折扣因子()。离现在越远的奖励,乘的 次方越多,折得越狠。
算一笔具体的。假设一条轨迹只有 3 步,奖励分别是 0、0、+1(最后一步测试通过),。站在起点往回看:
前两步的即时奖励都是 0,但回报不是 0——最后那个 +1,有 0.81 记在第 0 步的账上。这就是"长远账":把终局的功劳,按距离折算回每一步。
直觉就是"今天的钱比明天值钱":未来的奖励要打折,因为未来充满不确定性——你连策略都还没定,凭什么给遥远的奖励满额权重?
是个很妙的旋钮:调小,智能体只顾眼前;调大,智能体愿意为远期目标忍耐。RL 里没有万能值,0.9、0.99 都有人用,取决于任务——这是工程判断,不是数学结论。
那为什么一定要 ?数学上有个硬理由:不收敛。
假设每步奖励绝对值不超过某个上界 ,那么回报的绝对值:
最后一步是几何级数求和。 时它是有限值。 时就发散。无限长的轨迹,奖励无限加下去,回报变成无穷大——什么算法都没法比大小了。
我第一次在 Sutton & Barto 的书里翻到这个证明时,觉得数学家有点小题大做——一个收敛条件而已。
后来才品出味道: 不只是"打折",它是把无限长的未来压缩成一个有限数的那只手。没有它,强化学习连"目标函数"都写不出来。

你可以自己算一笔账: 时,未来所有奖励折算到今天的上限是 倍; 时是 100 倍。
0.9 和 0.99 看着差不多,耐心差了 10 倍。这就是为什么"调 "在 RL 里是个正经事。
结尾
回到开头那个 agent。
用 MDP 的语言,它的故事是这样:状态是代码库加测试日志,动作是调哪个工具,转移是工具返回什么,奖励是测试全绿加一分。
回报呢?它能不能把 30 步之后的 +1,折算到今天每一步的决策里。
第 3 步选错工具不可怕,可怕的是它的回报函数没有把"后面 27 步"折算到第 3 步的决策里。这就是强化学习要解决的:让每一步都知道自己在为终局打工。
下一篇讲怎么算这笔账——Bellman 方程。价值函数怎么递归,为什么 Q-learning、PPO、GRPO 这些算法,本质都在解同一个方程。
一个问题留给你:你遇到过 AI"只看眼前"的翻车现场吗?比如让模型写代码,它选了眼前最省事、后面全崩的方案。评论区聊聊你的经历。
🔥 近期热门:
觉得这篇把地基讲清楚了,点个赞 👍、收藏 ⭐ 备用。
关注「数解AI」,强化学习原理系列十篇,从 Bellman 到 GRPO 一路拆解完。关注后回复「强化学习」,我把系列合集链接发你。
夜雨聆风