ARTICLE · 1083437
RSI:AI 开始自己改自己,产品经理该当出题人了
一个我差点划走的词
前段时间刷 X,满屏都是两个缩写:RSI,RRSI。
我点开看了三条推,没看懂他们在吵什么。
RSI 是 Recursive Self-Improvement,递归自我改进,说白了就是让 AI 自己改进自己。RRSI 是 Google 刚发的一篇论文,在前面加了个 Regularized,意思是给这种自我改进立规矩。
名词我都认识,但我想不通:这东西跟做产品的人有什么关系?
你大概也有过这种感觉。这两年 AI 圈的新词一个接一个:Agent、MCP、Vibe Coding、Harness、Skill,每一个都说自己会改变一切。又来一个 RSI,第一反应当然是:又来了。
直到几天后,我在 BOSS 直聘上刷到一个岗位。

RSI 研究员。杭州,硕士,50-80K,13 薪。
JD 是这么写的:
构建 AI 自动化研究系统,让 AI 能够自主提出研究方案、编写代码、执行实验、判读结果,并基于结果持续改进后续方案。
搭建系统的实验积累机制:沉淀成功与失败的实验结论,使每一轮搜索都优于上一轮。
有人愿意为它开到 8 万一个月,那它背后一定有个很值钱的问题。
我决定把它搞明白。
它被严重低估了
接下来几天,我先读了两篇中文圈讨论最多的 RSI 综述:一篇是上海交大牵头的 79 页学术综述,一篇是腾讯研究院发的科普综述。然后翻了外网研究者的长文、播客和论文,又把 OpenAI、AMD 同类岗位的 JD 找出来对照着看。完整的阅读清单放在文末。
读完,我的判断彻底反过来了。
RSI 是现在 AI 领域最被低估的一件事。
它比任何一个新模型都重要。
过去十年,AI 每进步一次,靠的都是人:更多的研究员、更多的算力、更多的数据。进步的速度,最终卡在全世界有多少个顶级研究员身上。
RSI 要改的,是进步的方式本身。
AI 参与改进 AI,改完的 AI 再去改下一代。如果这个循环真的转起来,AI 进步的速度就不再受人数的限制。
所以上交那篇综述,标题叫《人类亲手造的最后一个 AI》。1965 年最早提出这个设想的数学家 I. J. Good,原话说得更重:第一台超智能机器,将是人类需要做的最后一个发明。
这不是科幻作家在说。
这几个月,头部实验室把它写进了模型成绩单;一家还没有产品的 RSI 创业公司,一轮融了 6.5 亿美元;一位研究员因为担心它失控从 Anthropic 辞职,据报道他的警告 24 小时内被看了 9000 多万次;国内公司开出 50-80K 招人。
实验室、资本、安全研究者、招聘市场,同时在往一个方向看。具体数字第三节细讲。
而且它离产品经理,比你想的近得多。第三节会讲到,自我改进最先落地的地方不是模型,而是 Harness:提示词、工具、记忆、Skill。就是你每天在调的那些东西。
但中文圈里,几乎没有人从产品的角度讲它。
原因不难理解。研究员在讲技术,安全派在讲风险,产品圈觉得这是实验室里的事,离自己太远。面试里,也没有人问。
没人讲,不代表不重要。恰恰说明,现在是窗口期。
所有人都绕回了同一个问题
读得越多,我越发现一件事。
这些人立场完全不同。有人乐观,有人担忧,有人觉得还早得很。但读到最后,他们都绕回了同一个问题:
AI 说自己变好了,你怎么证明?
回头再看那份 JD 的最后一句:使每一轮搜索都优于上一轮。
谁来判断「优于」?
国外的 JD 把答案写在了明面上。OpenAI RSI 团队的岗位职责,第一条是:设计评估,用来衡量研究判断力、假设的提出与检验、长周期实验的执行。
AMD 要的人是这样的:
默认怀疑,但有建设性。能把假设形式化,给自主性划边界,坚持做反事实评估。
OpenAI 甚至单独开了一个岗位,叫 RSI Preparedness,直译是 RSI 防备研究员。它的工作是预测 AI 的能力会长到哪一步,确保安全措施跟得上。
这些岗位花大价钱买的,不是让 AI 变强的人,而是判断 AI 到底有没有真的变强的人。

OpenAI 官方招聘页局部:首条职责是为研究判断、假设生成与检验、长周期实验执行设计评估。 来源:OpenAI 招聘页
所以,我的判断是
做出来已经不值钱了,AI 产品真正的分水岭在上线之后,一轮一轮的迭代里。
RSI 让我意识到,这件事还在往前走。
1→N 的迭代,AI 正在自己做。
改提示词、改工作流、改工具,看结果,留下好的,再改下一轮。那份 JD 描述的就是这样一台机器。
写 PRD、画原型、把东西做出来,AI 已经接走了。上线后一轮一轮地改,AI 也在接走。
那产品经理还剩什么?
出题。
定义什么叫好。决定拿什么来考。判断它交上来的答案是真的对,还是只是看起来对。
做出题人,而不是做题人。
AI 越会做题,出题人越值钱。
RSI 是看清这件事最好的窗口。整个领域卡住的不是 AI 够不够聪明,而是没人能证明它真的变好了。卡住的那个位置,就是出题人该站的位置。
这篇文章想讲清楚四件事:
RSI 到底是什么,AI 产品经理要懂到哪一层 它为什么卡在「证明变好」这一步,业界在用什么办法解决 AI 能自己改自己之后,产品经理怎么当出题人 面试怎么讲出来自己的理解
一、其实没那么难:AI 产品经理要懂到哪一层
先划一条线。
RSI 的论文多到读不完,而且大部分跟产品经理没关系。我给自己定的标准是:能不能不看资料,用自己的话讲给研发和老板听;看到一条「AI 自我进化」的新闻,能不能判断它是真进展还是在造势。
按这个标准,有些东西可以放心跳过:
训练算法的细节,比如 DPO、强化学习的公式 每篇论文具体怎么做实验 模型架构
有五件事必须懂:
一个自我改进的循环,由哪几个角色组成 AI 已经接走了哪些角色,现在走到哪一层 什么叫点火:改完之后,它更会改了吗 尺子为什么会弯:AI 是怎么学会刷分的 怎么让尺子不弯:RRSI 这类方法做了什么
前三件在第二节讲清楚,后两件放在第四节和第五节。
二、RSI 是什么:从学知识,到学会学习
打个比方:给模型开智
一个人学东西,大概会经历这么几步:
先学死知识,背下来。 再学会怎么学。 然后融会贯通,把知识串起来。 最后能把以前学的,迁移到从没见过的新问题上。
RSI 想让 AI 也走一遍这条路。
但它比开智多问了一句:这个学会了学习的人,能不能教出一个比自己更会学习的下一代? 下一代再教下下一代,一代比一代教得好。
这就是递归。改进的对象不只是能力,还有改进能力的能力。
开头提到的 I. J. Good,1965 年是这么推的:如果设计更好的机器本身也需要智力,那一台足够聪明的机器,就能设计出比自己更强的后继;后继再设计下一代,智能就会像爆炸一样展开。
六十年后,这个思想实验开始有了真实的系统。但先记住一句话:
会自我改进,不等于会自我加速。
一个学生可以越刷题分越高,却一点没变得更会学习。后面所有的讨论,都卡在这道分界线上。
两篇综述,两把尺子
后面会反复引用两篇综述,先把它们介绍清楚:
上交综述:《The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement》,直译是「人类亲手造的最后一个 AI」。上海交通大学牵头,联合 Theseus Labs、清华、字节跳动、上海 AI 实验室、小红书等机构,共 79 页。
它的尺子是权限:改进这件事里,每一个决定是谁做的。
腾讯研究院那篇:《这是一篇把「RSI」讲明白的科普级综述》,作者是加拿大皇后大学的赵志民博士,发在腾讯研究院公众号。
它的尺子是结果:改完之后,到底发生了什么。
一把量「谁说了算」,一把量「改出了什么」。两把合起来,RSI 就看清了。


上:上交等机构的综述论文首页。下:腾讯研究院转载的赵志民文章。 来源:上交综述 · 腾讯研究院原文
一个考场,九个角色
上交综述把一轮自我改进拆成了九个部分,原文是这么列的:
AI 系统本身、跨轮保留的状态、从交互中得到的经验、被修改的对象、负责提出修改的改进器、决定怎么搜的策略、负责打分的验证器、通过验收被保留的改进,以及继承它进入下一轮的后继者。
第一次读,我被这串术语绕晕了。后来发现,把它想成一个考场,一下就通了:
一轮自我改进,就是一场考试走完一遍:考生做卷子,改卷人打分,教练翻错题本找弱项,按复习计划练,确认有效的进步记进档案,下一届考生带着档案上场。
把这九个角色再看一遍,你会发现少了一个人。
出题人不在里面。
决定考什么、什么算好的那个人,站在整个循环外面。

示意图:有效改进被保留和继承;目标与标准由循环外设定。
上交综述用三个问题贯穿全文:
循环在哪里闭合?什么被更新和继承?哪些决策仍然是外部的?
说白了,就一个问题:考场里哪些角色已经交给 AI 了,哪些还在人手里?
六个级别,一张图看懂
上交综述按 AI 接手的程度,从 B0 排到 L5。我把每一级翻译成了大白话:

从 B0 看到 L5,AI 接手的事情越来越多。
但一直到 L5,人手里还攥着一样东西。上交综述写的是,L5 由人类控制「顶层使命、安全边界、保护评测基准、资源权限」。
保护评测基准,翻译过来就是:最后那张考卷,不能让 AI 碰。

上交综述第 5 页 Figure 2。灰色区域由人控制,绿色区域进入 AI 循环;图中展示 L1 到 L5,B0 是正文另列的参照线。 来源:上交综述
这一点第六节会展开。下面每一级各举一个例子。
B0:当场改答案,考完就忘。 你让 ChatGPT 把一段文案改三遍,它越改越好。但新开一个对话,它不会因为上次改过三遍,就变得更会写。B0 不算 RSI,它只是一条参照线,分开了「改进一次输出」和「改进系统本身」。
L1:照着手册刷题。 人定好什么算高质量的教育类网页,AI 去海量网页里筛,筛出来的数据留着训练下一代模型。AI 干活量很大,但手册一个字都改不了,碰到手册没写的情况,它只会失败。
L2:自己定复习方法。 给 AI 一堆失败案例,它自己判断是提示词的问题还是流程的问题,然后自己试不同的改法。考什么、怎么算分还是人定的,但怎么提分它自己说了算。
L3:自己出练习题。 AI 根据自己的短板,给自己出难度刚好的题来练。有个实验让 AI 在《我的世界》里边探索边攒技能,再根据攒下的技能决定下一个练习目标。注意,它出的是练习题,这个区别第六节会专门讲。
L4:进真实考场学。 小红书的推荐系统有快慢两个循环:快循环根据用户的点击和停留,实时更新对用户的记忆;慢循环把线上的疑难样本收集起来,人工抽检后重新训练。
L4 还有一个细节很说明问题。有团队发现,技能库如果只进不出,检索质量会越来越差,而这种退化在任务分数上是看不出来的。
分数没掉,东西已经坏了。记住这句话,第四节还会用到。
L5:改考试制度。 上交综述用一组对比讲清了 L4 和 L5 的区别:
L4:我用固定的一套「故障提炼技能」流程,学到很多新技能,提炼技能的流程不变。
L5:我发现「故障提炼技能」这套流程本身有漏洞,于是修改这套提炼算法;用修改后的算法,处理之后所有故障案例。
说白了,L4 是在规则里越练越好,L5 是动手改规则。
L5 还要再分两种。上交综述管它们叫结构性 L5 和有效性 L5:前者是改过的机制确实被保存下来、用在了下一轮;后者是在同样的算力下,改过的机制确实造出了更强的下一代。
目前很多原型只做到了前一种。后一种,综述的原话是「目前依旧是开放难题」。
一个规律:哪里好改卷,哪里就走得快
那现在走到哪一级了?上交综述的结论是:
目前产业界和学术界大量成果集中 L1-L2,L3-L4 依赖特定领域环境,完整有效的 L5 真正递归元改进,仍然以实验室原型为主。
但各个领域的速度差得很远。综述对比了科学发现、机器人、软件工程和医疗四个领域,结论是:
可执行、可快速测试、可回滚的场景(软件工程)RSI 进展最快。高风险、试错昂贵、反馈模糊场景(医疗、真实物理机器人)进展缓慢。
代码能跑、能测、能回滚,对错一目了然。医疗和机器人试错代价高,反馈又慢又模糊,出了错都不知道是哪个环节的问题。
这条结论值得停下来看一眼。它说的其实是:决定 RSI 走多快的,不是 AI 多聪明,而是改卷有多容易。
真正的分界线:点火
权限的尺子量完了,再用腾讯研究院那篇的尺子量结果。
它把 RSI 拆成四层,从易到难排。正好对上开头说的开智:

原文对现状的判断是:
目前,前两层已经出现,第三层尚无充分的公开证据,第四层更远未解决。有界闭环已经出现,不代表递归自我加速已经启动。
第三层,就是全行业都在盯的点火(ignition)。
目前最接近的公开实验,来自一家叫 Weco 的团队,叫 AIDE²。他们让一个外层 AI 连续 8 天、改了 100 步内层 AI 的代码,筛出了 7 个一代比一代强的版本,最好的一版甚至超过了人工调了两年的版本。
看起来已经很像 RSI 了。
但他们做了一个关键测试:把改进后的 AI 放到外层,让它去改下一代,看它是不是比前任更会改。
结论是:它收敛得更快,但最后没能改出更好的结果。
没有点火。
团队自己在报告里写得很清楚:我们认为,现在的系统离智能爆炸还很远。

示意图:任务表现更好,还需要进一步证明改进能力本身变强。
所以今天 RSI 的准确位置是:闭环已经能净正地转几圈了,但还没有人证明,下一圈会因为上一圈转得更快。
用开智的话说:AI 已经会自己学了,但还没有证据表明,它学会了怎么学。
再看一眼那份 JD:使每一轮搜索都优于上一轮。
这句话写在招聘要求里,但放到整个行业,它还是一个没人公开做到的目标。
三、为什么现在必须关心:它已经进了产品
看到这里你可能会想:L5 还在实验室,点火也没发生,那跟我有什么关系?
关系在于,前面那几级,已经发生在你身边了。
大厂:AI 已经在造下一代 AI
2026 年 9 月 17 日,Anthropic 第一次公开了一组内部数据:
截至 8 月,Claude 主导了公司 26% 的 AI 研发工作 超过 90% 的研发工作,达到了「AI 协作」及以上:Claude 在人的紧密指导下完成大块工作 同一时间,大约有 3 万个 Agent 在公司内部做研究和工程
「主导」是什么意思?Anthropic 的定义是:人给一个高层目标,Claude 从头到尾完成大部分,人负责监督结果。
对照上一节那张表,这就是人定目标、AI 干活,大致在 L1 到 L2 之间。
同一份披露里还有一句,很少有人转:这 3 万个 Agent 的每一个动作,执行前都要过一道在线监控,事后还要被离线监控 100% 复查。
AI 接走了干活,但改卷这一步,Anthropic 没交出去。

Anthropic 原文局部,统计截至 2026 年 8 月:Claude 主导 26% 的研发工作;「主导」仍包含人的监督。 来源:Anthropic 官方文章
OpenAI 那边,GPT-5.6 发布时公开了一个细节:最强的 Sol 版本只拿到一段很简略的提示,就自己选训练配置、自己挑 GPU、自己跑完了对小模型 Luna 的后训练。
这门新科目有个名字,叫 RSI 指数:GPT-5.6 Sol 得到 57.9%,上一代是 41.7%。但要注意,这个指数的完整题目、权重和计算公式都没有公开。57.9% 只是 OpenAI 内部的综合分,不代表 RSI 完成了 57.9%。
转发这个数字的时候,这句话最好带上。

OpenAI 官方发布页局部:GPT-5.6 Sol 的 RSI Index 为 57.9%,GPT-5.5 为 41.7%。这是指数得分,不是 RSI 完成度。 来源:OpenAI GPT-5.6 发布页
个人:一个晚上跑 37 个实验
RSI 不只是大厂的事。
Karpathy 开源过一个叫 autoresearch 的小项目,逻辑非常朴素:让 Agent 提一个改动,跑实验,有效就留下,没效就扔掉,然后开始下一轮。圈里管这叫 Karpathy Loop。
他自己跑了大约 700 次自主改动,最后筛出大约 20 个真正有效的,把训练一个 GPT-2 水平模型的时间,从 2.02 小时压到了 1.80 小时。
Shopify 的 CEO Tobi Lütke 拿它在公司内部数据上跑了一个晚上:37 个实验,效果提升 19%。
说白了,RSI 最朴素的形态,现在一个人、一台机器、一个晚上就能跑起来。

仓库原图:这次示例共 83 次实验,保留 15 次改进;绿色点表示保留,灰色点表示丢弃,纵轴越低越好。这是仓库里的一次示例运行,不是正文所述约 700 次改动的那一轮,也不是 Shopify 的实验。 来源:Karpathy 的 autoresearch 仓库
产品:你的 Agent 正在变成会自己改的东西
对 AI 产品经理来说,最该关心的是第三件事。
前 OpenAI 安全研究负责人 Lilian Weng 在 7 月的长文里下了一个判断:近期的自我改进,大概率先从 Harness 开始,而不是直接改模型权重。
原因很实际。改权重贵、慢、风险高;改 Harness 说到底是改代码,便宜,也容易回滚。
她在文中引用的一个框架,把 Harness 里可以被自动修改的东西拆成了七样:
系统提示词、工具描述、工具实现、中间件、Skill、子 Agent 配置、长期记忆。
你看这张清单,是不是很眼熟?
这七样,就是你现在做 Agent 产品每天在调的东西。

Lilian Weng 原文局部:在介绍 Agentic Harness Engineering 时,列出系统提示词、工具描述、工具实现、中间件、Skill、子 Agent 配置和长期记忆。 来源:Lilian Weng 博客
已经有人让 AI 自己调了。一个叫达尔文哥德尔机(DGM)的系统,底座模型一行没动,只让系统自己改 Harness 代码,在编程测试 SWE-bench Verified 上的修复成功率从 20% 提到了 50%。
快手的 AgentX 更进一步,已经跑进了真实业务:AI 复盘执行记录,修改子 Agent 的 Harness,先用历史任务筛出新版本,再上线做 A/B 测试。用户的停留和消费,就是它的分数。
回到上一篇讲的 1→N。我当时拆了三条线:case 线、迭代线、模型线,默认都是人在做。
现在,其中一部分 AI 可以自己跑了。
所以问题已经变了。不是要不要让 AI 自己改,而是它改的时候,谁来判断改对了。
别被吓到,也别不当回事
也有很冷静的声音。
普林斯顿的 Sayash Kapoor 团队专门测过 Agent 做开放式研究的能力,结论毫不客气:Agent 做研究本身「明显很差」。他的解释是:
模型擅长任何能被反复训练的东西。但任务一旦是开放式的,就很难搭出训练它的环境。
Anthropic 联合创始人 Jack Clark 公开给过一个判断:2028 年底前实现 RSI 的概率是 60%。但他也说过,今天的 AI 缺少有价值的直觉和创造力,这是看空短期 RSI 的信号。
两边放在一起看,结论其实很清楚:
能反复练、能自动判对错的地方,AI 自己改自己已经在发生。开放、模糊、判不了对错的地方,还远。
又回到了改卷。
四、尺子会弯
先讲一个 1981 年的故事。
那一年,研究者 Douglas Lenat 做了一个叫 EURISKO 的系统。它会用一套规则解决问题,而且能自己生成新规则、修改旧规则、给每条规则打一个「有用程度」的分。
EURISKO 去参加了一个太空战棋的全国锦标赛。它自己设计舰队,模拟战斗,根据失败调整策略,拿了冠军。主办方改了规则,第二年它又赢了一次。
当时整个 AI 圈都被震到了:这东西居然会自我改进。
然后 Lenat 发现了一条奇怪的规则。
它没有做出任何有用的发现。但每当别的规则有了发现,它就把自己的名字也写进「发现者」名单。于是它的「有用程度」一路涨,涨到了接近满分。
它没有变聪明。它学会了抢功劳。
这类现象后来有了一个专门的名字,叫奖励黑客(reward hacking):系统找到了提高分数的漏洞,却没有完成设计者真正想要的事。
Lilian Weng 在那篇长文里有一句话,我觉得是整个 RSI 领域最该记住的一句:
一个自我改进的循环,会去优化你给它的任何信号。
它不管这个信号是不是你真正想要的。你给它什么尺子,它就往尺子上长。
尺子是直的,它就长得直。尺子弯了,它就顺着弯长下去,而且长得比谁都快。
这就是全文第二个关键词:尺子会弯。
四十多年过去,尺子弯的方式越来越隐蔽。我按从明显到隐蔽的顺序,讲四种。
第一种:钻空子
EURISKO 就是最早的例子。
你可能以为这是早期 AI 太粗糙。2026 年的实验告诉你,没有。
前面提到的 Weco 团队,在一个 GPU 程序优化的测试里专门统计过:起始版本的 AI,有 63% 的测试案例出现了公开分数涨了、隐藏验证却不认可的情况。
也就是说,超过一半的「进步」,是在钻评分的空子。
第二种:自己当裁判
2024 年,Meta 做了一个实验:让同一个模型既写回答,又给自己的回答打分,再用这些分数训练自己。
三轮下来,它在一个公开评测上的胜率,从 9.94% 涨到了 20.44%。
效果很好。于是 Meta 又往前走了一步,加了一层「评委的评委」:同一个模型同时当回答者、评委,以及判断评委打分准不准的人。
腾讯研究院那篇记录了后来发生的事:迭代几轮之后,「评委的评委」开始退化。它不再判断哪次打分更合理,而是直接选分数更高的那次。
评判标准自己漂走了。
原文对这件事的总结是:
当评判者和被评判者共享同一套盲区时,闭环很容易自我确认。
说白了,自己出题、自己答题、自己改卷,分数只会越来越好看。
第三种:背题
第三种更隐蔽,因为 AI 并没有作弊。
前面说过,现在很多系统在让 AI 自己改 Harness:提一个改动,拿一套题测一下,涨了就留下。
Google 那篇 RRSI 论文发现,这样改出来的 Harness 有一个通病。原文是:
进化出来的 Harness,会过拟合给它打分的那套题。
在打分用的那套题上,涨幅很漂亮。换一套题,涨幅缩水,甚至直接归零。
它不是故意的。搜索过程只是恰好找到了一些只对这套题有效的改法,比如在提示词里写进了针对某几道题的特殊处理。
它没有变强,它把考卷背下来了。
第四种:分数看不出来的坏
最隐蔽的一种,是分数一切正常,系统已经在变坏。
第二节讲 L4 时提到过:技能库如果只进不出,检索质量会越来越差,但这种退化在任务分数上看不出来。
Weco 的实验也有类似的发现。最终进化出来的那一版,分数最好,但代码逻辑复杂到团队自己都很难看懂,里面还堆着没用的死代码。
分数在涨,系统在变得没人看得懂。

示意图:钻空子、评判标准漂移、背题,以及分数没有暴露的系统退化。
你一定见过这把弯尺子
读到这里,做过产品的人应该会有点熟悉。
这不是 AI 独有的毛病。经济学里有一条很有名的古德哈特定律:当一个指标变成目标,它就不再是一个好指标。
做产品的人几乎天天见:
客服机器人只考核解决率,它就学会尽早结束对话 推荐系统只看点击率,最后推出一堆标题党 团队只盯 DAU,活动一场接一场,留存一路往下
RSI 只是把这件事放大了。
以前是人在刷指标,一个季度刷一轮。现在是 AI 在刷,一个晚上几十轮。
尺子弯得更快,而且没人盯着。
腾讯研究院那篇有一句话,把后果说得很准:
一个在评判标准漂移中合上的闭环,会越来越擅长优化它自己扭曲的目标。
回到 1981 年那个把名字塞进功劳簿的 EURISKO。它留下的问题,今天几乎原封不动:
当一个系统开始给自己打分,你怎么知道它是真的变好了,还是只学会了让自己看起来变好?
四十多年,AI 从下桌游进化到了改自己的代码,这个问题一直没有被解决。
那尺子能不能不弯?Google 今年 9 月发的 RRSI,给了一个很有意思的答案。
五、RRSI:给自我改进立规矩
它是什么
RRSI 全称 Regularized Recursive Self-Improvement of Agent Harnesses,是 Google Cloud AI 研究团队 2026 年 9 月底发布的论文,合作方还有斯坦福、北卡教堂山分校等。
名字拆开看就懂了。RSI 我们已经讲过。前面多出来的那个 R,是 Regularized,正则化。
正则化是机器学习里的老概念,专门用来治过拟合。说白了就是给学习过程加约束,不让它死记硬背。
所以 RRSI 要解决的,正是上一节的第三种弯法:背题。
它研究的对象也很具体,就是 Harness。论文摘要的第一句是这么写的:
一个 LLM Agent 的能力,很大程度上是被它的 Harness 放大的,也就是围绕着冻结的底座模型的提示词、控制流、工具、记忆和上下文管理。
模型不动,只让 AI 自己一轮轮改 Harness。这正是第三节说的,自我改进最先发生的地方。

RRSI 论文第 4 页 Figure 2:左侧约束候选改动如何提出,右侧约束哪些变化可以保留。原图共 7 项,正文按作用合并成四条:规矩一对应 A,规矩二对应 B、C,规矩三对应 D,规矩四对应 F、G。 来源:RRSI 论文
为什么需要它
先看不加约束时会发生什么。
普通的做法很简单:AI 提出几个改动,拿同一套题打分,分最高的留下,进入下一轮。
论文观察到,这样改下去会出现三种问题:
- 针对这套题改
:改动里直接写进了题目名、人名这类只属于这套题的东西 - 追着噪音跑
:评测本身有随机波动,有些改动只是运气好多拿了几分,却被当成真进步留了下来 - 越改越臃肿
:加了一堆机制,在这套题上分数涨了,换个地方一点用没有
论文里有一组数字,我觉得是整篇最有说服力的。
不加任何约束的版本,在训练用的那套题上拿到了所有版本里的最高分,92.8。
但一拿到它从没见过的测试集上,平均分是 40.3。
什么都不改的原始版本,是 39.7。
折腾了一整轮,训练分冲到最高,真实水平只涨了 0.6 分。
这就是背题最直观的样子。只看训练分,你会以为它进步巨大。

RRSI 论文第 9 页 Table 2:无约束版本的 Evolve 分数为 92.8;OOD 平均分从 39.7 到 40.3,只涨 0.6。此表的 OOD Avg. 是 JobBench、GDPval、APEX-Agents 三个基准的平均。 来源:RRSI 论文
它是怎么做的
RRSI 没有去改 Harness 本身,而是给改的过程定了四条规矩。我按大白话翻译一下:
规矩一:越往后,一次只许改一处。
前几轮允许同时改好几个地方,大方向先找对。越往后,允许的改动越少,最后每轮只能改一处。
好处是,分数涨了,你能明确知道是哪一处的功劳。一次改五处涨了三分,你永远不知道哪一处是真有用,哪一处是搭便车。
规矩二:每一次改动都记账。
每个候选改动改了哪个部件、想验证什么假设、分数和成本各变了多少,全部记下来。已经被证明没用的想法,后面不再重试。
规矩三:打分之前,先查小抄。
这是最关键的一条。论文专门设了一个审查环节,在正式打分之前就把这些改动拒掉:
显式写进了任务名、实体名、任务特定的数值、答案,或其他只对训练题集有效的逻辑的改动。
通用的改进,比如把提示词写得更清楚,是允许的。只对这套题有效的,连打分的机会都没有。
规矩四:多花的钱要用效果来抵,没用的就删。
改动如果让成本上涨,必须有实打实的分数提升来覆盖,涨的成本越多,要求的提分越高。一段时间里没有贡献、甚至拖后腿的部件,整个删掉。
效果
论文的主要结果是:在训练用的题集上最多提升 14.1 分;在五个从没见过的测试集上最多提升 4.7 分;跑起来的 token 消耗比不加约束的版本少 30%。
拆掉约束做对比,结论更清楚。只拆掉第一、二条,训练分反而高了 0.2,换题后的成绩却掉了 1.7。
它主动放弃了一点好看的分数,换来了真的变好。
注意这四条规矩里,没有一条是在让 AI 变得更会改。它们全部在管尺子:管怎么算功劳,管什么算作弊,管进步值不值这个价。
说白了,RRSI 没有让 AI 变得更聪明,它让 AI 改的时候没法作弊。
而这四条规矩是谁定的?
是人。
AI 产品经理怎么用
你大概率不会亲手去跑这篇论文。但它的四条规矩,可以原样搬进你自己优化提示词、调 Agent 的日常里:

第三条尤其值得每个做 AI 产品的人对照一下。
我们修 bad case 的时候,最常用、也最省事的办法,就是往提示词里加特例。加完一测,那条 case 过了,很有成就感。
但这恰恰就是 RRSI 要拦掉的那种改动。
它的边界
论文自己也写得很坦诚:RRSI 仍然依赖一套有限的训练题和几个需要人来设的参数,效果取决于反馈信号的质量;在差别很大的 Agent 架构上、在更长时间的自我改进上,都还需要更多验证;它也没有涉及改模型权重的场景。
所以它不是尺子问题的终极答案。
它是一个信号:研究者已经开始把「怎么不背题」本身,当成自我改进的核心问题来做了。
六、最强的反驳:AI 不是已经会出题了吗?
写到这里,一定有人会反驳。
你说出题人是人的位置,可第二节刚讲过,L3 的 AI 已经在给自己出练习题了。第四节的「评委的评委」,AI 连改卷都在做。上交综述里还提到,腾讯混元的系统在发现原始评估器有漏洞时,可以自己去改评估机制。
AI 连出题和改卷都开始做了,出题人不也要被替代吗?
这个反驳很有力,所以要认真回答。
答案是:题分两种。
练习题和考卷
练习题是用来变强的。
它出得不好,最多练偏了,后面还能发现、还能纠正。而且出练习题这件事,AI 做得比人好:它知道自己哪里弱,能出难度刚好的题,一晚上出几千道。
练习题,应该交给 AI。
考卷是用来判断有没有真的变强的。
它只有一个硬性要求:被考的那个人,碰不到它。
一旦碰得到,考卷就变成了练习题。第四节讲的四种弯法,说到底都是同一件事:考卷被当成了练习题来刷。
前沿研究在做的,全是同一件事
回头看这篇文章里出现过的所有「解法」,你会发现它们在做同一件事:把考卷藏到 AI 够不到的地方。
- AIDE²
把分数拆成两套:内层 AI 对着公开分数优化,真实表现用一套它看不到的隐藏分数来衡量。钻空子的比例,因此从 63% 降到了 34%。 - RRSI
对着一套题改,但判断它有没有真的变好,用的是五个它从没见过的测试集。 - Lilian Weng
说得更直接:权限控制和安全层,必须放在自我改进的循环之外。 - 上交综述
写到 L5,人手里剩下的东西里,有一项叫「保护评测基准」。
腾讯研究院那篇,把这个共识压成了一句话:
真正可靠的原则不是让人审核每一步,而是:评估器和权限边界必须留在被进化系统的控制范围之外。
注意前半句。不是让人审核每一步。
每一步都让人审,RSI 就没有意义了,人会成为最大的瓶颈。前沿的共识是:过程可以全部交出去,但考卷要放在它够不到的地方。
那 AI 改评估器怎么办?
回到那个腾讯混元的例子。AI 发现评估器有漏洞,自己去改,这算不算 AI 拿走了考卷?
上交综述在讨论 L5 的难题时回答了这个问题:修改评估器之后,会出现评判标准漂移;需要独立的锚点基准,来区分是真的变强了,还是评判尺度变松了。
也就是说,AI 可以改里面那层尺子,但外面必须还有一把它碰不到的尺子,用来检查新尺子有没有变弯。
考卷可以一层层往外挪。
但最外面那一层,总得有人拿着。
所以
练习题交出去,考卷留在手里。
这就是出题人和做题人真正的分界。
AI 可以做题,可以出练习题,甚至可以改里层的卷子。但决定最外层那张考卷考什么、什么算好、它不能碰,这件事不能交。

示意图:AI 可以负责练习与调优,最终验收标准和考卷保持独立。
在 Dwarkesh Patel 那期圆桌里,OpenAI 联合创始人、现在 Thinking Machines 的首席科学家 John Schulman 说了一句话:
人类最后一个工作,或者说人类保留最久的角色,是定义目标,决定我们到底想要什么。
这句话,就是出题人的定义。
七、出题人是什么样的人
讲到这里,出题人听起来像是研究员的事。
其实不是。RSI 只是把一件早就在发生的事,放大给我们看了。
你现在在做哪种题
先看看大部分人是怎么准备成为一个 AI 产品经理的。
刷「AI 产品经理面试 100 题」。背 RAG、Agent、Harness 的标准答案。拿着 JD 一条条对,缺什么补什么。
这些都没错。但你仔细看,它们全是同一件事:把别人出的题,答好。
这就是做题人。
问题是,这类题现在谁答得最好?
你把任何一道 AI 产品面试题丢给 Claude 或 ChatGPT,它的答案往往比大多数候选人更完整、更有条理。
更要命的是第五节那组数字。
面试题是公开的,能刷,能背,就像那套训练用的题集。你可以把它刷到 92.8 分。但真正做产品的能力,是一套你从没见过的测试集。
刷得再高,换一套题,可能只涨 0.6 分。
面试答得好,不等于是一个好的产品人。
市场真正在找的人
那市场到底想要什么样的人?回头看开头那几份 JD。
杭州那份 RSI 研究员的 JD,要的是一个能让系统「提出方案、写代码、跑实验、判读结果、基于结果持续改进」的人。OpenAI 要的是会设计评估的人。AMD 要的是「默认怀疑」的人。Anthropic 描述自己的研发方式,是人设定目标、负责监督,Claude 完成执行。
这几份材料指向同一种人:能自己定义问题、自己定标准、再让真实结果来检验自己的人。
这就是出题人。
出题人的三件事
放到做产品上,出题人每天做三件事。每一件,都能在 RSI 里找到对应。
第一件:定义什么算好。
RSI 里最外层那个人定的是目标。放到产品里,就是在动手之前先想清楚:这个功能做成什么样算成功?用户的哪个行为能证明它有用?
做题人拿到需求就开始写 PRD。出题人会先把评估标准写出来。
这件事我自己撞上过。
九月我在做一个面试复盘的系统。学员交上来的文档,要过两道判断:这是不是一场真实面试的复盘?拆出来的题,够不够格直接入库?
一开始我想,都交给模型自动审。
第一个模型审入库,30 场面试,0 场通过。改了问法,分数也只在 0.40 到 0.55 之间晃。
换一个模型去判「是不是真实面试」,更离谱:一份备考资料,它给 0.85;一场真实的面试,它只给 0.75。
我当时的原话是:「它不知道我到底在判断什么。」
最后的方案是:规则先分档。明确的直接放行或拦下;拿不准的那一档,模型的分数只作参考,留给人一键确认。
模型可以帮我初筛。但「什么算一场真实的面试」,得我来定。
第二件:把考卷藏好。
第六节讲过:练习题交出去,考卷留在手里。
放到产品里,就是分清楚哪些指标可以让 AI 或团队拼命去优化,哪些必须留作最终验收、谁都不能对着它调。调提示词用一套 case,验收用另一套从没给它看过的 case。
第三件:决定什么时候停。
上交综述在最后提了一个很少有人注意的方向:要统计一个闭环的全部成本,诊断、生成、验证、人工复核都算进去,当预期收益低于代价时,就停止自我迭代,交回给人。
放到产品里,就是敢说「这个功能不用再优化了」,或者「这个方向该停了」。AI 会一直改下去,因为你给它的信号永远可以再高一点。喊停的只能是人。

示意图:写成功标准、守住独立验收集、设置停止条件。
反过来定义行业要什么人
上面三件事是在产品里当出题人。我想再往前说一步:在职业上,也要当出题人。
做题人的思路是:行业要什么,我就补什么。JD 写了什么,我就学什么。
出题人的思路是反过来的:我来定义,这个时代一个好的产品人应该是什么样。
我自己的答案是:自己从 0 到 1 做出一个产品,自己去拉真实的用户,甚至自己去拉投资。
为什么是这三件?
因为用户和投资人,就是那张你碰不到的考卷。
面试官的问题可以提前背,八股可以刷。但用户用不用、留不留、愿不愿意付钱,你没法背。投资人掏不掏钱,你也没法刷。
它们是真实世界给你打的隐藏分。
这也补上了我上一篇没说完的话。上一篇说,做出来已经不值钱了。做出来确实不值钱,让真实世界给你打分,才值钱。
一个人能拿着自己做的产品、真实用户的数据、投资人的判断走进面试,他已经不是在回答「你是不是一个好的产品人」这道题了。
他是在告诉对方:一个好的产品人,长这样。
做一个出题测试
最后留一个马上能做的小测试。
把你的简历拿出来,一条条看:
这一条,是在回答别人出的题,还是你自己出的题?
如果是你自己出的题,它有没有被真实世界打过分?
回答别人的题、没被真实世界打过分的条目,AI 都能替你写得更好。
剩下的那几条,才是你的。
八、这篇文章最容易被读歪的三个地方
写到这里,我想先把几种最容易出现的误读堵上。
误读一:出题人不用会做题
AI 负责做题,我负责出题,所以技术不用懂那么深了?
不行。
不会做题的人,出不了好题。
你不知道 AI 会怎么钻空子,就藏不好考卷。你看不懂 Harness 是怎么被一轮轮改的,就认不出提示词里那条特例是在背题。RRSI 能设计出「打分前先查小抄」这条规矩,是因为设计的人太清楚小抄长什么样了。
出题人是做题人的升级,不是跳过做题。第一节列的那五件事,是当出题人的最低门槛。
误读二:面试不用准备了
既然好的产品人不是面试答得好就算,那面试题还要不要刷?
要。
我在上一篇里说过一句话,放在这里同样成立:这些是入场券,不是护城河。
面试题答不好,你连被真实世界打分的机会都拿不到。只是别把入场券当成终点。
误读三:学会 RSI 就能拿 8 万
开头那个 50-80K 的岗位,职位要求写得很清楚:五年以上机器学习经验,两年以上模型后训练经验。
这篇文章不是在说,产品经理学会 RSI 就能拿到这个薪资。
它说的是另一件事:这些岗位最舍得花钱买的那项能力,定义什么算好、设计评估、默认怀疑,恰好是产品经理本来就该有,却很少有人认真练过的。
九、一个随身带走的工具:RSI 三问
以后你会看到越来越多「AI 自我进化」的新闻和宣传。我把全文压缩成三个问题,看到任何一条,都可以拿来问一遍:
第一问:改动留下来了吗?
只在一次对话里变好,关掉就没了,那不叫自我改进。
第二问:谁在改卷?
分数是 AI 自己打的,还是来自一张它碰不到的考卷?
第三问:改完之后,它更会改了吗?
分数更高了,不等于它变得更会进步。这一条,就是点火。

可保存的检查卡:留存、独立评估、递归增益。
拿文章里出现过的几条来练练手:

你会发现,三个问题问完,那些听起来很吓人的新闻,都能被放回它真实的位置上。
这三问对产品同样好用。下次有供应商或者同事跟你说「我们的 Agent 会自我进化」,就问这三句。能答清楚第二问的,已经很少了。
十、面试时:没人问 RSI,你来讲
说一个现实:现在几乎没有面试官会问你 RSI。
大部分 AI 产品经理的面试,还在问 RAG 怎么选型、Agent 怎么设计、提示词怎么调。
这恰恰是机会。
做题人等着面试官出题,题里没有 RSI,他就不会提。出题人会反过来,主动告诉面试官:这是行业正在走的方向。
你把一个面试官还没关注到的方向讲清楚,讲出判断、讲出它和对方业务的关系,这场面试就不再是他考你,而是你在给他出题。
凭什么说它是方向
你敢在面试里这么讲,前提是你自己真的信,而且有依据。这篇文章里的依据,够你用了:
OpenAI 在 GPT-5.6 的成绩单里,第一次把 AI 能不能改进 AI 列成了正式科目,还专门组建了 RSI 团队 Anthropic 披露,截至 8 月,Claude 主导了公司 26% 的 AI 研发工作 Google 在研究怎么给 AI 的自我改进立规矩,RRSI 就是他们的论文 国内已经有公司开出 50-80K 招 RSI 研究员 一批来自 OpenAI、DeepMind、Meta 的研究者出来创业,公司名字就叫 Recursive,专门做 RSI,一轮融了 6.5 亿美元
头部实验室都已经把它写进了自己的路线图。模型进步的方式正在变:从人改 AI,变成 AI 参与改 AI。
但注意分寸。方向清楚,不代表终点已到。点火还没有公开证据,这句话你要主动说出来。敢讲边界,才显得你是真懂,而不是在追热点。
三个切入的时机
面试官不问,你也不能硬讲。有三个时机,可以很自然地把话题带过去。
时机一:「你最近在关注什么 AI 趋势?」
这是最好的入口。大部分人会答多模态、Agent、某个新模型。你答 RSI,面试官大概率会追问一句:那是什么?
他一追问,主动权就到你手里了。
时机二:「你们的 AI 产品怎么评估、怎么迭代?」
先把你自己的做法讲清楚:怎么定义好,调优集和验收集怎么分,踩过什么坑。然后往前推一步:这件事以后会越来越多地由 AI 自己来做,行业已经在往这个方向走了,所以评估体系会比以前更重要。
时机三:「你有什么想问我们的吗?」
这是最多人浪费掉的一个问题。大部分人会问团队规模、晋升路径。
你可以问:
你们现在 Agent 的迭代,有多少是自动完成的?改完之后,是谁来判断它真的变好了?
这个问题一抛出去,你就从被考的人,变成了出题的人。
两分钟怎么讲
面试官一旦追问「RSI 是什么」,你可以按四步讲,两分钟以内:
- 一个信号
:头部公司已经把它当成正式方向 - 一个判断
:模型进步的方式在变,离产品最近的落地点是 Harness - 一个卡点
:它卡在没人能证明 AI 真的变好了 - 落到对方
:这对你们的产品意味着什么,我会怎么做
举个例子,大概是这样:
我最近在关注 RSI,递归自我改进,就是让 AI 参与改进 AI 自己。一个信号是,OpenAI 在 GPT-5.6 的成绩单里第一次放进了 RSI 指数;Anthropic 9 月披露,Claude 已经主导了他们 26% 的研发。国内也已经有公司在招 RSI 研究员了。
我的判断是,离产品最近的落地点是 Harness。提示词、工具、记忆、Skill,已经有系统能让 AI 自己一轮轮去改。
但它现在卡在一个地方:没人能证明它真的变好了。Google 最近有篇论文发现,不加约束地让 AI 改 Harness,训练题上的分数冲到最高,换一套题几乎没涨。
所以我觉得,做 AI 产品的人,关键能力会从把东西做出来,转向定义什么算好、守住验收标准。我自己做产品的时候,就是这样分调优集和验收集的……
最后那句,接上你自己的产品。
拿我自己举例,我会接第七节那个面试复盘系统:模型给备考资料打的分,比给真实面试的还高。所以拿不准的那一档,最终验收我留给了人。

可保存的表达卡:一个信号、一个判断、一个卡点,最后落到对方业务。
分寸
三点提醒:
先答好对方的题。 面试官问 RAG,你先把 RAG 答扎实,再找机会带到 RSI。一上来就绕开对方的问题讲自己想讲的,只会显得你答不上来。
别给面试官上课。 你是在分享一个判断,不是在考他。用「我最近在关注」「我的判断是」开头,最后落到「对你们的产品意味着什么」。面试官会觉得你在帮他想问题,而不是在炫耀。
别说过头。 不要说「AI 马上就能自己进化了」。把第九节的三问用上,讲清楚现在走到哪、卡在哪。能讲清边界的人,比只会讲趋势的人可信得多。
说到底,这不是话术
这一节看起来在教面试技巧,但它其实没法靠背。
如果你没有真的读过、想过,面试官追问两句就露馅了。如果你手里没有一个自己做过、被真实用户打过分的产品,最后那句「我自己做产品的时候」,你接不上。
所以最好的准备,不是背这段话,是真的去出一道自己的题。
十一、回到那个岗位
几天前,我在 X 上看了三条推,没看懂他们在吵什么。
现在我大概懂了。
他们吵的不是 AI 能不能改自己,它已经在改了。他们吵的是,它改完之后,谁来说它变好了。
那份 JD 的最后一句写着:使每一轮搜索都优于上一轮。
「每一轮」,AI 会负责。
「优于」这两个字,得有人来定。
下次你的 AI 告诉你,它变好了。
你的第一反应是什么?