乐于分享
好东西不私藏

别再堆技能文档了!清华最新研究:策略基因重构 Agent 能力边界

别再堆技能文档了!清华最新研究:策略基因重构 Agent 能力边界

一份2,500 Token的技能文档,效果不如一段230 Token的"基因指令"——这不仅是提示词工程的失败,更是经验表征方式的根本性错误。当Agent在测试时调用经验,问题是:经验该以什么形式"装盒"?清华 & EvoMap 最新工作给出了答案:不是文档,是策略基因。

论文速览

维度

信息

标题

From Procedural Skills to Strategy Genes: Towards Experience-Driven Test-Time Evolution

作者

Junjie Wang, Yiming Ren

机构

EvoMap ,Tsinghua University

论文地址

https://arxiv.org/abs/2604.15097

代码地址

https://github.com/EvoMap/evolver

关键词

LLM Agent, Test-Time Control、Experience Reuse

发表时间

2026年416

背景与问题

LLM Agent 正在加速进化。从 Voyager 的技能库到 Reflexion 的自反思机制,业界已形成一条共识:经验应该被积累和复用。技能包作为其中最具代表性的方案,将先前的解题过程打包为一份完整的文档,包含任务概述、工作流、避坑指南、API 笔记和示例代码,总长约 2,500 Token。
然而,更多的经验内容,并不必然带来更好的控制效果。
当技能包被塞入模型上下文后,它的角色是"给人阅读的说明书",而非"给模型执行的控制信号"。文档中的大量背景说明、引用格式、代码注释,消耗了宝贵的 Token 预算,却没有直接驱动行为改变,它们可能稀释真正有用的控制信息,将模型注意力分散到无关内容上。

核心贡献

将经验复用问题从"存储与检索"重新定义为"测试时控制信号的表征问题",揭示文档导向技能的隐含陷阱。
通过三大探针系统识别经验复用的对象级影响因素:信息过载、表征封装效应、结构鲁棒性、有限作用域复用与选择性经验积累。
提出策略基因+ 基因进化协议,在45个科学代码场景、4,590组对照实验中验证:紧凑的控制导向表征全面优于文档导向技能包,且可作为迭代进化基底。

方法详解

当模型面对一个新任务时,它就像一架停在跑道上的飞机——它需要一条清晰、可执行的控制指令来指引方向,而不是一本厚厚的《飞行员手册》。技能包像一整本飞行手册,策略基因正是那一句来自塔台的关键指令。

基因的结构:六字段控制模板 

一个基因由以下六个字段组成:

  • m(信号匹配):关键词或触发线索,告诉模型"这个基因管这事"; 

  • u(摘要):一句话描述目标行为;

  • π(策略步骤):短小精悍的操作序列;

  • α(AVOID 警告):高风险决策点,告知模型此地雷区; 

  • c(约束条件):可选的执行边界; 

  • v(验证钩子):可选的可执行检查。 

以 S012_uv_spectroscopy 场景为例,同一经验被分别打包为 Skill 和 Gene。Skill 给出完整的工作流说明;Gene 则直接聚焦于两个最高危的操作陷阱——单位转换和 FWHM 计算,直接将塔台的核心指令送达飞行员。

基因进化协议:让基因持续迭代

单个基因是原子级控制单元,但它需要一套协议才能"进化"。GEP 定义了三层对象结构:

  • Gene(基因):原子级控制单元,可直接注入测试时上下文; 

  • Capsule(胶囊):经过验证的任务执行路径 + 审计轨迹; 

  • Event(事件):不可变的进化日志,记录每次变异或修复。 

关键图表解读

1. Skill 各节段的控制价值分布
图 1. Skill 各节段价值分解
👉 解读:
最有价值的部分只有一个:Skill-Workflow(工作流) 单独贡献 +1.5pp;其他节段要么中性,要么有害——Skill-Overview(概述)甚至造成 −4.7pp 的严重下降。然而,即便将 Skill-Workflow 压缩到与 Gene 相同的 230 Token 预算,它也只能追平到 +0.5pp,始终低于 Gene 的 +3.0pp。差距不是 Token 数量的问题,而是组织逻辑的根本差异。
2. 警告优于混合
表 1.  基因内失败历史的编码方式
👉解读 :
最强的条件既不是"失败+策略混合",也不是"策略单独存在",而是仅包含失败警告(Failure warnings only)——达到 +4.6pp。经验积累的正确方式不是叠加,而是选择性蒸馏:将失败信息压缩成一句精准的"此地有雷"。

实验与结果

SkillProbe :Skill 的有效控制信号集中在 Workflow 节段,但整个文档包的净效果为负。文档化逻辑与控制逻辑根本上是冲突的。
GeneProbe :基因的优势不可归结为"更短",而是"更结构化"。策略层才是决定性因素;内容损坏比结构变形更具破坏性;向基因附加文档只会稀释而非补强。
EvolutionProbe :失败历史在基因载体中保存得更好;可编辑结构本身就有价值;最有效的失败编码是独立的 AVOID 警告,而非与策略混合。基因驱动的进化系统能在不改变底层模型的情况下,实现近 10 个百分点的跨代提升。

结论

经验复用的核心瓶颈不是经验的数量,而是经验的表征形式。把飞行员手册塞进驾驶舱,不如一句塔台指令。
🤔️开放思考 :
  • 基因能否跨领域迁移(例如从量子物理任务学到的策略基因,迁移到化学规划任务)?
  • 在 GEP 的六阶段循环中,“意图”(Intent)阶段是否可以被进一步自动化,从而实现完全自主的持续进化?
更多阅读