微软开源SkillOpt,用训练神经网络的方式让AI代理技能自我进化!

你有没有遇到过这种情况:给AI助手写了一段很长的提示词,想让它帮你做点什么,结果它要么理解偏了,要么效果时好时坏?你想让它学会某种固定的工作流程,比如“帮我查论文摘要并总结”,但每次都得反复调整指令,甚至重新写一段。
这其实是当前LLM Agent(智能代理)的一个尴尬点:大多数“技能”都是手写的、一次性生成,或者通过松散控制的自我修改来迭代。没有一种像深度学习训练那样系统、可复现的方法来优化它们。
微软团队最近开源了一个叫SkillOpt的项目,要解决的就是这个问题。它的核心思路很妙:把技能文档当成神经网络里可以训练的参数,然后用一套类似深度学习的训练流程(epoch、batchsize、learning rate、validation gate)来优化它——但全程不碰模型权重。
项目在GitHub上已经积累了7418颗星,说明很多人关注这个方向。我仔细看了一下它的README和文档,发现它确实有货。

技能优化,像训练神经网络一样严格
SkillOpt的全称是“Self-Evolving Agent Skills”,直译就是“自我进化的Agent技能”。它不是为了造一个更强的LLM,而是在不改变底层模型的前提下,让同一个模型通过更好的技能文档表现更好。
想象一下,你的AI助手有一份“技能手册”,里面写着怎么执行某个任务。传统做法要么是手写,要么让模型自己改一遍——但改完之后可能变好,也可能变差,完全没有保证。SkillOpt的做法是引入一个专门的优化器模型,它会根据过去一段时间里技能的表现(也就是“rollout”的结果),对技能文档进行有边界的小幅度编辑:增加、删除、替换某段文字。每次修改都先过一遍验证关卡,只有严格提升验证分数才接受。
这就像一个mini版本的“梯度下降”,只不过梯度的对象是文本,优化的是自然语言指令。而且它还有一个文本版的学习率预算(textual learning-rate budget)和拒绝编辑缓冲区(rejected-edit buffer),让训练过程更稳定。最妙的是,部署时只需要一个几百到两千token的best_skill.md文件,完全不需要在推理时额外调用模型。
这等于是把深度学习的训练范式迁移到了文本技能空间里,而且效果惊人。

52项评测全胜,跨模型跨框架通用
SkillOpt在六个基准测试、七个目标模型、三个执行框架(直接对话、Codex CLI、Claude Code CLI)上做了评测,结果是在所有52个(模型、基准、框架)组合中,要么最优,要么并列最优。在最新的GPT-5.5上,它让无技能时的平均准确率提升了:直接对话+23.5分,Codex agent循环+24.8分,Claude Code循环+19.1分。

注意,这些提升不需要改模型权重,只需要一个优化后的技能文档。而且这个技能文档可以跨模型规模、跨执行框架迁移,甚至能迁移到相近的其他基准任务上——你在一个场景里训练好的技能,拿到另一个场景也能用,不用重新优化。

怎么用?安装一行命令,训练一个脚本
SkillOpt已经发布到了PyPI上,安装就是一行 pip install skillopt。它包含了完整的训练循环:rollout(让代理执行任务)→ reflect(反思结果)→ aggregate(汇总)→ select(选择)→ update(更新技能)→ evaluate(再次验证)。支持多后端,包括OpenAI、Azure、Claude、Qwen、MiniMax,可以通过配置文件切换。
内置了六个标准评测基准,你可以直接跑起来看效果。还可以启动一个WebUI监控面板,在浏览器里观察训练过程。如果你想加新的后端或新的基准,项目也提供了详细的文档指南,甚至给出了最简单的参考实现(比如SearchQA基准只有几个文件)。
谁适合用?
如果你是做LLM Agent开发的工程师,或者你在尝试让AI助手在特定领域更稳定地工作,SkillOpt直接给了你一套现成的优化工具。不需要调模型参数,不需要额外部署推理服务,只需要准备一些初始技能文档和评测数据,就能自动迭代出更好的技能。
如果你或者你的团队已经在用Claude Code、Codex或者OpenAI的API做自动化任务,SkillOpt的“夜间自我进化”功能(SkillOpt-Sleep预览版)甚至可以让你每天醒来发现Agent自动变强了——它会在后台回顾历史会话,找出重复出现的任务模式,然后通过验证门控自动合并成更优的技能。
当然,如果你对AI的理解还停留在“向GPT问个问题”的阶段,那这个项目暂时还帮不上忙。它面向的是有一定开发能力、希望系统化提升AI代理表现的用户。

值得关注的地方
SkillOpt的出现,意味着Agent技能优化开始进入“工程化”阶段。不再是一堆prompt调来调去没有标准,而是有了可复现的训练流程、验证机制和评估指标。这和当年深度学习从手工特征工程转向自动学习的过程有几分相似。
如果你想试试让Agent学会更好的技能,或者好奇这种“把自然语言当参数训练”的思路能走多远,SkillOpt值得花时间看看。
持续分享优质 AI 开源项目与源码实战,一个人摸索很容易踩坑。
对 Agent、智能体感兴趣的朋友,无论新手还是大佬,都欢迎一起交流。私信「时之」拉你进群。
想拿到仓库地址,直接动手试试?
GITHUB: https://github.com/microsoft/SkillOpt
夜雨聆风