乐于分享
好东西不私藏

同一个 Skill 换个 AI 工具还能用?微软证明了

同一个 Skill 换个 AI 工具还能用?微软证明了

先说个反直觉的事情。

同一份 Skill 技能文件,在 Codex 里训练好了,直接丢进 Claude Code 用——得分从 22 分直接飙到 81.8 分,比它本来就在 Claude Code 里训练的 80.4 分还高

对,你没看错:跨工具搬过去的,比就地训练的还强。这是微软和上交、同济、复旦联合发的一篇论文(SkillOpt)里最离谱的一张实验表。我一开始也不信,把论文翻了一遍,发现这事儿比"搬文件"有意思多了。

先搞清一个前提:Skill 是什么

在讲这篇论文前,得先对齐一个概念——Skill(技能)

如果你已经在用 AI 编程工具(Claude Code、Codex、OpenCode 都支持),可能见过这种东西:一个 SKILL.md 文件夹,里面用自然语言写好一套操作流程,比如"改代码前先跑测试""处理 CSV 前先检查编码"。AI 工具读到这个文件,就会照着上面的规矩干活。

我自己的体验是:手写 Skill 很不稳定。同一套流程,今天管用明天失效,换个工具直接不认——Claude Code 读 ~/.claude/skills,Codex 读 ~/.agents/skills,OpenCode 读自己的目录,格式还略有差别。所以社区里一堆"技能搬运工具"(skill-port、Agent-SkillHub 之类),专门帮你把 Skill 文件复制到各个工具的目录里。

但搬运工具只解决"文件在哪"的问题,解决不了"这份 Skill 内容到底行不行"的问题。

微软的思路:把 Skill 当"能训练的文档"

SkillOpt 这篇论文的野心就在这:别再把 Skill 当一次性写好的说明书,把它当成一个可以被"训练"的文档。

具体做法很有意思,我尽量用人话讲:

1. 让它跑一遍:带着当前版本的 Skill,让 AI 去干一批真实任务,记录每次成功和失败(这叫 rollout)。

2. 让另一个 AI 当教练:一个更聪明的模型(论文里用 GPT-5.5)看这些执行记录,总结"哪些步骤有效要保留、哪些总出错要改"。

3. 小步修改:教练只做"增加/删除/替换"这样的小改动,一次改一点点,不许大改特改(防止 Skill 漂移成另一个东西)。

4. 过闸门才收货:改完的版本要在一个"留出验证集"上重新测试,只有分数严格比旧版高,才被正式采纳。被否掉的改动也不扔掉,存起来当反面教材。

5. 循环往复:重复上面过程,直到分数不再涨。

整个流程,活脱脱就是把深度学习训练的那套(前向传播、反向传播、学习率、验证集)搬到了"改文档"上。论文里管这个叫 best_skill.md——训练完的产物就一个 300-2000 token 的小文件,模型权重一个都不用动

结果有多夸张

论文在 6 个基准、7 个模型、3 种执行环境上做了 52 组对照,52 组全部最优或并列最优,把"人手写的 Skill""AI 一次性生成的 Skill"全比下去了。

先看一组我觉得特别有意义的数据——小模型被 Skill 拉起来了

• GPT-5.4-mini 配训练好的 Skill,平均分 64.3,超过了没配 Skill 的 GPT-5.4(59.7)

• GPT-5.4-nano 配 Skill 后 57.4 分,超过了没配 Skill 的 GPT-5.2(51.3)

• 连 40 亿参数的 Qwen3.5-4B 都能靠一份 Skill 追平更强的模型

但最夸张的还是开头那组跨工具的数据:

• 同一份 Skill 从 Codex 搬到 Claude Code:22.1 → 81.8(+59.7 分),反超就地训练的 80.4

• 反过来从 Claude Code 搬到 Codex:27.5 → 71.1(+43.6 分)

• 在 GPT-5.5 上,训练后的 Skill 让平均正确率从 58.8 提到 82.3(+23.5 分

翻译成人话:原来"换更大的模型"才能提的能力,现在靠一份写得好的 Skill 也能补。这对我们这种用不起旗舰模型的普通人,是实打实的好消息。

为什么"跨工具还能用"这件事很关键

回到开头那个反常识实验。一份在 Codex 里训练出来的 Skill,为什么搬到 Claude Code 反而更强?

论文的解释是:真正被训练出来的不是"Codex 专属的某个命令怎么敲",而是"做这类任务应该遵循的通用步骤"——比如处理表格要先看结构、算完要验证公式、输出要核对静态值。这些步骤跟工具无关,Codex 和 Claude Code 谁读都一样。

这意味着 Skill 开始变成一种可训练、可复用、可审计的资产

• 可训练:不用等大模型发新版本,自己就能持续优化

• 可复用:优化一次,多个工具、多个模型共用

• 可审计:整个优化过程就是改一个文本文件,改了什么、为什么改,全都能回看

换个角度想,这就是把"Prompt 调优"从玄学变成了工程。以前靠运气试 Prompt,现在有一套明确的方法论:采样、反思、小步改、验证过关才收。

踩坑提醒:别急着冲上去

话虽这么说,我得泼盆冷水:

这套东西现在不是开箱即用的产品,是一篇论文 + 一个开源工具。官方其实已经把代码开源了(GitHub 上搜 SkillOpt 就能找到),但它定位是研究工具,不是装好就能用。我研究下来最大的门槛是——它需要一个"能自动打分"的验证环境。训练循环里"验证过关才收"这一步,得有个客观评分器告诉你这轮改没改好。如果你的任务没有清晰的验收标准(比如"表格答案对不对"能自动判分,但"帮我想个选题"就没法打分),这套流程就跑不起来。

另外,训练一次要跑很多轮 rollout,每一轮都要真金白银地调 API,成本不小。论文里用的是 GPT-5.5 当教练,普通用户自己复现的话,得掂量掂量 API 账单。

我目前的用法是:先别想着自己训,把它当成一个信号——Skill 的价值正在被正式承认,以后好的 Skill 会越来越值钱。GitHub 上 92 万+ 的免费 Skill 生态已经摆在那了,等这套优化工具成熟,好 Skill 和普通 Skill 的差距只会越拉越大。

总结

SkillOpt 告诉我一件反直觉的事:AI 的能力上限,未必只由模型大小决定。一份经过"训练"的 Skill,能让小模型追上大模型,能让一个工具里练出的经验在另一个工具里直接复用。

对普通用户来说,最值得记住的就一句:以后别再随手写 Skill 了,把它当成值得认真打磨的东西。因为 Skill 正在从"说明书"变成"训练得出来的资产"。

换更大的模型是花钱买能力,把 Skill 训练好是花时间攒能力——前者越花越贵,后者越攒越值。

💬 你平时会用 Agent Skill 吗?有没有遇到过"换个工具 Skill 就废了"的经历?评论区聊聊。


如果觉得这篇文章有用,欢迎关注「AI 阿砚」,一个科研爱好者的 AI 探索笔记。