
先说个反直觉的事情。
同一份 Skill 技能文件,在 Codex 里训练好了,直接丢进 Claude Code 用——得分从 22 分直接飙到 81.8 分,比它本来就在 Claude Code 里训练的 80.4 分还高。
对,你没看错:跨工具搬过去的,比就地训练的还强。这是微软和上交、同济、复旦联合发的一篇论文(SkillOpt)里最离谱的一张实验表。我一开始也不信,把论文翻了一遍,发现这事儿比"搬文件"有意思多了。
先搞清一个前提:Skill 是什么
在讲这篇论文前,得先对齐一个概念——Skill(技能)。
如果你已经在用 AI 编程工具(Claude Code、Codex、OpenCode 都支持),可能见过这种东西:一个 SKILL.md 文件夹,里面用自然语言写好一套操作流程,比如"改代码前先跑测试""处理 CSV 前先检查编码"。AI 工具读到这个文件,就会照着上面的规矩干活。
我自己的体验是:手写 Skill 很不稳定。同一套流程,今天管用明天失效,换个工具直接不认——Claude Code 读 ~/.claude/skills,Codex 读 ~/.agents/skills,OpenCode 读自己的目录,格式还略有差别。所以社区里一堆"技能搬运工具"(skill-port、Agent-SkillHub 之类),专门帮你把 Skill 文件复制到各个工具的目录里。
但搬运工具只解决"文件在哪"的问题,解决不了"这份 Skill 内容到底行不行"的问题。
微软的思路:把 Skill 当"能训练的文档"
SkillOpt 这篇论文的野心就在这:别再把 Skill 当一次性写好的说明书,把它当成一个可以被"训练"的文档。
具体做法很有意思,我尽量用人话讲:
1. 让它跑一遍:带着当前版本的 Skill,让 AI 去干一批真实任务,记录每次成功和失败(这叫 rollout)。
2. 让另一个 AI 当教练:一个更聪明的模型(论文里用 GPT-5.5)看这些执行记录,总结"哪些步骤有效要保留、哪些总出错要改"。
3. 小步修改:教练只做"增加/删除/替换"这样的小改动,一次改一点点,不许大改特改(防止 Skill 漂移成另一个东西)。
4. 过闸门才收货:改完的版本要在一个"留出验证集"上重新测试,只有分数严格比旧版高,才被正式采纳。被否掉的改动也不扔掉,存起来当反面教材。
5. 循环往复:重复上面过程,直到分数不再涨。
整个流程,活脱脱就是把深度学习训练的那套(前向传播、反向传播、学习率、验证集)搬到了"改文档"上。论文里管这个叫 best_skill.md——训练完的产物就一个 300-2000 token 的小文件,模型权重一个都不用动。

结果有多夸张
论文在 6 个基准、7 个模型、3 种执行环境上做了 52 组对照,52 组全部最优或并列最优,把"人手写的 Skill""AI 一次性生成的 Skill"全比下去了。
先看一组我觉得特别有意义的数据——小模型被 Skill 拉起来了:
• GPT-5.4-mini 配训练好的 Skill,平均分 64.3,超过了没配 Skill 的 GPT-5.4(59.7)
• GPT-5.4-nano 配 Skill 后 57.4 分,超过了没配 Skill 的 GPT-5.2(51.3)
• 连 40 亿参数的 Qwen3.5-4B 都能靠一份 Skill 追平更强的模型

但最夸张的还是开头那组跨工具的数据:
• 同一份 Skill 从 Codex 搬到 Claude Code:22.1 → 81.8(+59.7 分),反超就地训练的 80.4
• 反过来从 Claude Code 搬到 Codex:27.5 → 71.1(+43.6 分)
• 在 GPT-5.5 上,训练后的 Skill 让平均正确率从 58.8 提到 82.3(+23.5 分)

翻译成人话:原来"换更大的模型"才能提的能力,现在靠一份写得好的 Skill 也能补。这对我们这种用不起旗舰模型的普通人,是实打实的好消息。
为什么"跨工具还能用"这件事很关键
回到开头那个反常识实验。一份在 Codex 里训练出来的 Skill,为什么搬到 Claude Code 反而更强?
论文的解释是:真正被训练出来的不是"Codex 专属的某个命令怎么敲",而是"做这类任务应该遵循的通用步骤"——比如处理表格要先看结构、算完要验证公式、输出要核对静态值。这些步骤跟工具无关,Codex 和 Claude Code 谁读都一样。
这意味着 Skill 开始变成一种可训练、可复用、可审计的资产:
• 可训练:不用等大模型发新版本,自己就能持续优化
• 可复用:优化一次,多个工具、多个模型共用
• 可审计:整个优化过程就是改一个文本文件,改了什么、为什么改,全都能回看
换个角度想,这就是把"Prompt 调优"从玄学变成了工程。以前靠运气试 Prompt,现在有一套明确的方法论:采样、反思、小步改、验证过关才收。
踩坑提醒:别急着冲上去
话虽这么说,我得泼盆冷水:
这套东西现在不是开箱即用的产品,是一篇论文 + 一个开源工具。官方其实已经把代码开源了(GitHub 上搜 SkillOpt 就能找到),但它定位是研究工具,不是装好就能用。我研究下来最大的门槛是——它需要一个"能自动打分"的验证环境。训练循环里"验证过关才收"这一步,得有个客观评分器告诉你这轮改没改好。如果你的任务没有清晰的验收标准(比如"表格答案对不对"能自动判分,但"帮我想个选题"就没法打分),这套流程就跑不起来。
另外,训练一次要跑很多轮 rollout,每一轮都要真金白银地调 API,成本不小。论文里用的是 GPT-5.5 当教练,普通用户自己复现的话,得掂量掂量 API 账单。
我目前的用法是:先别想着自己训,把它当成一个信号——Skill 的价值正在被正式承认,以后好的 Skill 会越来越值钱。GitHub 上 92 万+ 的免费 Skill 生态已经摆在那了,等这套优化工具成熟,好 Skill 和普通 Skill 的差距只会越拉越大。
总结
SkillOpt 告诉我一件反直觉的事:AI 的能力上限,未必只由模型大小决定。一份经过"训练"的 Skill,能让小模型追上大模型,能让一个工具里练出的经验在另一个工具里直接复用。
对普通用户来说,最值得记住的就一句:以后别再随手写 Skill 了,把它当成值得认真打磨的东西。因为 Skill 正在从"说明书"变成"训练得出来的资产"。
换更大的模型是花钱买能力,把 Skill 训练好是花时间攒能力——前者越花越贵,后者越攒越值。
💬 你平时会用 Agent Skill 吗?有没有遇到过"换个工具 Skill 就废了"的经历?评论区聊聊。
如果觉得这篇文章有用,欢迎关注「AI 阿砚」,一个科研爱好者的 AI 探索笔记。
夜雨聆风