想象一所没有人类老师的学校,学生自己出题、自己答题、连评分标准都自己制定,而且越学越难、永不触顶。这听起来像科幻,但2026年7月,阿里巴巴通义千问团队把它变成了现实。
一把刀刺进了AI训练的"死穴"
大模型正在悄悄发生一场革命
过去几年,AI界流行一种叫做自我对弈(Self-Play)的训练思路:不依赖人工标注,让模型分饰多角,用互相施压的方式生成训练信号。但这条路走到今天,卡在了一个几乎所有人都绕不过去的矛盾,
一边是"笼子里的可靠":把模型钉在代码执行器、游戏环境里训练,奖励信号很干净,但任务空间被死死框住,模型只会在这个笼子里转圈;
另一边是"旷野里的混乱":让模型自由造题,看起来什么都能学,但现实很骨感,它造出来的题经常前后矛盾、答案错误、无法验证,甚至大量重复。过滤器只能被动扔掉明显坏样本,却根本教不会模型"怎样才算出了一道好题"。多轮迭代之后,垃圾数据越积越多,模型能力反而塌缩。
Qwen团队把这个死穴写进了论文的第一页。然后,他们拿出了一把刀


▲ Hugging Face Daily Papers 将 Skill Self-Play 列为当日热门论文
那把刀叫做:技能库
7月24日,arXiv编号2607.22529的论文悄然上线,《Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills》。作者来自阿里巴巴通义千问大模型应用团队及多所高校,阵容横跨产学界。
论文的核心思想是:把"技能"从模型推理时的工具书,改造成训练时的课程引擎。
所谓"技能(Skill)",概念本身并不新鲜。Anthropic在2025年就推广了Agent Skills的工程实践,把领域流程写成可发现、可加载的文件夹式资源,模型需要时临时调用。这好比一本工具手册,需要时翻出来查,用完放回去。
Qwen团队把技能的用途彻底翻转了:在他们的框架里,技能成了出题插件。每一个技能包都写明这类题的出题规则、参考示例,以及一个机器可以自动判分的验证契约(Contract)。
这个翻转,是整篇论文的灵魂
三个角色,一个永不停止的进化循环
Skill Self-Play(简称Skill-SP)在每轮训练中同时运作三个角色,缺一不可:
🔵 出题者(Proposer):从技能库里领到一个技能包,按照其中的规则生成一道题 x,并同时生成一份隐藏的"验证契约" c,比如单元测试代码、约束检查器,用来自动判分。答题者看不到 c,只看到题目 x
🟡 答题者(Solver):什么工具都不给,只拿到题目 x,生成答案 y。环境用 c 来判断答案对不对
🔴 技能控制器(Skill Controller):收集每一轮的胜负信号,哪道题太难(全错)、哪道题太简单(全对)、哪些出题模式新颖有用,然后对技能库执行精炼(Refine)、剪枝(Prune)和诱导(Induce),让库中的技能包随着训练迭代进化。
三者不断咬合、相互激励,构成一个永不触底、也永不过载的学习飞轮。


▲ fly51fly 分享论文:包含框架动机对比图与系统总览
出"刚好半会半不会"的题
这里有个极其精妙的设计,值得单独拎出来说。
如果只告诉出题者"要出难题",它会钻空子:故意造出病题、无解题,制造假难度,然后坐收奖励。这个漏洞在很多类似框架里被真实观察到。
Skill-SP的解法是:有效性优先,难度次之。
系统先用验证契约检查这道题本身是否合法、可解;对合法的题,再按求解成功率 v 靠近 0.5 的程度打分。太简单(答题者全对)或太难(全错)的题,学习价值都低;只有"刚好在能力边界附近"的题,才能给模型带来最大的成长拉力。
这正是课程学习(Curriculum Learning)的精华,难度始终贴着模型的成长边界移动,随训练进程动态调整。
一位韩国博主在社区帖子里把这套机制写得很传神:
Proposer追求的是有效且当前Solver约有50%概率能解的题。



▲ @code_n_money 用韩文详细拆解 Skill-SP 的出题机制,附上了条件概率生成公式
数字来了:Mistral从"不会用工具"到全面开窍
说了这么多机制,实验数据才是最有说服力的语言。
论文在两大任务族上跑了实验:工具调用(API-Bank + BFCL)和逻辑推理(ZebraLogic谜题)。骨干模型从3B到14B,横跨Qwen3、Ministral-3、Granite三个家族。
工具调用综合得分(Base → Skill-SP):
| +6.5 | ||
| +2.8 | ||
| Ministral-3-8B | 20.7 → 63.6 | 🚀 +42.9 |
| Ministral-3-14B | 22.2 → 64.5 | 🚀 +42.3 |
| +5.3 |
Ministral系列的数字看得人头皮发麻,起点只有20分出头,几乎完全不会用工具;经过Skill-SP训练后,直接跳到64分。增益超过42分,接近翻三倍
为什么会这么夸张?原因正是那个矛盾的另一面:Ministral基础对齐太差,几乎无法独立合成有效训练样本,无引导的自博弈根本"转不起来";而有了技能库提供结构先验,训练回路才得以建立,模型才有东西可学。这一对比,把Skill-SP存在的必要性说得比任何理论解释都清楚。
逻辑推理方向同样有亮点:Ministral-3-14B从5.4分提升到17.4分,增益+12。没有技能引导的无引导基线(Unguided SP)在复杂逻辑谜题上结构性崩塌,根本无法合成出有效的训练循环。论文于是只用Skill-SP与Base对比,Unguided的失败本身就是一条隐含的强有力证据。
一个引发社区撕裂的哲学问题
数字之外,这篇论文在X(原Twitter)上引发了一场不大不小的思想争论。
矛盾点在于:把技能放进训练环,到底是在增强技能,还是在背叛技能?
Agent Skills最初的设计哲学,是"可发现、可插拔、可拆卸",就像手机App,随时装、随时删、不影响系统底层。用户可以给模型加一套炒股技能,也可以随时替换成医疗技能,模型核心不变。
Skill-SP则把技能放进训练环,通过训练将技能逻辑内化进模型权重。训练结束后,线上推理时,Solver甚至无需调用技能库,它靠的是参数里已经"学会"的东西。
有人(@identity_matrix)直接在评论里质疑:
把skills放进训练环,会不会削弱其灵活可拆扩展的初衷,把原本可拆卸的能力模块,变成训练流程内部的重型组件?
另一个声音(@frankyouchill)则从另一个角度看:
"技能更重要的用途,或许是决定模型下一步该学什么";回答眼前的问题只是其中一种用途。
这两种声音,代表了工程实践与学习理论两个截然不同的技能观。一个追求灵活可插拔,一个追求深层内化。它们都有道理,也都有边界

▲ 社区对"技能内化进训练"的哲学质疑
Qwen之外的研究动向
Jerry Li(@lijieisme)在7月28日的帖子里把Skill Self-Play与另外两篇论文并排摆在一起:NVIDIA的Molt(原生agentic RL框架)、以及Agentic Context Management(agent记忆管理)。他的结论很简短:
"2026的研究方向已经明朗了。"
的确从近期Hugging Face每日热门论文的趋势看,Agent训练、记忆与原生agentic RL已成为2026年毫无争议的研究主线。而Skill Self-Play,正好站在这条主线的一个关键节点上,它把"技能"这个词从产品词汇变成了训练词汇,从工程实践变成了理论框架。
代码已经完整开源,仓库地址 Qwen-Applications/skill-self-play,支持Qwen3、Ministral、Granite等多个骨干,附带API-Bank、BFCL、ZebraLogic全套评测数据,标配8卡GPU训练脚本,许可证Apache-2.0,任何人都可以拿来直接复现。

▲ arXiv 摘要页:论文于2026年7月24日正式提交,编号 cs.CL:2607.22529
尾声:那所没有人类老师的学校
回到最开始的比喻
那所学校现在有了更清晰的轮廓:出题老师、学生、还有一本会不断改版的"出题手册"。手册告诉老师出什么题、怎么判分;学生进步了,手册随之升级,让题目继续贴着学生的能力边界,永远在"刚好半会半不会"的甜蜜区间里施压。
AlphaZero用这个逻辑在围棋上打败了全人类。Skill-SP把同一套逻辑,拆成可更新的技能模块,试图迁移到无边界的语言与工具世界。
能走多远,还是未知数 Large/X-Large难度的逻辑谜题上,进展依然有限;技能能否迁移到论文评测套件之外,社区仍存疑虑。但从现有结果看,Ministral从20分跳到64分的这条折线,已经显出这套方法的潜力。
AI正在学会教自己而这,可能只是开始
论文:https://arxiv.org/abs/2607.22529代码:https://github.com/Qwen-Applications/skill-self-play
夜雨聆风