想象一下这样一个场景:一个AI,不需要人给它出题,也不需要人帮它批改,它自己一边出卷、一边作答、一边升级课程,而且,越练越强,不会乱,不会崩。
听起来像科幻?阿里巴巴通义千问团队在2026年7月底发布的新研究,就实现了这样的训练循环。
一道横亘AI界的世纪难题
过去几年,大语言模型的训练正在经历一场范式革命:从“人工喂数据”走向“自我驱动进化”。自我对弈(self-play)是其中最性感的一条技术路线,模型分饰出题者与答题者两个角色,靠互相加压来生成训练信号,减少对昂贵人工标注的依赖。
但这条路几乎每走几步就会撞上同一堵墙。
一边是“笼子里的强者”:把训练绑死在代码执行器、棋盘游戏这类可验证环境里,奖励信号清晰,但任务种类被环境死死框住,模型只能在固定赛道上越跑越快,出不了圈。另一边是“自由散漫的烂摊子”:让模型随机自由造题,覆盖面倒是宽了,但造出来的题满是病题、伪题、重复模板,所谓的“过滤器”不过是被动地扔掉明显的坏苹果,根本无法教会生成器什么叫“一道好题”。多轮迭代之后,合成数据里的错误与偏差越积越深,不但没有进步,反而开始退化,这就是令人头疼的合成数据塌缩。
可验证、可覆盖、可扩展,三者不可兼得,这是一道摆在所有AI研究者面前的死局。


▲ Rohan Paul对论文的解读:Skill Self-Play将Agent技能从“运行时说明书”改造成了“训练时课程引擎”
一招破局:让“技能”当中间人
阿里通义千问团队的解法,简洁得令人拍案叫绝:在出题者和题目之间,放一个“技能库”。
这里的“技能(Skill)”,借鉴自Anthropic 2025年发布的Agent Skills工程实践,把领域流程写成可发现、可加载的知识包,需要时再调用。但Skill-SP做了一个颠覆性的用途挪移:技能在这里负责告诉系统怎么出一道合格好题,为任务生成提供结构模板。
技能包里装着什么?题型规则、构造方法、以及一套可执行的“验证契约”,比如单元测试、参数约束、逻辑检查器。有了这个契约,系统就能在答题结束之后,用程序判定答案对不对,而不依赖昂贵的人类打分或者含混的“多数投票”。
用更通俗的比喻来说:学校同时养三类角色,出题老师、学生、还有一本会自己改版的“出题手册库”。手册规定题型模板,自带判卷规则;学生变强之后,手册继续升级,始终把难度对准“学生刚好半会半不会”的那条线。


▲ 7月27日,Hugging Face Daily Papers将本文列为当日热门,标注“Qwen Business Unit”
三个角色,一台永动机
Skill-SP把整个训练循环拆成三个共进化的模块:
Proposer(出题策略):在技能库路由出的技能条件下,生成任务实例。每道题包含两部分:学生能看到的题目文本,以及隐藏的机器可读“验证契约”。
Solver(求解策略):只看题目,不看答案,生成解答。环境用契约判定对错,给出0到1之间的验证奖励。关键点在于:推理部署时,最终的Solver仍然只靠提示词工作,技能库是训练时的基础设施,不会被强行塞进线上推理路径。
Skill Controller + 演进技能库:汇总每轮训练的失败信号、新颖样本与任务效用,触发技能的精炼、剪枝与诱导,让技能包随着迭代轮次持续更新。
但这里有一个至关重要的设计细节,光出难题是不够的。如果只鼓励出题者"越难越好",它会钻空子:造出无解的病题或者根本无法验证的假难度,制造虚假分数。Skill-SP因此采用了门控式课程奖励:先用有效性过滤器判断题目是否成立,再对有效题按求解成功率靠近50%的程度打分,太容易或太难,学习价值都低。
这个逻辑,和AlphaZero式课程惊人相似,只不过“棋盘”从有限规则的游戏,换成了无边界的语言任务空间。
此外,论文还强调了一个防退化的关键设计:双流架构,一路由技能引导稳定出题,另一路做开放自由探索。如果训练池全部来自技能库,在API-Bank这类泛化评测上反而会变差;把探索得到的新模式沉淀成新技能,才能在“稳定”与“覆盖”之间维持动态平衡。
数字会说话:Ministral从20分打到64分
论文在两大任务族上做了检验:工具调用(API-Bank L1–L3 + BFCL)与逻辑推理(ZebraLogic逻辑网格谜题)。骨干模型横跨3B到14B,包括Qwen3-4B、Qwen3-8B、Ministral-3-8B/14B、Granite-4.1-3B。
结果一览:
| +6.5 | |||
| +2.8 | |||
| Ministral-3-8B | 20.7 | 63.6 | +42.9 |
| Ministral-3-14B | 22.2 | 64.5 | +42.3 |
| +5.3 |
Ministral系列的数字,是整张表格最震撼的部分。 从20分出头到64分,模型由几乎无法工作跨到了具备实用价值的区间。原因在于:当基座模型连最基本的工具schema都遵循不了,无引导的自我对弈根本造不出有效训练样本,整个学习回路直接卡死。但有了技能编排,系统能从模型当前的零点开始,一步步拉升,训练回路就这样被重新转了起来。
逻辑推理一侧,Qwen3-8B在ZebraLogic上从23.6分涨到32.4分;而无引导基线在复杂谜题上结构性崩塌,无法合成有效训练样本,连对照实验都无法成立,这本身就是技能编排价值最有力的注脚。


▲ Winston B. 点出类比AlphaZero课程的关键:“棋盘”换成了无界语言任务,验证构成关键支撑
技术圈的两种声音
消息一出,X(推特)上的反应迅速分成了两个阵营。
一派是热情拥抱技术分析账号Franky直接点破了这篇论文的概念革命意义:“大多数Agent Skills在runtime被调用;Skill-SP把技能库放进了training loop。” 他的结论带着一丝哲学意味,“技能更重要的用途,或许是决定模型下一步该学什么。”
另一派则冷静发问Winston B.用AlphaZero做了精准类比之后,抛出了一个没有被论文解答的问题:这些技能能否迁移到论文任务套件之外,抑或会越来越擅长满足系统内部的校验器?

▲ 有声音追问:把Skills放进训练环,会否削弱其作为灵活可插拔扩展的初衷?
这个质疑触碰到了一个更深的概念张力。Anthropic在2025年定义的Agent Skills,是**“运行时可拆卸的能力插件”;而Skill-SP把技能内化进训练循环,某种程度上让技能从轻量级说明书,变成了训练基础设施里的重型组件**。两者共享同一个词,但设计哲学迥然不同。
这场争论没有结论,但本身就意味深长。
论文之外,还有完整代码
阿里同步开源了完整代码仓库 Qwen-Applications/skill-self-play,目录里的 skill_library/、train-*-skill-*.sh 与基于VERL框架的训练脚本,让“技能路由,校验,前沿课程,库更新”这整条链路可被第三方逐行审查,实现范围覆盖了整张架构图。
有观察者把这篇论文与同期Hugging Face热榜上的另外几篇Agent训练、记忆管理工作并列,认为2026年的技术主线已经清晰浮现:AI正在从被动回答问题的工具,逐步学会主动规划自己的成长路径。
课程学习、可验证奖励、技能工程,这三条过去分散在不同研究方向的线,正在Skill-SP这个框架里交汇成一条新的主干道。
至于终点在哪里?没有人知道但有一件事是确定的:当AI开始为自己设计课程,人类设计者的角色,也正在悄悄发生改变。
论文全文:arxiv.org/abs/2607.22529开源代码:github.com/Qwen-Applications/skill-self-play
夜雨聆风