乐于分享
好东西不私藏

阿里Qwen让AI学会“自己出题卷自己”!三角色共进化,单模型工具调用暴涨42分,LLM后训练范式要变天了?!

阿里Qwen让AI学会“自己出题卷自己”!三角色共进化,单模型工具调用暴涨42分,LLM后训练范式要变天了?!

想象一个永不停歇的补习班,老师和固定教材都缺席,学生自己出题、自己答题、教材还会跟着学生的成长自动升级,永远卡在"刚好会一半"的甜蜜难度带上,逼着人不断突破。

这段设想并非科幻情节阿里巴巴通义千问团队刚刚公开的一篇论文,正在做的正是这件事。

一张论文,搅动AI训练圈

2026年7月24日,阿里巴巴通义千问大模型应用团队悄悄在arXiv挂出一篇论文:

《Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills》

发布会和媒体通稿都缺席代码仓库 Qwen-Applications/skill-self-play 同步开放,Apache-2.0 许可证,全部源码公开可跑。

结果几天之内,Hugging Face Daily Papers 把它标成当日热门,技术社区的讨论帖迅速蔓延,从英文推特到韩文技术博客,从学术账号到产品从业者,所有人都在问同一个问题:

AI的自我进化,终于找到了那把正确的钥匙吗?

▲ HuggingFace Daily Papers 将其列为当日热门,摘要直指三角色共进化框架

旧问题,死结

要理解这篇论文的价值,先得明白一件事:AI的后训练,正在遭遇一场深层的矛盾

大语言模型已经告别了"堆人工标注"的蛮荒时代,进入了"自我对弈驱动进化"的新纪元。逻辑很简单:让模型分饰出题者和答题者,互相加压,用强化学习迭代,减少对人工数据的依赖。

但问题是,这条路上有两堵墙:

第一堵墙:环境绑定 把训练钉在代码执行器、游戏模拟器上,奖励信号清晰,但任务种类被"笼子"框死,出了这个领域,啥也不会。

第二堵墙:自由生成的混乱 让模型"想出什么考什么",然后事后过滤烂题,听起来自由,实际上是一场灾难。模型会造出自相矛盾的题、无解的题、一模一样的题。 过滤器只会扔掉坏样本,却永远教不会模型"怎么出一道好题"多轮迭代下来,错误与偏差滚雪球式累积,出现所谓"合成数据塌缩",越练越歪。

这个死结,卡住了无数研究团队

直到Qwen团队带着一个词出现了:Skill(技能)

破局:把技能塞进训练循环

论文的核心思路,可以概括为:

技能应当在出题之前介入训练,而非等到答题时才登场。

这听起来很抽象,但实际上极其精妙

过去,AI的"技能"是推理时才加载的说明书,模型要调用什么工具,临时翻一翻。Qwen团队的做法,是把技能重新定义为一种"出题模板接口":每个技能里面,打包了题目生成规则、示例、提示,以及尤其重要的可执行验证契约

技能为出题引入了结构先验验证契约的存在,让每一道题生成的那一刻,就自带了判卷标准。

这就是 Skill Self-Play(技能自我对弈) 的核心杠杆。

▲ 论文动机图:环境绑定(左)vs 无引导生成(中)vs Skill Self-Play的中间地带(右)

三个角色,共同进化

整个系统里,有三个共同进化的组件,构成了一个永不停歇的自我升级回路:

① Proposer(出题者)

它的输入是从技能库里路由来的一个 skill,输出是两样东西:x,求解者看得见的题目,和 c,隐藏的、机器可读的验证契约(单元测试、约束检查器、参考答案)。

(x, c) ~ π_propose(· | s)

这道公式的含义是:题目和验证规则,都由技能结构来约束生成。技能是锚,防止出题者漂移

② Solver(答题者)

它什么都看不到,只拿到题目 x,给出答案 y环境拿验证契约 c 来判分:对就是1,错就是0,判分只留下二元结果。

关键细节:训练完毕后,推理部署时的solver,只靠提示词,不依赖技能库技能负责支撑训练阶段,线上部署无需携带它。

③ Skill Controller + 演进技能库(Evolving Skill Library)

这是整个系统最聪明的部分它汇总所有失败案例、新颖样本、成功率数据,持续对技能库做三件事:精炼(refine)、剪枝(prune)、诱导(induce)

技能库持续变化它随着模型的成长而升级,始终知道"下一课该考什么"。

"永远卡在50%难度带"的妙处

但最精妙的一刀,藏在课程设计里

如果奖励机制只是"越难越好",出题者会立刻找到捷径:造出根本无解的题,制造假难度。这是所有自博弈系统都会遭遇的对齐难题。

Skill-SP的解法是:门控式课程奖励

先用有效性过滤器判断这道题是否成立;对有效题,再奖励求解成功率最接近50%的那些题。

太简单?没学习价值太难?模型根本无法从错误中获得有效信号。那些"刚好在能力边界上"的题,构成了高价值课程。

这个逻辑,在社区引发了大量共鸣有人把它类比AlphaZero的课程机制:

"这和AlphaZero式课程是同一个把戏,只不过'棋盘'换成了无界的语言任务空间。", Winston B. (@DoDataThings)

▲ Winston B. 将Skill-SP类比AlphaZero,同时提出迁移性的尖锐质疑

数字说话:Ministral从废物变成满分

理论再漂亮,不及数字有力

工具调用任务(API-Bank + BFCL合并平均):

骨干模型
训练前
Skill-SP后
绝对增益
Qwen3-4B
60.2
66.7
+6.5
Qwen3-8B
69.4
72.2
+2.8
Ministral-3-8B
20.7
63.6
🔥 +42.9
Ministral-3-14B
22.2
64.5
🔥 +42.3
Granite-4.1-3B
57.2
62.5
+5.3

Ministral系列的数字,堪称本文最大的戏剧性时刻。

20分跳到63分堪称一次"救活"

论文的解释是:Ministral基础对齐本来就很差,几乎无法独立生成有效的工具调用任务。无引导的自博弈在这里彻底失灵,没有一道好题,强化学习就无法转动。技能结构让训练回路得以启动

逻辑推理(ZebraLogic谜题)方向,Qwen3-8B从23.6→32.4,Ministral-3-14B从5.4→17.4,同样显著。唯一的遗憾是:对于最复杂的"超大型"谜题,即使加了技能,提升仍然有限,自博弈系统有个无法绕开的门槛:模型得先有最低限度的能力,才能产生有效的学习信号。

一个词,两种哲学

这篇论文在社区引发的讨论,有一条隐藏的暗流,值得细细品味。

用户Franky.(@FrankYouChill)说了一句很有穿透力的话:

"大多数agent skills,是在运行时被调用的。Skill Self-Play,把技能库放进了训练循环。"

▲ Franky点出了Skill-SP最核心的哲学位移:从runtime到training loop

这句话触碰到了整件事最深层的张力。

Anthropic曾在2025年10月发布一篇工程文,把Agent Skills定义为可随时插拔、可发现、可加载的知识模块,"需要时才读",像一本随时可翻的工具手册,强调灵活性与可移植性。2025年12月,这套标准甚至发布成了跨平台开放标准。

Skill-SP引用了同样的"技能"概念,却把它送进了完全不同的战场:技能进入训练循环,负责帮系统持续造出下一课。

有人因此追问:"这会不会削弱skills作为灵活、可插拔扩展的初衷?" 把原本可拆卸的能力模块,变成训练流程内部的重型组件,是一种背叛,还是一次升维?

这个问题,论文没有给出答案它甚至不打算给 这是属于整个行业的开放命题

仍在燃烧的问题

Jerry Li(@lijieisme)在当天的HuggingFace热门论文列表里,把Skill Self-Play和NVIDIA的Molt(原生agentic RL框架)、Agentic Context Management并排列出,并写道:

"2026年的研究主线已经浮现。"

▲ Jerry Li将Skill-SP列入agent训练主线,认为2026方向已清晰

也许是的但Winston B.的质疑同样尖锐,同样值得铭记:

"基准分数上涨之后,还要检验这些技能能否迁移到论文任务套件之外,抑或只擅长满足自家的验证器?"

这个问题,无法从论文里找到答案答案要交给时间与第三方复现,并在论文精心设计的"小世界"之外,接受真实任务的洗礼。

代码已经开放,挑战已经抛出

技能进化能否完成自举,抑或只是一个更精巧的自我欺骗?

答案,就等整个社区来揭晓了

论文:https://arxiv.org/abs/2607.22529代码:https://github.com/Qwen-Applications/skill-self-play