乐于分享
好东西不私藏

AI开始“自己卷自己”了!阿里通义千问发布Skill Self-Play:模型不靠人类出题,某骨干直接暴涨43分!

AI开始“自己卷自己”了!阿里通义千问发布Skill Self-Play:模型不靠人类出题,某骨干直接暴涨43分!

你有没有想过一个问题,大模型训练到最后,数据从哪儿来?

人工标注,贵且慢爬互联网,越来越贵让模型自己生成?好主意,但模型自己造的题,质量往往一塌糊涂:有些题毫无训练价值,有些答案无法验证,迭代一久甚至开始“自我崩塌”。

这道题,困扰了整个大模型训练界至少两年。

就在2026年7月,阿里通义千问大模型应用团队(Qwen Large Model Application Team)联合香港中文大学、中国人民大学、北京大学、苏黎世联邦理工学院等高校,悄悄放出了一篇重磅论文:

论文《Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills》,arXiv编号2607.22529。

代码已开源,Apache-2.0协议骨干覆盖Qwen3、Ministral-3、Granite。某些模型上,工具调用能力直接暴涨43分

▲ arXiv:2607.22529,cs.CL类别,阿里通义千问团队联合多所高校

自我进化的致命BUG:劣质题与假题

先看这件事究竟难在哪里

近年来大模型后训练有一条显学路线:让模型自己出题,自己做题,用可以自动判对错的奖励信号来做强化学习,也就是所谓的RLVR(可验证奖励强化学习)。

听起来完美代码能不能跑通,工具调用格式对不对,逻辑谜题答案符不符合约束,这些都能机器判断,不用人打分,干净利落。

但现实很骨感让模型自由出题,会遇到两个死局:

死局一:绑死在环境里 把任务生成绑在代码沙箱、游戏模拟器、检索引擎上,奖励是可靠的,但题目永远出不了那个小盒子,智能体能力的天花板就是盒子的边界。

死局二:放开生成,垃圾成堆 让模型自由发挥,过滤器再使劲筛,也只是被动删掉明显的废题,教不会模型“什么叫结构正确的好题”。练久了,合成数据质量螺旋下滑,业内管这叫模型崩塌(model collapse)

这两条路,一条困死,一条烂死

通义千问团队的回答是:你需要一个中间抽象。而这个抽象,恰好已经有人发明了,它叫 Agent Skill(智能体技能)。

一个词,两种命运

“技能(Skill)”这个词,AI界最近很火。

Anthropic的Claude平台有Agent Skills:按需加载的文件夹式资源包,内含说明、脚本、模板,模型在推理时判断相关性并挂载,用来做Excel表格、遵循组织规范、处理文档。插件逻辑,即插即用,用完即卸

▲ 传统产品意义上的Agent Skills:运行时按需加载,服务“此刻把任务做对”

通义千问团队做了一件看似简单、实则釜底抽薪的事:

把技能从“运行时的解题工具”,改造成“训练时的出题引擎”。

技能不再直接替模型答题技能负责告诉出题器:这类题该怎么出、结构是什么、怎么验证答案。

社区讨论中有一句概括:

"Maybe the better use of skills is deciding what the model should learn next."或许技能更好的用途,是决定模型接下来该学什么

这句话捅破了一层窗户纸

三个角色,一场永不停歇的军备竞赛

▲ Skill-SP框架全貌:技能库路由、任务生成验证、Proposer/Solver共进化、技能演化控制器

Skill Self-Play的核心是三个角色加一个不断生长的技能库,共同构成一个闭环军备竞赛

Proposer(出题者): 它从技能库里抽一个技能,在技能的“出题说明书”引导下,生成一道题 $x$ 和一份学生看不见的验证契约 $c$,可以是单元测试、参数约束、答案检查器。

Solver(答题者): 只能看到题面 $x$,看不到 $c$,凭自己的能力作答。环境用 $c$ 打分,不会把答案钥匙泄露给解题者。

Skill Controller(技能管理员): 它盯着失败率、新颖性、难度效用,定期对技能库做三件事:精炼(refine) 表述模糊的技能,剪枝(prune) 废弃反复出坏题的技能,诱导(induce) 从自由探索中归纳出全新技能类型。

技能库就像一份不断修订的“出题大纲”;Solver是那个被逼到能力边界的学生;Skill Controller是根据错题本重写大纲的教研组。

核心设计在这里: Proposer的目标避开纯粹的极限难度。论文把奖励函数设计成,Solver成功率约50%的有效题得分最高,太简单或太难都会被压低。这个50%有明确依据,它叫“能力边界(learning frontier)”,借鉴自教育心理学里的“最近发展区”:任务得比你现在略难一点,才能有效促进成长。

随着Solver越来越强,旧题自动变“太容易”,系统会自动把课程推向新的前沿。这是一台持续运转、永不停歇的能力推进机器。

数字会说话:某模型直接暴涨43分

实验在五个骨干上展开,从3B到14B:Qwen3-4B-Instruct、Qwen3-8B、Ministral-3-8B-Instruct、Ministral-3-14B-Instruct、Granite-4.1-3B。每个模型的Proposer和Solver从同一个检查点初始化。

与“无引导自博弈(Unguided SP)”对比,结果触目惊心。

▲ Rohan Paul对论文的解读:攻克“自产训练任务”的关键难题

工具调用任务(API-Bank + BFCL):

Qwen3-4B,总体分数从60.2升到66.7,+6.5Qwen3-8B约+2.8Granite-4.1-3B约+5.3

而Ministral-3-8B,起初schema对齐极差,模型几乎无法独立生成有效任务,无引导自博弈基本停滞,Skill-SP带来了+42.9的绝对分提升Ministral-3-14B约+42.3

这组数字的意义在于: 对于那些“几乎不会自己造题”的弱基础模型,无引导自博弈等于无效,因为整个训练回路根本建立不起来。而技能库提供的结构先验,相当于给出题器装了一副“脚手架”,哪怕基础极差的模型,也能从有效信号中开始学习。

逻辑推理任务(ZebraLogic斑马谜题):

五个骨干网格级准确率全部上升对较弱的Ministral-3-14B,网格级总体约+12.0,小规模谜题提升更大。

消融实验更能说明问题:把技能编排去掉,学习曲线更早平台;冻结Proposer或Solver的其中一方,分数都会掉;切断“用最新Solver估计边界难度”的反馈伤得最重,共进化是核心机制,缺了谁都会跛行。

社区追问:这改变了“技能”的本质吗?

▲ 开发者Franky.:技能从runtime走进了training loop

论文公开后,X上的讨论烧得很快

开发者Franky.写道:“Most agent skills get called at runtime. Skill Self-Play puts the skill library inside the training loop.(大多数agent技能是运行时调用的,Skill Self-Play把技能库放进了训练循环。)” 紧接着有人回复:“那这不就违背了skills作为灵活可拆卸扩展的初衷吗?”

▲ 网友质疑:把技能写进训练回路,是否改变了“即插即用”的产品定位?

这是个好问题把技能绑进训练,它还是“即插即用的模块”吗?

但论文和README都给了一个明确答案:最终的Solver在推理时可以保持prompt-only,不需要永久挂载技能库。 技能是训练时的脚手架,大楼盖好了,脚手架可以拆掉。

这与产品级Skills的思路是两条不同的轨道,不该混谈,尽管它们共享同一个“模块化程序化知识”的外壳。

分析师Winston B.则把这个框架类比为AlphaZero:

“验证单元落在技能上,即使任务空间扩大,校验仍可局部进行。” 榜单涨幅之后还有一场泛化考验:这些技能能否走出论文任务套件,抑或越来越擅长“应付自己的验证器”。

▲ “棋盘是无界语言任务”,AlphaZero式课程的语言模型版本

这一质疑直指自博弈领域长期的噩梦:过拟合验证器(reward hacking)模型可能只找到了欺骗验证器的捷径,并未学会目标能力。这个问题还要交给独立实验回答

一张更大的地图

Skill Self-Play已有一批前序研究铺路。

就在2025年,arXiv上出现了Search Self-Play(arXiv:2510.18821),同一个Proposer-Solver骨架,只是把“棋盘”换成了深度搜索场景,用检索结果做验证锚点。还有Absolute Zero(arXiv:2505.03335),走得更极端:完全零外部数据,让模型用代码执行器给自己出题,在代码与数学推理上达到有竞争力的表现。

这三条路,都在回答同一个问题:没有人工题库,Agentic RL还能跑起来吗?

Search Self-Play的答案是“用检索环境上锁”;Absolute Zero的答案是“用代码沙箱上锁”;Skill Self-Play的答案是:“用可演化的技能包上锁,而且这把锁本身也会随着训练一起生长。”

Hugging Face Papers页收录了这篇论文,自动推荐了一串2026年前后的相关工作:trace派生agent skills的自演化编码代理、技能自演化对比评估、多模态技能-策略共进化……

“技能”这个词,正在从产品功能词,悄悄变成训练、评估、记忆与路由的研究关键词。 Skill-SP站在这张地图的一个特定坐标上:技能服务自博弈课程,而非仅服务单次推理。

▲ Qwen-Applications/skill-self-play,Apache-2.0,目录结构完整,含多骨干训练脚本

最后一个问题

如果Skill-SP的主张成立,技能库是调和“验得稳”与“题够多”的合适中间件,那么未来可能出现一种有趣的合流:同一套技能描述,既能给在线代理加载,也能给离线训练出题。 技能市场与训练课程市场,或许是同一个市场。

如果主张不成立,技能库会退化成另一层依赖人工维护的提示工程,换了个名字的数据飞轮。

材料本身尚未给出最终判决工具调用与斑马谜题上的实证切片,是目前能看到的全部答案。

但有一点是确定的:大模型训练正在从“人工标注”走向“模型自己造题”,而如何让“自造题”不变成“造假题”,是未来一两年最值得盯紧的技术主线。

阿里通义千问交出了一份阶段性答卷。下一份,不知道会从哪里飞来

参考资料:arXiv:2607.22529;github.com/Qwen-Applications/skill-self-play;huggingface.co/papers/2607.22529