乐于分享
好东西不私藏

AI不需要人类出题了!阿里千问“技能自我博弈”震撼开源:让模型自己造题自己刷,能力暴涨43%,还改写了训练的课程生成方式!

AI不需要人类出题了!阿里千问“技能自我博弈”震撼开源:让模型自己造题自己刷,能力暴涨43%,还改写了训练的课程生成方式!

想象这样一个场景:一个学生不仅自己刷题,还自己出卷子,而且出的每一道题,都精准卡在他当前能力的极限边缘不太难,不太简单,恰好是那种"做完会成长"的题。

这幅近似教育乌托邦的图景,正是阿里巴巴通义千问团队刚刚发布的新论文在做的事。

2026年7月24日,Qwen大模型应用团队与多所高校合作,在arXiv挂出论文《Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills》,代码同步开源。这篇论文做了一件听起来很简单、但细想极其颠覆的事:把AI的"技能库",从推理时的外挂工具包,变成了训练时的自动出题引擎。

消息一出,技术圈迅速炸开了锅

一个折磨了整个AI行业的问题

先来说说AI自我进化这件事,为什么这么难。

过去两年,AI圈里有一条热门赛道叫做Self-play(自我博弈),让模型自己给自己出题、自己作答、自己从反馈里学习,从而摆脱对人类标注数据的依赖。听起来是无限能量的永动机,对不对?

但现实很骨感这条路上有两个深坑,几乎所有团队都掉进去过。

第一个坑:把模型关进一个狭窄的"可验证沙盒"比如让它只在代码执行器或棋盘游戏里训练,反馈精准,但任务空间被死死锁住,根本练不出更通用的智能体能力。

第二个坑:放开让模型自由出题,然后事后过滤烂题任务数量多了,模型自己造出来的题却千奇百怪:逻辑矛盾的题、答案根本验证不了的题、同一个模板反复复制的题,事后再怎么过滤,也只是被动的筛子,根本没教会模型"什么叫一道好题"。多轮迭代下去,合成数据质量会雪崩式坍塌

Qwen团队直接在论文里点出了这个两难困境:一边是"可靠但太窄",另一边是"够广但太脏"。

那有没有第三条路?

技能,开始承担出题任务

这是整篇论文最核心、也最反直觉的一个转身。

说到"AI技能(Agent Skills)",大多数人脑子里浮现的画面是:给Claude装一个财务分析插件、一个代码执行器,让它在回答问题时随时调用。Anthropic在2025年10月就是这么定义Skills的,可组合、可移植、按需加载的运行时能力包

Qwen团队把这个概念劫持了,然后把它彻底改造。

在Skill Self-Play(Skill-SP)里,"技能"负责充当训练阶段的出题模板,和推理时的答题工具有着完全不同的定位。 每个技能包里装着生成任务的规则、提示词、示例,核心组件是一个可执行的验证器(executable validator)

这个区别,就是一切的根源

有了验证器,模型造出来的每道题都能被机器自动判断"这题本身有没有问题"。结构规则把天马行空的生成限制在一套合理的框架内。技能库则将每一次试错经验压缩成可复用的出题知识,供下一轮继续使用。

韩国技术博主code_n_money将这个变化概括为:技能在这里充当出题器。

▲ Skill-SP框架:技能库驱动Proposer出题,Solver作答,环境验证,再反过来更新技能库,形成完整的共演化闭环

三个玩家,一台永不停转的出题机器

整个系统由三方共同演化,节奏环环相扣。

Proposer(出题器):根据技能库生成任务,目标锁定在当前Solver大概有50%概率解出来的题太简单,学不到东西;太难,连学习信号都没有这个"恰好在能力边界"的设计,和AlphaZero在棋类AI里的课程设计思路如出一辙。

奖励机制也因此被精心设计成一个门控公式:无效题得零分;偏易或偏难的题得分低;落在约50%成功率附近的有效题才能拿高分。 这就彻底堵死了Proposer通过造"不可能解的题"来刷高难度分的作弊漏洞。

Solver(解题器):只看到题目本身,不知道背后的技能库,老老实实作答。

技能演化控制器:这是整个系统的"大脑"。每一轮结束后,它会做三件事:精炼现有技能(从失败轨迹里提取经验)、剪除那些只会生成无聊题的饱和技能、诱导全新技能(从那些没有技能约束的开放生成流里发现新模式)。

为了防止系统退化成只会在技能框架里打转,论文还保留了一条探索流(exploration stream),一部分时间完全不用任何技能,让模型自由发挥,专门用来发现现有技能库还没覆盖到的新领域。

这就是论文里说的"双层优化(bilevel optimization)":内层训练Solver,外层优化"如何出好题"。两层同时跑,互相推动

数字,会说话

接下来是最让人震撼的部分

论文在五个骨干模型上(参数量从3B到14B)做了系统实验,任务分两大类:工具调用(API-Bank + BFCL函数调用)和逻辑推理(ZebraLogic斑马谜题)。

工具调用的结果,直接看数字:

骨干模型
初始能力 → Skill-SP
增幅
Qwen3-4B
60.2 → 66.7
+6.5
Qwen3-8B
69.4 → 72.2
+2.8
Ministral-3-8B
20.7 → 63.6
+42.9
Ministral-3-14B
22.2 → 64.5
+42.3
Granite-4.1-3B
57.2 → 62.5
+5.3

看到Ministral系列那两行了吗?一个初始工具调用能力只有20%出头的模型,被Skill-SP直接训到了64%量级。 与此同时,无引导自我博弈(Unguided SP)在Ministral上几乎毫无进展,原因正是论文预警的那个:基座模型太弱,根本无法独立合成有效训练任务,没有技能库提供结构先验,整个学习回路就彻底启动不了。

逻辑推理侧同样有惊喜:Ministral-3-14B在ZebraLogic上从5.4%涨到17.4%,Small难度子集的提升甚至达到35个百分点量级

消融实验则用一组对照数字,回答了"技能库到底有多重要":冻结技能库,整体掉2.3分;冻结Proposer,掉2.1分;两者同时冻结,掉3.2分每一个组件拿掉,系统都会变弱,没有一块是多余的装饰

▲ 韩语技术博主将Skill-SP解读为"bilevel self-play课程学习",并详细拆解了双层优化目标

海外技术圈的讨论

论文上线后,很快引起了多位海外技术博主的讨论。

英文科技博主Rohan Paul将整个方法概括为"把agent skills变成训练时的课程引擎",并认为这个框架瞄准了"AI自我造题"本身的结构性缺陷

▲ Rohan Paul将Skill-SP概括为"evolving collection of verified task templates"推动自我改进

Franky.在推文里写道:"多数agent skills在运行时被调用;Skill Self-Play把技能库放进了训练环。或许技能更好的用途,是决定模型下一步该学什么。"

当然,质疑的声音也有有评论者问:这样做,会不会把技能从"灵活可拆卸的扩展能力"变成了"只服务于训练流水线的内部零件",从而消解了技能生态本来的价值?

还有人提出了更深的担忧:当验证器本身不完备时,模型会不会只是学会了"钻验证器的空子",却没有充分理解任务? 这个问题,论文没有完全回答,也是后续研究的最大未知数之一。

这件事,比看起来还要大

把视野拉宽一点,Skill-SP其实站在一条研究曲线的重要节点上。

从固定环境可验证RL(靠代码执行器、棋盘规则),到开放合成加事后过滤,再到用模块化、可执行、可演化的技能接口同时承担出题先验与校验边界,AI自我进化的工程路径,正在一步步走向成熟。

这篇论文的作者名单里,出现了与2025年《Search Self-play》重叠的研究者。那篇论文让模型在可验证搜索任务里自我对弈;这篇论文则把可验证结构抽象成了跨任务的技能包,同一个团队,正在系统性地把"可验证self-play"的边界往外推。

而且,整个实验框架已经全部开源(github.com/Qwen-Applications/skill-self-play),包含工具调用和逻辑推理两条完整训练线、8张卡的训练启动脚本,以及初始的15个通用技能包和8个逻辑谜题技能包。开源内容组成了一套可以直接跑起来的实验栈。

技能演化本身占整个端到端训练时间的约6.5%,换句话说,用极低的额外开销,换来了持续自动生成高质量课程的能力。

▲ arXiv:2607.22529,Submitted on 24 Jul 2026,cs.CL分类

模型,终于开始替人类操心"该怎么练"了

有一个问题,始终盘旋在Skill-SP的论文字里行间:如果AI能够决定自己的学习课程,人类的角色会变成什么?

在极弱基座模型上,Skill-SP依然难以冷启动,先给它一点"能力种子",才能让自我进化的飞轮转起来。人类标注与课程设计由此被前移到更早的环节:初始技能包的设计,仍然依赖人类判断与工程投入。

趋势已经显现:模型正在越来越多地接管"该练什么"这个问题,同时继续回答"这道题怎么做"。

技能库会继续长大能力边界会继续被推远而那个"恰好在能力极限处徘徊"的出题器,正在一轮一轮地把模型,推向它自己都不知道能到达的地方。

这,才叫自我进化