一篇新论文在AI研究圈掀起波澜
2026年7月24日,阿里巴巴通义千问(Qwen)大模型应用团队悄悄在arXiv挂出一篇论文。发布会和新闻稿都未出现,页面只附了一个GitHub链接。这篇论文让全球AI研究圈开始重新思考一个已经被讨论了好几年、却始终没有完美答案的问题:
AI,究竟能否实现"自我进化"?
一道悬而未决的难题
先说背景
近年来,自我博弈(Self-Play) 是AI训练领域最热门的方向之一,核心思路很简单:让AI自己给自己出题、自己解题,在这个过程中螺旋上升,越来越强。
AlphaZero就是这条路的神话:不靠人类棋谱,纯靠自我博弈,几天内就打败了世界顶尖围棋程序。
语言模型面对的是开放任务,缺少棋类那样固定的规则和终局判定。
于是大家发现,把自我博弈搬到大语言模型上,会掉进两个坑里。
第一个坑:"环境牢笼"把AI关进代码执行器、游戏模拟器,验证结果确实可靠,但任务空间被死死锁住,模型只会越来越擅长"这个格子里的事",一出门就抓瞎。
第二个坑:"噪声地狱"让AI自由发挥、随便出题,覆盖面倒是广了,但生成的题目里充斥着矛盾题、无解题、"出题者自己都不知道答案对不对的题",训练一轮比一轮混乱,数据质量在多轮迭代中坍塌式崩溃。
这就是困扰业界的自我博弈两难困境:要么深度,要么广度,二者似乎不可兼得。
通义千问的"破局一刀"
Qwen团队的解法,既简洁又漂亮:
在出题者和解题者之间,加入一个"技能库"。

▲ Skill-SP框架总览:技能库、提议器、求解器三方共演化,构成自驱动训练课程引擎
这篇论文的名字叫做 Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills(技能自我博弈:用共演化技能推进大语言模型能力边界),作者来自阿里巴巴通义千问大模型应用团队及多所高校合作方。
它的核心机制,是把"技能"从推理时的外挂插件改造成训练时的课程引擎。
在他们的框架里,被称为 Skill-SP,模型不再乱出题,而是先从一个"技能库(Skill Library)"里拿到一份"出题说明书":这道题该考什么类型、怎么出才算结构正确、怎么自动判断答对了没有。有了这份说明书,出题器(Proposer)出的题才算"有根之木";解题器(Solver)答完之后,有一个可执行验证器(Executable Validator)给出明确的对错反馈。
而这个技能库,本身也在随着训练不断进化,旧技能被精炼、用处不大的被剪掉、全新的技能从训练轨迹里被"诱导"出来。
三个部分,技能库、出题器、解题器,形成一个持续共同进化的闭环。
成绩单有多亮眼?
别急,先看成绩单
实验横跨两大任务族:工具调用(API-Bank + BFCL函数调用基准)和逻辑推理(ZebraLogic约束谜题),在五个规模从3B到14B的主流骨干模型上全部测试。
工具调用结果(Table 1):
| +6.5 | ||
| +2.8 | ||
| Ministral-3-8B | 20.7 → 63.6 | +42.9 |
| Ministral-3-14B | 22.2 → 64.5 | +42.3 |
| +5.3 |
那个42.9,没有看错
Ministral-3-8B在工具调用上,从20.7分直接跳到63.6分。这个幅度远超常规微调论文解释,Ministral系列的基础模型本身在工具调用的schema对齐上极为薄弱,自己根本造不出有效的训练题,导致无引导自我博弈几乎完全停转,学习信号为零,训练等于白训。而Skill-SP的技能库,相当于给了它一根"助力棒":你先学会这个范式怎么出题,再一边出题一边练。
这个结果也侧面展示了Skill-SP的价值:强模型可以继续提升,弱模型也获得了"从零冷启动"的机会。
它究竟是怎么做到的?
技术核心,值得深挖一下
Skill-SP最精妙的设计,是一个叫做"前沿奖励(Frontier Reward)"的机制。
训练中,课程该多难才合适?太简单,模型学不到东西;太难,学习信号崩掉Skill-SP给出了一个优雅的回答:成功率大约在50%左右的题,才是最好的题。
数学上,这个奖励函数写成:
R_propose = 1{题目有效} · (1 − 2|v_solve − 0.5|)
越接近50%成功率,奖励越高;完全解不开或者一秒秒过,奖励归零这逼着出题器持续在求解器的"能力边界"附近生成任务,就像一个私教,永远知道你现在能做多难的题,难一点点,刚好够你跳一跳够到。
同时,Skill-SP设计了双流生成机制:一条"技能流"按照技能库的结构先验出题,保证深度和可验证性;另一条"探索流"完全自由发挥,防止模型只会在技能库框定的范式里打转,两条流的混合,才是课程训练池。
消融实验显示每个组件都发挥了作用:冻结技能库,总分掉2.3分;冻结出题器,掉2.1分;把探索流去掉、只用技能流,API-Bank泛化直接恶化。缺一不可
"技能"究竟是什么?
这里有一个概念需要澄清,因为它很容易和另一个东西搞混。
你可能听说过Claude的Agent Skills,那是Anthropic在2025年10月发布的运行时能力包,类似可按需加载的"技能插件",帮助模型在部署时处理特定任务,比如做表格、遵循品牌规范,是给用户用的功能模块。
Skill-SP里的"技能",用途与之完全不同。
在Skill-SP里,每个技能s被定义为一个元组 s = ⟨路由元数据, 规则, 提示, 示例, 可执行验证器, 使用统计⟩,它是一个任务模式接口,存在的唯一目的,就是告诉出题器"这类题该怎么出、怎么验"。
训练结束后,技能库本身不随模型一起部署。 用论文原话:推理阶段的最终求解器是prompt-only,不再依赖技能库作为运行时扩展。Skill-SP把技能彻底用在了刀刃上,训练时,燃尽;上线后,不留痕
AI研究者Winston B.将其类比为AlphaZero式课程:技能本身成为可验证单元,"棋盘"则扩展为无界的语言任务。
开源了,就是现在
论文提交次日,GitHub仓库随之公开:Qwen-Applications/skill-self-play。
仓库目录清晰:技能库(skill_library)、工具调用(tool_call)、逻辑推理(logical_reasoning)、分布式训练组件(verl),以及一批开箱即用的训练启动脚本,默认假设8张GPU,出题器占前四张卡,求解器跑满八张。论文中还透露:初始技能库包含约15个通用工具调用技能包和8个ZebraLogic逻辑谜题技能包;整个训练跑五轮迭代,技能库的诱导与精炼只占端到端墙钟时间的6.5%,技能演化的开销,比你想象的要小得多。

▲ Qwen-Applications/skill-self-play GitHub仓库首页,代码已按工具调用与逻辑推理两条线完整组织
但质疑的声音也出来了
也有人提出反问
在一条讨论帖的回复里,网名naeem(@identity_matrix)提出了一个尖锐的问题:
"这不就破坏了技能'灵活、可拆卸扩展'的本意吗?"
这个质疑有它的逻辑:如果技能被深度嵌入训练循环,和模型绑死,那么"技能可插拔"这个最迷人的特性是否会名存实亡?
Winston B.从另一个角度提出隐忧:基准分数上涨之后,这些技能学到的东西能否泛化到论文任务套件之外,抑或只会越来越擅长取悦自己的验证器?
这个问题,也是整个可验证强化学习领域的共同难题:如果模型只学会"让验证器开心",该怎么办?
论文自身也诚实地承认了边界:在极难的大规模逻辑谜题上,起点太弱的模型仍然很难突破,学习需要一个能力门槛,弱到一定程度,连有效题都造不出来。
方法的意义
把Skill-SP放回2025,2026年agent研究的大地图上,你会看到一条清晰的曲线:
从固定环境可验证RL(靠执行器给反馈),到开放合成+事后过滤(靠多数投票筛样本),再到模块化、可执行、可演化的技能接口同时承担出题先验与校验边界,
每一步,都在试图回答同一个问题:AI的自我进化,能不能不依赖人类标注、不依赖更强的教师模型,从内部生长出来?
Skill-SP给出的答案是:可以前提是给"自我出题"这件事装上结构先验,给"自我验证"这件事装上可执行的牙齿。
一个能自己决定"下一步该学什么"的AI训练范式,也许会成为通用智能体能力进化这条路上的重要一步。
而它,已经开源了
论文地址:arxiv.org/abs/2607.22529代码仓库:github.com/Qwen-Applications/skill-self-play
夜雨聆风