minimax发布DIVE:颠覆工具使用任务合成范式,让LLM泛化能力飙升22个百分点!
DIVE:颠覆工具使用任务合成范式,让LLM泛化能力飙升22个百分点!
AI前沿 | 顶会论文解读
论文标题:DIVE: Scaling Diversity in Agentic Task Synthesis for Generalizable Tool Use
作者团队:复旦大学、MiniMax联合团队
发表会议:arXiv预印本 (2026)
核心结论:通过反转任务合成顺序,先执行真实工具再推导任务,在9个OOD基准上平均提升22个百分点,比最强8B基线性能高68%,验证多样性扩展比数据量扩展更能提升泛化能力
📄 论文摘要
当前工具使用LLM在分布外(OOD)任务上泛化能力不足,核心瓶颈是训练任务多样性匮乏:现有方法要么局限于固定工具集和任务模板,要么难以保证合成任务的可验证性和可执行性。本文提出DIVE框架,通过反转任务合成顺序实现证据驱动的任务生成:先执行真实世界工具收集证据痕迹,再严格基于这些痕迹推导任务,从构造上保证任务的可验证性和可执行性。DIVE通过工具池扩展、任务工具集多样性控制和迭代的证据收集-任务推导循环,在金融、医疗、生物、学术等5个领域的373个工具上生成多样化任务。基于Qwen3-8B的实验表明,DIVE在9个OOD基准上平均提升22个百分点,比最强8B基线性能高68%,且多样性扩展比单纯数据量扩展更能提升泛化能力。
🏗️ 总架构设计
DIVE框架分为三个核心阶段:1) 多样化合成资源准备:构建包含373个工具的工具池(覆盖通用+4个专业领域)、实体种子池和任务示例池;2) 证据驱动任务合成:通过随机采样配置,执行真实工具收集证据痕迹,再基于痕迹迭代生成任务;3) Agent训练:先通过SFT获取工具使用能力,再通过RL优化分布外任务性能。整个流程从构造上保证任务的可验证性和可执行性,同时最大化任务多样性。

图2:DIVE整体架构设计
💡 核心创新点
▪ 反转任务合成顺序:颠覆传统”先生成任务再验证”的范式,改为先执行真实工具收集证据痕迹,再基于痕迹推导任务,从构造上保证每个任务都可验证、可执行,无需事后质量检查。
▪ 可控多样性扩展:通过工具池覆盖(5个领域373个工具)和任务工具集多样性(每个任务随机15-50个工具),系统扩展任务的结构多样性,避免模板化任务导致的过拟合。
▪ 迭代任务优化循环:通过证据收集-任务推导的迭代循环,逐步生成更复杂的多步骤工具使用任务,诱导模型学习多样化的工具调用模式,而非单一工具使用流程。
🔬 关键方法与实验结果
实验采用Qwen3-8B作为基础模型,使用48k SFT数据和3.2k RL数据进行训练。评估覆盖3个层级9个基准:同分布任务(L1)、通用工具OOD任务(L2)和专业工具OOD任务(L3)。结果显示DIVE在所有基准上均显著优于基线模型,特别是在专业工具任务上提升最为明显。

图3:Scaling分析结果,多样性扩展比数据量扩展更能提升泛化能力
Scaling分析验证了三个核心结论:1) 多样性扩展比数据量扩展更重要:用12k多样化数据训练的模型性能优于48k单一模板数据训练的模型;2) 工具池扩展比工具集多样性更能持续提升性能;3) RL进一步放大多样性优势:随着多样性增加,RL与SFT的性能差距从4.6个百分点扩大到5.6个百分点。
| 模型 | OOD基准平均 | Toolathlon | 相对8B基线提升 |
|---|---|---|---|
| Qwen3-8B(base) | 13.2 | 0.9 | – |
| WebExplorer-8B | 18.5 | 0.3 | – |
| DIVE-8B(RL) | 35.4 | 8.3 | 68% |
🚀 应用价值与展望
DIVE框架为工具使用LLM的训练提供了全新范式,可广泛应用于金融数据分析、医疗辅助诊断、学术研究助理等需要复杂工具调用的场景。通过在真实工具上生成多样化任务,模型能够更好地适应真实世界的不确定性和任务多样性。未来研究可进一步扩展工具覆盖范围,优化任务合成效率,探索多模态工具使用场景,以及将DIVE与模型架构优化结合,进一步提升工具使用LLM的泛化能力和性能。
📚 论文原文:https://arxiv.org/pdf/2603.11076
💻 相关资源:项目主页
🎯 核心亮点:反转任务合成顺序,用真实工具痕迹生成可验证任务,多样性扩展显著提升LLM泛化能力
⭐ 觉得文章有用?欢迎分享给更多朋友!
💡 关注公众号,获取更多顶会论文深度分析
🔥 每日精选AI论文,解读最新技术进展
夜雨聆风