当 AI 连续搜索、阅读资料、组织答案,却依然没有答对时,这一整段过程是不是只能算作“零分”?一篇来自奇瑞集团NEXTAI智能研究院的新论文提出:与其把所有失败一笔勾销,不如先分清它究竟是“证据没找够”,还是“证据找到了,但答案没说好”。
EviBack: Search-Agent Reinforcement Learning via Evidence-Constrained Teacher Backoff
项目主页:https://chery-nextai.github.io/eviback/
开源主页:GitHub - chery-nextai/eviback
arXiv Paper:https://arxiv.org/pdf/2607.23955
奇瑞NEXTAI智能研究院:https://github.com/chery-nextai
点击观看视频
AI 已经会搜索,但还不太会“从失败中学习”
我们熟悉的大语言模型,知识主要来自训练时读过的数据。这些知识像一本已经印刷完成的百科全书:内容很多,却无法自动知道刚刚发生的新闻,也未必包含企业内部资料。RAG(Retrieval Augmented Generation),也就是“检索增强生成”,正是为了解决这个问题。它允许 AI 在回答前先查资料,再根据查到的证据作答。更进一步的“搜索智能体(Agentic RAG)”不只搜索一次,而是会像人一样反复进行这样的循环:
提出搜索词 → 阅读结果 → 判断还缺什么 → 继续搜索 → 整理答案。

为了让智能体学会这套过程,研究人员常用强化学习训练它。最简单的办法是看最终答案:答对得 1 分,答错得 0 分。问题也恰恰出在这里。大家之前的通用做法是,在训练时,系统通常会让模型针对同一道题尝试多条不同的搜索路径,再比较哪一条更好,然后采用的 GRPO(Group Relative Policy Optimization)训练方式,每组会生成 8 条路径。如果其中有人答对、有人答错,模型就能从差异中学习;可如果 8 条路径全部答错,大家都是 0 分,系统便无法判断哪条路径其实更接近正确答案。这就像一场考试中,老师只看最终答案。8 名学生都算错了,于是全部记零分。但有人连题意都没看懂,有人已经列对公式,只在最后一步写错,还有人的答案其实意思正确,只是格式不符合标准。把他们当成完全相同的失败,显然浪费了大量信息。
一个“0 分”,背后至少有三种情况
论文作者分析了 Qwen3-1.7B 搜索智能体训练早期的 512 组结果,共包含 4096 条搜索路径。其中,只有 27% 的组同时出现了 0 分和 1 分,能够直接形成有效对比;有 353 组是“全员 0 分”。换句话说,大量训练样本进入了没有相对奖励信号的“沉默区”。作者又对零分路径进行抽样标注,并按总体分布加权,发现“0 分”其实混合了几类完全不同的问题:
64.5%:证据不足,或者现有证据存在歧义,确实还不能回答;
16.7%:语义上已经答对,却因为没有与标准答案精确匹配而被判错;
9.9%:证据基本够了,但答案错误或不完整;
9.0%:没有按要求输出一个完整、可解析的最终答案。
这组数据揭示了论文最关键的出发点:最终答错,不等于整个搜索过程毫无价值。有些路径需要继续搜索,有些只需修正答案,还有些只是表达形式没有对齐。如果能辨别这些差异,原本沉默的失败样本也可以继续为训练提供信号。
EviBack:只在“全员答错”时请老师出场
论文提出的方法名为 EviBack,可以理解为“基于证据约束的教师兜底”。它没有取代原来的客观评分,而是在客观评分失去区分能力时,补上一点谨慎的过程反馈。它遵循一个很克制的原则:
只要一组 8 条路径中至少有一条答对,就完全沿用原来的 0/1 奖励;只有 8 条全部答错时,才启动教师模型。
这样做的原因并不复杂。可验证的正确答案仍然是最可靠的信号,教师模型不应该推翻它。教师只负责处理“大家都是零分、无法比较”的特殊情况。不过,让一个大模型评价另一个大模型,也有明显风险:如果老师提前看到了标准答案,它可能会过度脑补,误以为残缺的资料足以支持正确结论。为此,EviBack 把教师的工作拆成两道严格隔离的关卡。
第一关:只看证据,不看标准答案
教师先读取问题,以及搜索智能体实际看到的全部资料,但看不到标准答案。它需要判断现有证据属于哪一种状态:
S(Supported):证据足以支持完整答案;
I(Insufficient):缺少关键事实、关系或推理环节;
A(Ambiguous):证据允许多个相互冲突的完整答案,问题仍有歧义。
这一关的作用,是划定一条“证据边界”:现有材料究竟够不够得出结论。
第二关:证据够了,才允许对齐答案
只有第一关没有判定为“证据不足”,第二关才会启动。这时教师可以参考标准答案,帮助校准答案内容和表达形式。最重要的规则是:第二关不能推翻第一关的“证据不足”判断。 即使标准答案中的某个词碰巧出现在检索材料里,只要支撑问题所需的关系或推理链不完整,就不能把它包装成“证据充分”。这很像新闻编辑的工作流程:事实核查员先判断材料是否足够,文字编辑只能在事实成立的前提下润色表述,不能因为已经知道理想标题,就反过来宣称证据已经齐全。
为什么还要把教师奖励“调小声”?
教师模型的判断毕竟不如“答案确实命中”那样客观。因此,EviBack 不仅限制教师出场的场景,还刻意降低它的影响力。在论文的默认设置中,兜底奖励会先在组内标准化,再乘以 0.1。这意味着它足以告诉模型“这几条失败路径中,哪一条更有希望”,却不会盖过那些真正答对所提供的学习信号。消融实验也支持这一选择:当这个权重从 0.1 提高到 0.3、0.5 或 1.0 时,整体准确性没有稳定提升,答案有效率和搜索效率反而变差。老师的声音太大,学生可能开始迎合老师的偏好,而不是追求可验证的正确答案。
连“老师怎么教”,也交给 AI 自动优化
这项工作的另一个组成部分叫 E2E-APE,即端到端自动提示词工程。研究人员先手工写出一个初始教师提示词,再让 GPT-5.5 充当流程设计者:自动划分和标注数据、生成候选提示词与工作流、反复测试其准确性、稳定性、格式合规性和调用成本,最后选出“先判断证据、再校准答案”的两阶段方案并冻结。
正式强化学习训练中,实际承担教师角色的是 GLM-4.7-Flash。GPT-5.5 用于构建教师流程,而不是在每一步训练中直接评分。更值得注意的是:无论 GPT-5.5 还是教师模型,都只在训练阶段出现。 模型部署后,推理仍然只有搜索智能体和检索器,不需要额外携带一个教师模型,也不需要知道标准答案。因此,这套方法增加的是训练成本,而不是线上每次问答的教师调用成本。
实验结果:1.7B 模型受益最明显
作者在 Qwen3 的 0.6B、1.7B 和 4B 三种规模上进行训练。训练集包含 5100 个问题,评测集包含 3500 个问题,覆盖 Natural Questions、HotpotQA、MuSiQue、2WikiMultiHopQA、Bamboogle、PopQA 和 TriviaQA 七个开放域问答基准。与采用相同训练数据和检索设置的 Search-R1 相比,EviBack 在三个模型规模上的答案 F1 均有提高:
0.6B:从 0.2431 提升至 0.2490;
1.7B:从 0.2509 提升至 0.2911;
4B:从 0.4044 提升至 0.4177。
论文所说的“约 16% 提升”,对应的是 1.7B 模型 F1 从 0.2509 到 0.2911 的相对增幅,而不是所有模型、所有指标都统一提升 16%。在 1.7B 模型上,变化尤其明显:有效答案率从 73.17% 升至 86.11%,平均搜索次数从 1.73 次 降至 1.59 次,重复查询率从 17.86% 降至 13.31%,达到最大轮次仍未正常结束的比例也从 15.49% 降至 10.71%。逐题对比还能看到,性能提升并不是平均散落在所有问题上。3500 道题中,有 593 道从“未能正常给出答案”转为能够输出有效答案,而反向退化的有 140 道。这说明 EviBack 最擅长挽救的,正是那些搜索过程有所进展、最后却没能正确收尾的轨迹。
这项研究真正有价值的地方
表面上看,EviBack 是一种搜索智能体的奖励设计;更深一层,它提出了一种值得重视的训练观念:
失败不是一种状态,而是一组需要被区分的状态。
对于会调用工具、执行多步任务的 AI 智能体来说,最终结果只是整条轨迹的最后一个点。一次失败可能源于资料不足、工具调用错误、推理中断、答案格式不合规,也可能只是评价标准过于机械。只有把这些原因分开,训练信号才可能真正指向需要改进的环节。
EviBack 的设计还体现了三条颇具普适性的原则:
第一,客观可验证的结果优先。教师模型只在原始信号失效时兜底,不能取代正确答案。
第二,先判断证据能否支持结论,再讨论答案是否漂亮。这条边界对减少模型“看答案猜理由”尤其重要。
第三,软性评价应该弱而受控。大模型评审可以提供细粒度反馈,但权力过大也可能引入新的偏差。
写在最后
当 AI 开始搜索网页、调用工具并完成多步任务后,我们已经不能只用“最后答对没有”来理解它的学习过程。EviBack 给出的答案并不复杂:先保留最可靠的客观评分;当评分无法区分好坏时,再请一个受到严格约束的老师,辨认失败中那些真正有价值的部分。这或许也是训练下一代智能体的关键变化:不仅奖励成功,也要学会读懂失败;不仅关心答案是什么,还要追问,现有证据是否真的足以让我们这样回答。
夜雨聆风