乐于分享
好东西不私藏

AI应用评测速递 20260725

AI应用评测速递 20260725

一、AWS:银行 next-best-product 推荐评测落到业务短名单

链接:https://aws.amazon.com/blogs/machine-learning/build-an-explainable-next-best-product-recommendation-system-for-banking-on-aws/

1. AWS 在 7 月 24 日发布面向银行的 next-best-product 推荐系统方案,目标是让关系经理看到客户最可能采用的产品短名单,并把解释性分数同步给 CRM 和仪表盘。

2. 原文把评测指标对应到业务问题:Top-1 Accuracy 看首推是否正确,Top-3 和 Top-5 Accuracy 对应短名单与推荐轮播,MRR 衡量正确产品的平均排序,Weighted F1 检查各产品类别是否均衡预测;生产模型在这些指标上表现强,并让正确产品稳定进入 top-3。

3. 文章还用 tower attention 输出客户级特征权重,而不是只依赖 SHAP 或 LIME 事后解释,说明推荐应用评测需要同时覆盖排序质量、类别均衡和一线人员能理解的推荐依据。

二、Anthropic Opus 5:Agent 评测开始同时看通过率和任务成本

链接:https://www.anthropic.com/news/claude-opus-5

1. Anthropic 在 7 月 24 日发布 Claude Opus 5,正文虽然是模型发布,但评测重点集中在 coding、knowledge work、agentic search、business automation 和 computer use 等应用型任务。

2. 原文报告 Frontier-Bench v0.1、CursorBench 3.2、AA Coding Agent Index、Zapier AutomationBench、OSWorld 2.0、DeepSearchQA 等结果,并强调不同 effort setting 下的 cost-per-task 曲线;其中 AutomationBench 衡量业务任务能否端到端完成,OSWorld 2.0 衡量计算机使用能力。

3. 这条的评测价值不在单纯模型排名,而在把长程 Agent、自动化业务流程和电脑操作放到同一套成本-性能视角下比较,提示生产选型不能只看静态分数。

三、AREX:Deep Research Agent 用约束级验证驱动递归改进

链接:https://arxiv.org/abs/2607.21461

1. AREX 面向 deep research 任务,核心判断是答案发现成本高,但候选答案常可拆成 constraint-wise checks,因此研究 Agent 不应只是延长搜索,而要用中间验证结果递归改进答案。

2. 论文设计内层 research loop 收集证据并形成临时答案,外层 self-improvement loop 逐约束审计答案、定位未解决声明并发起定向补充研究;同时训练 autonomous context-update tool,把增长的交互历史压缩为保留已验证证据和未解决约束的 improvement state。

3. 原文在 BrowseComp、WideSearch、DeepSearchQA、HLE 以及其他 reasoning 和 tool-use benchmarks 上报告优于同规模基线,说明 Deep Research Agent 评测正在从终局答案分数转向证据状态、验证粒度和长程改进能力。

四、Tencent WorkBuddy Bench:Coding Agent 基准把污染控制写进任务构造

链接:https://arxiv.org/abs/2607.20911

1. Tencent WorkBuddy Bench 是面向 coding agents 的多领域评测套件,报告重点覆盖构建方法、评分协议和跨模型榜单,任务分布在 Code、Web、Office 和 Security 四类真实工作域。

2. 论文没有直接改写公开 issue 文本,而是从真实代码变更或业务场景反向构造短口语化角色请求,使 prompt 不能通过搜索原始材料恢复;开放内容包括任务目录、环境镜像、evaluation harness、测试和参考解。

3. 该基准在 CodeBuddy Code 和 Claude Code 两个 agent harness 上用统一协议运行,但因各子集评分工具不同而不报告总平均分,这比单一总榜更适合暴露不同工作流里的验证方式差异。

五、Evolving User Intent:协作 Agent 评测要允许用户意图中途变化

链接:https://arxiv.org/abs/2607.20734

1. LLMs Get Lost in Evolving User Intent 关注协作 Agent 的多轮交互问题:真实用户很少一次性给出完整目标,而是在对话中逐步披露、修订或转向。

2. 论文提出框架,把静态单轮任务改造成用户意图会跨轮演化的动态对话,同时保留原任务的 evaluation protocol,使已有 benchmark 可作为受控测试床复用。

3. 原文在多项任务上发现强静态表现不能迁移到 evolving-intent 设置,模型族普遍出现明显下降;这说明 Agent 评测需要测“跟踪并执行变化中的目标”,而不只是测一次性指令遵循。

六、ProVisE:空间认知评测让图像模型直接在像素里作答

链接:https://arxiv.org/abs/2607.21072

1. Show, Don't Tell 指出许多空间任务天然发生在连续视觉场景里,但现有空间推理 benchmark 常要求坐标、选项或文本答案,和图像生成模型用像素表达空间判断的方式不匹配。

2. 论文提出 ProVisE,一个 benchmark-agnostic 的 protocolized visual evaluation 框架,引导图像生成模型给出协议约束的视觉答案,并解析成能兼容原指标的结构化预测;同时提供 Agentic builder 来构造和验证新任务协议。

3. 作者还发布 SpatialGen-Bench,包含 470 个样本、14 个空间子任务、4 个能力层级和多种答案形式;该工作把图文评测从“文字解释空间关系”推进到“可计量地画出空间判断”。

七、Experience Distillation:Agent 经验学习评测看样本效率和迁移保真

链接:https://arxiv.org/abs/2607.21051

1. Sample-Efficient Learning from Agent Experience 研究 Experience Distillation,目标是在不增加环境交互的前提下,把 Agent 从交互历史中获得的 in-context learning 收益内化到模型权重。

2. 论文在 749 个 curated software-engineering tasks 和 6 个 text-adventure games 上实验,结果显示该方法至少保留 64.8% 的上下文学习收益,而直接用收集经验做 supervised fine-tuning 只恢复 3.8%。

3. 原文还称该方法相较经典 reinforcement-learning baseline 至少减少 9.6 倍 environment samples;这让 Agent 评测不只比较最终成功率,也比较经验复用的样本成本和跨任务保真度。

八、ReferTrack:具身视觉跟踪评测拆分目标指认和轨迹规划

链接:https://arxiv.org/abs/2607.20061

1. ReferTrack 面向 embodied visual tracking,要求移动 Agent 仅用机载视觉持续跟随自然语言描述的目标,并把任务拆成先从 indexed bounding boxes 选择目标、再基于图像 grounded decision 生成 tracking waypoints。

2. 论文通过 sliding-window 队列保留历史目标框,并用 temporal-viewpoint-bbox indicator tokens 注入几何历史;作者还用自建 Refer-QA 数据集增强目标识别。

3. 在 EVT-Bench 上,ReferTrack 在 single-target、distracted、ambiguity tracking 三个 split 的成功率分别为 89.4%、73.3% 和 74.1%,并在腿式和人形机器人真实部署中验证迁移,说明多模态 Agent 评测需要同时看指代表达、视觉 grounding 和连续控制链路。