AI 论文每日简报
📌 今日概览
今日论文聚焦 Agent 能力评估与扩展、视频/图像生成前沿、科学 AI 新基准与机器学习方法论——涵盖 35B Agent 挑战万亿参数模型、实时视频编辑、分子优化新范式、表格基础模型泛化性等热点方向。
核心:提出 Agents-A1,一个仅 35B 参数的 MoE Agent 模型,通过扩展 Agent 轨迹长度(平均 45K tokens)和多教师蒸馏策略,在多个长程 Agent 基准上达到甚至超越 Kimi-K2.6、DeepSeek-V4-pro 等万亿参数模型的性能。核心思路是"扩展 Horizon 而非参数",为小模型实现强 Agent 能力提供了可行路径。
核心:定义 Agentic Abstention 问题——Agent 在不确定性下应何时停止行动而非继续调用工具。在 28,000+ 任务上评估 13 个 LLM Agent,发现主要挑战不是 Agent 能否弃权,而是何时弃权:部分 Agent 从未在应该停止时停下,另一些则在多次无意义交互后才停止。提出 CONVOLVE 上下文工程方法,将 Llama-3.3-70B 的及时弃权召回率从 26.7 提升至 57.4。
核心:将多 Agent LLM 系统的延迟验证建模为图上的延迟共识问题,利用接地拉普拉斯矩阵谱分解推导出验证剂量的闭式稳定性阈值——过强或过迟的修正都会使共识变为震荡。延迟为 2 时阈值为黄金比例的倒数。但基于事实的接地验证可消除此不稳定性,说明该问题特属于符号信念任务。
核心:挑战异步流水线并行中梯度延迟不可避免的固有认知。在 10B 参数规模上系统评估发现:AdamW 确实因一步延迟严重退化,但 Muon 优化器对延迟具有强鲁棒性。引入 Error Feedback 修正后,异步训练可弥合与同步训练的性能差距,极大提升了大规模 LLM 预训练的资源利用率。
核心:提出 SWE-Together 多轮交互编程基准,从 11,260 条真实用户-Agent 会话中精选 109 个仓库级任务。构建基于 LLM 的用户模拟器重放交互,评估 Agent 的最终代码正确率和所需纠正反馈轮数。结果显示更强 Agent 不仅成功率更高,且所需的用户干预也更少。
核心:提出 PolicyGuard 子 Agent 验证器,通过与主 Agent 共享对话视图、在上下文中推理组织策略,提供可操作的反馈指导 Agent 下一轮行为。在 tau²-BENCH 航空公司场景中,跨 GPT-5.4/Claude Sonnet 4.6/Gemini 2.5 Pro 三个模型,PASS4 分别提升 +12.0/+6.0/+12.0 个百分点。
核心:提出 TACO(工具增强信用优化),一种 GRPO 变体,通过差分答案探测奖励(DAPR)无监督地评估每次工具调用的贡献:有用调用得正分、误导调用得负分、无变化调用得零分。配合 OGAR 路由,Agent 学会仅在工具真正有帮助时才调用,无需额外评判模型。
核心:指出现有 KV Cache 剪枝方法依赖输入/领域特定的预算阈值,在开放域场景中严重受限。提出"无阈值"KV 压缩目标,并设计 ReFreeKV 方法自适应调整预算分配,在 13 个不同上下文长度、任务类型和模型规模的数据集上实现无损压缩。
核心:提出 SOTA 掩码离散扩散模型,解决两大关键挑战:通过 Token 编辑机制使模型在推理时动态修正已解码 Token(类似雕刻家迭代精修),以及通过分组交叉熵(GCE)目标缓解大词表下训练信号稀疏问题。在 GenEval 达 0.90、DPG 达 86.9,实现高质量文本到图像合成。
核心:提出实时流式视频编辑框架,通过三阶段蒸馏流水线将双向基座模型的编辑能力迁移至高效单向流式编辑器,配合 AR 导向掩码缓存复用跨帧计算。在 12.66 FPS 下实现 SOTA 视觉质量,适用于交互式和 AR 应用场景。
核心:发布 DreamForge-World 0.1 预览版,一个基于 Wan2.1-T2V-1.3B 自回归视频栈的低计算量世界模型。支持键鼠实时控制、多模态初始化、中流重提示和双视图操作,在单张 RTX 4090 上以 480p 分辨率达到 14-15 FPS,展示了消费级 GPU 上实时可控世界模拟的可行路线。
核心:提出 SAM2Matting,将视频目标分割追踪器(SAM2/SAM3)升级为高保真视频抠图框架。通过区域提议桥接和专用抠图头将追踪与抠图解耦,仅用图像训练即在视频抠图上达到 SOTA,支持多种提示类型并展现强时序一致性。
核心:提出 ViDiHand,利用预训练视频扩散模型的表征重建 4D 双手姿态。通过手部叠加渲染目标适配特征并解码为度量尺度姿态,全程无需检测器、填充器或测试时优化。在 ARCTIC、HOT3D、HOI4D 上大幅超越先前方法,开辟视频扩散模型作为手部运动重建新基础的道路。
核心:发现扩散 MoE 路由器因依赖噪声污染的特征而无法准确将计算资源分配给显著 Token。提出 SharpMoE 后训练框架,使用干净潜在特征作为无噪声路由引导信号,配合轨迹路由损失约束去噪全过程的计算分配,即插即用地提升预训练 MoE 模型的生成质量。
核心:提出 Exemplar-Based 人像精修新任务:给定示例对,推断并应用相同的精修操作至新图像。MirrorPPR 框架使用精修操作提取器捕捉示例对的细微差异,注入预训练 DiT 并通过 LoRA 适配,配合 4700 万对数据集 MirrorPPR47M 和渐进式课程学习,在精修质量和身份保持上显著超越基线。
核心:提出以场景为中心的世界探索范式 NeuWorld,将交互式生成的滚动变量从帧潜在表示改为固定长度的可渲染隐式场景状态(NIS),分解为紧凑场景状态的随机转移与给定采样状态的确定性姿态条件渲染。无需预训练视频骨干或辅助 3D 重建器,在公开数据上从头训练即可实现强长程一致性。
核心:通过 Drop-Then-Recovery 协议系统研究 VLA 模型的架构冗余:移除 Transformer 块后微调恢复。发现语言骨干对标准机器人操作任务高度冗余——在 LIBERO 上移除一半 LLM 块反而将 OpenVLA-OFT 从 95.0% 提升至 98.3%,仅保留两个语言块即可恢复基线性能。视觉和动作通路则远不可压缩。
核心:发布 BeyondArena——首个统一的表格数据全维度基准,覆盖 IID/时序/分组、多尺度样本量与特征维度、多样化特征类型。在 11 个模型和 142 个数据集上的评估表明:现有表格基础模型仅在中小规模 IID 数据上表现优异,传统树模型和深度学习在非 IID、大规模高维数据上仍然占优。
核心:提出"一模型适应多延迟"的通用实时语音增强框架:算法延迟通过可配置前瞻帧灵活调节,计算延迟通过早退机制控制推理深度。引入并行卷积层和两阶段训练策略(共享-多解码器过渡),单一模型即可覆盖不同延迟预算的部署场景,无需为每种场景单独训练。
核心:用简单的全微调+知识蒸馏+权重插值配方解决时尚检索中专业化与通用性之间的权衡。ZooClaw-FashionSigLIP2 在统一公平评估下全面超越 LoRA、更大骨干(最高 1B)和外部训练数据。同时发布高质量时尚检索基准 ZooClaw-Fashion,并系统分析现有基准的结构偏差。
核心:将掩码图像建模(MIM)与归一化流(NF)统一为端到端生成框架。通过 VAE 编码器从掩码图像推断语义潜在表示,NF 专注于建模简化的低频语义流形,专用解码器处理高频合成,解决了 NF 的容量瓶颈。ImageNet 256×256 上仅用 128 Token 即达到 2.50 FID 和 71.3% 线性探测准确率。
核心:构建 Video-MME-Logical 受控诊断基准,隔离评估 MLLM 的视频时序逻辑推理能力。涵盖状态追踪、序列计数、时序排序、动态空间性和结构组合五种逻辑操作,支持难度控制和中间状态诊断。实验揭示当前最强 MLLM 与人类仍存在巨大差距,微调 50 万样本后仍不足以弥合。
核心:发布纳米技术分子优化(NMO)基准,将量子材料科学与生成式分子设计桥接。NMO 用量子模拟替代代理评估,施加硬结构约束和崎岖适应度景观,对生成模型提出全新要求。意外的是,先进分子优化方法在这些任务上反而不如更简单的方法,暴露了当前领域从药物发现向更广泛科学领域迁移的局限性。
核心:构建 TheoremGraph,首个统一非正式与形式化数学的语句级依赖图。非形式化侧从 arXiv 解析 1170 万条定理环境并恢复 1830 万条候选依赖;形式化侧发布 LeanGraph(Lean 4 精化器级提取器),产出 38.8 万声明节点与 1130 万类型化边。通过语义嵌入桥接两端,LLM 评判确认 47,952 条跨域匹配。
核心:提出几何稳定性——神经群体编码的成对距离结构在独立观测间的一致性——作为表征可靠性的独立维度。在 229 个区域-会话观测中,几何稳定性预测试次间神经-行为耦合(ρ=0.18),而质心漂移不能(ρ=0.002)。纹状体最稳定(S=0.44),海马体最不稳定(S=0.19),揭示了与时间稳定性层级大致相反的区域层级。
核心:提出 Epi2Diff 框架,将大型推理模型的推理轨迹映射为认知 Episode 序列(功能性问题求解状态),通过推理规模、精力分配和状态转移建模题目难度。在四个真实人类难度数据集上持续超越强基线,揭示更难的题目诱导更多迭代性、以执行为中心的 Episode 动态,而非仅产生更长回答。
核心:发布 OSWorld 2.0,包含 108 个长程计算机使用工作流的基准。任务中位人类完成时间约 1.6 小时,Agent 平均需 318 次工具调用(OSWorld 1.0 仅约 30 次)。最佳 Agent Claude Opus 4.8 在 500 步下仅完成 20.6% 任务,暴露了当前 Agent 在约束追踪、动态信息接收和隐藏状态恢复方面的根本性缺陷。
核心:提出 TUA-Bench,首个通用终端使用 Agent 基准,包含 120 个真实任务覆盖五个任务族——从日常文档编辑、邮件管理到博士级科学工程工作流。每个任务手动设计、在真实终端中运行并由执行评分协议评估。最强 Agent Claude Code + Opus 4.8 仅达 65.8%,跨领域差距显著。
核心:发现 MLLM 的 GUI 目标定位中,目标区域感知在中间解码层涌现但未被保留至最终坐标预测。提出 InnerZoom 单次前向跨层证据桥接框架,将原始前向传播中的目标线索转化为紧凑跨层证据状态并在后续解码层中保持、精炼和重新注入。在六个 GUI 基准上全面 SOTA,相比两遍 ZoomIn 降低 31.8% 延迟和 29% 计算量。
核心:提出 GUICrafter,一个利用海量无标注截图的弱监督 GUI Agent。通过两阶段课程学习:先在大规模无标注截图和网页上学习视觉 Grounding,再用少量高质量标注数据通过强化学习校准。仅用 UI-TARS 0.1% 的数据量即达到竞争甚至更优的性能,显著降低了对昂贵人工标注的依赖。
核心:发布 SafePyramid 安全基准,包含 1,000 条多轮对话、3,000 条应用特定策略和 61,699 条自然语言规则。三级难度递进评估:L0 单规则理解、L1 规则依赖推理、L2 新策略框架适配。最强模型 GPT-5.5 在三级上的全规则识别率仅为 54.0%/35.3%/12.9%,揭示了当前护栏系统的严重不足。
核心:提出 ILLUME-X 统一多模态范式,实现高质量自由形式交错图文生成。三大组件:扩展的交错图文训练数据管线、自适应目标的渐进式训练策略、以及交错序列评估方法 ILScore。在风格迁移、图像分解和故事叙述等多任务上超越先前统一模型。
核心:提出微调回退的"引力"解释:早期大规模训练阶段创建主导行为流形,后续对齐/专业化阶段是其上的浅层位移,后续微调因此继承指向主导流形的回退分量。实验验证阻断开沿回退方向的运动可将有害性从 19.0% 降至 8.5%,近乎无任务代价,为理解和控制后训练行为退化提供了几何框架。
核心:提出 RocketSmith Agent 系统,利用 LLM 编排软件工具自动完成高功率火箭的增材制造设计流程。包含子 Agent 和技能集合,支持零样本和人机协作两种工作流。四枚不同配置的火箭全部实现稳定发射,两枚成功回收,高度计验证实际高度达到系统预测的 80%。
内容由 AI 自动整理 · HuggingFace Daily Papers · 2026-07-01
由 Hermes Agent 生成
夜雨聆风