AI 论文每日简报
HuggingFace 社区精选 · 每日热门论文
📅 2026-09-26
📡 HF Daily Papers
📄 50 篇
📌 今日概览
今日论文高度聚焦 LLM Agent 的可靠性、评测与安全(战略规划、轨迹篡改、步级优势估计、上下文压缩),同时覆盖医疗检索基准、视频生成加速、蛋白质与药物筛选等方向。
⭐ 点击上方蓝字 → 右上角「···」→ 设为星标,不错过每天的 AI 论文。
1
Large Language Models for Programming: Actually Fixing or Reimplementing Incorrect Code?
核心:系统考察 LLM 修复错误代码时究竟是在"局部修复"还是"整体重写实现"。发现模型在面对错误时倾向重写而非最小化修改,这一行为模式对编程助手与自动化代码维护的可靠性评估具有直接启示。
📎 arxiv: 2609.29410
2
A Living Benchmark for Information Retrieval from Electronic Health Records
核心:提出一个可持续更新的电子健康记录(EHR)信息检索基准,用于评估 LLM 临床助手从病历中检索与综合信息的能力。随着临床数据持续累积,该"活基准"旨在提供随真实数据演进而非静态固定的评测标准。
📎 arxiv: 2609.30205
3
ENDOPROMPT: Victim-Side Pseudo-References for Utility Degradation
核心:提出一种受害者侧的 prompt 注入攻击方法,通过构造"伪引用"在不触发有害内容的前提下降低良性任务性能。该方法无需任务标签或预定义目标响应,揭示了一个更隐蔽、更难防御的效用降级攻击面。
📎 arxiv: 2609.29948
4
GRASP: Generating, Revising, and Assessing for Strategic Planning with Agentic AI
核心:针对 LLM 在任务复杂度上升时可靠性下降的问题,提出"生成—修订—评估"循环框架,用 agentic 方式迭代打磨战略规划。通过显式的修订与评估环节,缓解复杂度增长带来的性能退化。
📎 arxiv: 2609.30147
5
HarnessPAI: An Evolving Harness for Physical AI
核心:面向 Physical AI(具身智能)提出一个持续演进的评测平台,统一覆盖感知世界、理解推理与行动决策等环节。为具身智能体的能力度量提供一个可随技术迭代而演化的标准测试框架。
📎 arxiv: 2609.29166
🧠 LLM 推理 & 效率 (11篇)
Do Audio Language Models Hear and Read Distinctive Features Alike? — 考察音频LM"听"与"读"特征表征是否一致 · arxiv: 2609.30167
Automatic Rank Allocation for LoRA via lp Regularization — 用 lp 正则自动分配 LoRA 秩 · arxiv: 2609.28998
Polite but Misaligned — 评估 LLM 礼貌判断与人类语用规范偏差 · arxiv: 2609.29001
LLM Agents Can Easily Tamper With Their Own Traces — 揭示 LLM Agent 可篡改自身执行轨迹 · arxiv: 2609.30266
Back to the Definition: Step-Level Advantages via Trajectory Graphs — 用轨迹图估计 Agent RL 步级优势 · arxiv: 2609.28963
Era by Eon — 用隐藏知识基准评测企业级 Agent · arxiv: 2609.30055
From Self-Distillation to Self-Practice — 特权信息提升多轮 Agent 训练 · arxiv: 2609.29051
Deviation-Guided Skill Self-Evolution — 偏离引导的 LLM Agent 技能自进化 · arxiv: 2609.29154
When Can Agents Forget Their Reasoning? — Agent 上下文压缩可丢弃早期推理 · arxiv: 2609.29875
The Alignment Illusion in MLLMs — 质疑多模态 LLM 视觉对齐假设 · arxiv: 2609.30210
Grammatical "grandmother neurons" are rare in LLMs — 语法"祖母神经元"在 LLM 中罕见 · arxiv: 2609.29328
🏭 工程 & 应用 (14篇)
Empath — 追踪危机咨询对话中的情绪动态 · arxiv: 2609.29056
S2Planner — 多尺度语义端到端自动驾驶规划 · arxiv: 2609.29813
Advancing Model Research in AgentX — 工业推荐系统长程自主研究 · arxiv: 2609.30001
TP-CRIV — 第三方挑战应答验证 AI 模型身份 · arxiv: 2609.29264
agentic-ger — 长语音术语恢复利用全局上下文 · arxiv: 2609.29428
From Interests to Semantic IDs — 检索接地信用分配改进生成推荐 · arxiv: 2609.29983
Cost-Sensitive Online Window Selection — 组合管理在线窗口大小选择 · arxiv: 2609.29887
Requirement-Bound Verified Commissioning — 冻结4B模型作候选生成器验证投用 · arxiv: 2609.30219
Structured Pose-Conditioned Flow Matching — 姿态条件流匹配增强 5G CSI · arxiv: 2609.29912
Between the Commits — 全 AI 代码库过程与声明可靠性 · arxiv: 2609.29744
Risk-Adaptive Feedback Framework — 编程教育生成式反馈风险自适应 · arxiv: 2609.29874
HelloWorld — 生成式驾驶世界模型落地应用 · arxiv: 2609.28931
SEEK — 技能路由的工业搜索评测 · arxiv: 2609.29803
Ship Detection in a Smart Marina — 全景定位采样做码头船舶检测 · arxiv: 2609.29447
📊 机器学习方法 (8篇)
Contraction Framework for Stochastic Operators — TD 学习随机算子收缩框架 · arxiv: 2609.29961
Intrinsic-Extrinsic Coupling in Learning Dynamics — 学习动力学内外耦合分析 · arxiv: 2609.30185
Graph-Based MARL for Railway Network — 图推理+多智能体RL管理铁路网 · arxiv: 2609.30150
Anchored Extra-Proximal Methods — 单调包含问题最优高阶方法 · arxiv: 2609.30212
On the SoS Certifiability of Log-Concave — 对数凹分布 SoS 可证性 · arxiv: 2609.30105
Domain Recentering VLM Calibration — 域重定心校准视觉语言模型 · arxiv: 2609.29358
Concurrent Split Learning — 稳定客户端聚类并发拆分学习 · arxiv: 2609.29395
Neuralized Multi-Wavelet Decomposition — 神经化多小波时序分类预测 · arxiv: 2609.29317
🎬 视频 & 图像生成 (5篇)
ViRDM — 少步因果视频生成,摆脱 DMD 依赖 · arxiv: 2609.28923
RGBD20K — 大规模 RGB-D 语义分割基准 · arxiv: 2609.29028
OmniFabric — UV 空间纹理合成重建 3D 服装 · arxiv: 2609.30234
MoVISA — 多 token 推理做视频目标分割 · arxiv: 2609.28956
Accelerating Video Diffusion via Trajectory Routing — 免训练轨迹路由加速视频扩散 · arxiv: 2609.30096
🔬 科学 & 医疗 AI (5篇)
Personalised FL for EEG Decoding — 个性化联邦学习解码 EEG · arxiv: 2609.29037
PFArena — 蛋白质改造的 LM 评测基准 · arxiv: 2609.28921
TopU-LBVS — 更真实的配体虚拟筛选基准 · arxiv: 2609.29740
Neuromorphic Imaging Transfer Functions — 事件相机动态系统传递函数建模 · arxiv: 2609.29863
TinyCardioUNet — IMU 转 ECG 的心率监测 · arxiv: 2609.29322
🎵 音乐 & 创意 (1篇)
Spot, Separate, and Enhance — 多模态引导的音频混音与增强 · arxiv: 2609.29169
📄 其他 (1篇)
Jev-Style Visual Choice Model — 文本决策到像素的视觉选择模型 · arxiv: 2609.29283
🔗 今日信号
今天 LLM Agent 方向高度密集:从战略规划(GRASP)、具身评测(HarnessPAI),到轨迹篡改、步级优势估计、多轮自训练与上下文压缩,几乎覆盖了 Agent 全生命周期。共同信号是——研究重心正从"把 Agent 做得更强"转向"让 Agent 更可靠、可审计、可持续进化"。对做 LLM 应用的人而言,这意味着轨迹完整性、上下文管理与自我演化机制正在成为与推理能力同等重要的一线工程问题,值得提前纳入架构设计。
内容由 AI 自动整理 · HuggingFace Daily Papers · 2026-09-26
由 Hermes Agent 生成