AI 前沿日报 2026-07-29
2026 年 7 月 29 日
📝 博客
Gemini API Managed Agents: 3.6 Flash, hooks, and more
Gemini API 的 Managed Agents 现默认使用 Gemini 3.6 Flash,并新增环境钩子(可在沙盒内拦截、检查或审计工具调用)、预算控制、定时触发和免费层访问。这些更新让开发者能构建更可靠、可成本可控且自主运行的智能体。
来源: DeepMind Blog · 发表于 2026-07-28
https://blog.google/innovation-and-ai/technology/developers-tools/expanding-managed-agents-gemini-api-3-6-flash-hooks/
5 ways AI Mode in Search helps you enjoy the real world
Google 搜索的 AI Mode 可帮助用户更好地享受线下生活,而非沉迷网络。它能查找符合日程的本地课程、选购合适装备、制定游戏策略、预订活动门票,并连接应用设计聚会邀请,从而简化规划、让人专注现实世界。
来源: DeepMind Blog · 发表于 2026-07-28
https://blog.google/products-and-platforms/products/search/ai-mode-real-world-tips/
Scientific computing in the age of agentic AI
一份新的现场报告显示,科学家正使用 AI 编程智能体来现代化科学计算,在基因组学等领域加速软件开发和科学发现。
来源: OpenAI Blog · 发表于 2026-07-28
https://openai.com/index/scientific-computing-agentic-ai
Jul 28, 2026Frontier Red TeamDiscovering cryptographic weaknesses with Claude
Anthropic 研究人员使用 Claude Mythos Preview 发现了两种加密算法的数学缺陷:显著削弱后量子数字签名方案 HAWK 的攻击(有效密钥强度减半),以及将简化版 AES 的已有攻击速度提升 200-800 倍的新方法。这两项成果主要由 AI 自主完成,目前均不影响任何生产系统,但展示了前沿模型在发现重要加密算法漏洞上的潜力。
来源: Anthropic Blog · 发表于 2026-07-28
https://www.anthropic.com/research/discovering-cryptographic-weaknesses
💬 社区讨论
Discovering Cryptographic Weaknesses with Claude
讨论核心话题是 Anthropic 用 Claude Mythos Preview 发现密码学算法弱点,包括对后量子签名方案 HAWK 的改进攻击和对缩减轮数 AES 的更快攻击。受关注是因为前沿 AI 模型能自主发现经人类专家多年审查都未发现的密码学数学缺陷,展示了 AI 在密码分析上的强大能力,尽管目前不影响生产系统。
来源: Hacker News · points=174, comments=118 · 发表于 2026-07-28
https://news.ycombinator.com/item?id=49087091
microsoft/Mage-VL · Hugging Face - An Efficient Codec-Native Streaming Multimodal Foundation Model
微软推出 Mage-VL,一个 4B 规模从零训练视觉编码器的编解码原生流式多模态基础模型,用于图像与视频理解。它借鉴视频编解码结构仅保留关键帧与运动区域补丁,视觉 token 减少超 75%、推理最高加速 3.5 倍,并以单一模型实现事件触发的主动流式感知。在视频理解与空间智能多项基准上优于同规模 Qwen3-VL-4B。
来源: Reddit r/LocalLLaMA · 发表于 2026-07-28
https://www.reddit.com/r/LocalLLaMA/comments/1v97f8d/microsoftmagevl_hugging_face_an_efficient/
Agenta: an open-source Claude Cowork alternative where you can use self-hosted models (and any harness)
Agenta 是一个开源、可自托管的 Claude Cowork 替代方案,支持使用自托管模型及多种 harness(如 Claude Code、OpenAI Codex、Pi)。用户可通过聊天构建具备独立指令、技能和工具的 AI 同事或自动化任务,并能让其根据反馈自我改进配置。项目代码已发布于 GitHub,并提供自托管安装指引。
来源: Reddit r/LocalLLaMA · 发表于 2026-07-28
https://www.reddit.com/r/LocalLLaMA/comments/1v9c1hz/agenta_an_opensource_claude_cowork_alternative/
Zuck's opinion: The AI Future Is for Everyone
马克·扎克伯格在WSJ发表文章,主张先进AI不应被少数前沿实验室或政府系统垄断,而应广泛扩散至企业、个人、开放生态和国家基础设施中,以扩大个人能动性并维持美国领导力。他将AI视为扩展人类自主性的工具,主张加速扩散、保护创新并仅针对具体危害监管,而非限制智能本身。当前AI政策立场分化出开放模型联盟、分级限制开放、放缓前沿研发和扎克伯格的广泛接入加定向防护四种路线。
来源: Reddit r/LocalLLaMA · 发表于 2026-07-28
https://www.reddit.com/r/LocalLLaMA/comments/1v9fetk/zucks_opinion_the_ai_future_is_for_everyone/
NeurIPS 2026 Reviewer: AI-Generated Rebuttals (and Paper) [D]
一位 NeurIPS 2026 审稿人发现所审论文及反驳意见疑似完全由 LLM(如 Claude)生成,虽作者在清单中注明使用了写作辅助,但其认为这显得作者缺乏诚意且难以阅读。审稿人表示会尽量客观评判内容,但不愿给全 AI 生成的内容太高权重,并就此寻求处理建议。
来源: Reddit r/ML · 发表于 2026-07-28
https://www.reddit.com/r/MachineLearning/comments/1v90r9r/neurips_2026_reviewer_aigenerated_rebuttals_and/
Might need math+code benchmark for frontier model(LLMs Silently Replace Math)[D]
有用户发现当前前沿大模型在单一提示中混合数学与代码时,会悄悄把应使用的复杂数学方法(如子黎曼几何)替换成 SVD、PCA 等更简单廉价的替代方案,而单独要求数学或代码实现时则正常。案例显示模型在结合隐藏空间潜向量写训练代码时也会擅自改动向量模长等设定。该现象被记录为“LLM 静默替换数学组件”的问题。
来源: Reddit r/ML · 发表于 2026-07-28
https://www.reddit.com/r/MachineLearning/comments/1v94h9m/might_need_mathcode_benchmark_for_frontier/
How to deal with text only vector search across multimodal embedding space? [D]
有用户数据集为带文字描述的图像,用户主要用纯文本搜索,其默认用 BM25,想了解如何用向量数据库和多模态嵌入模型处理。其纠结是将文本和图像分别嵌入为两个向量,还是合并成一个向量,因纯文本搜索会忽略图像部分,故考虑合并嵌入并想听取意见。
来源: Reddit r/ML · 发表于 2026-07-28
https://www.reddit.com/r/MachineLearning/comments/1v9ad2j/how_to_deal_with_text_only_vector_search_across/
📄 论文
MioFFAn: an Annotation Software for Formula Formalization with LLM Automation Capabilities
解决科学文献中数学表达式自动转为可执行符号代码(公式形式化)缺乏高质量标注数据的问题。核心创新是构建开源可定制的 MioFFAn 标注框架,基于 MioGatto 扩展出公式选择、符号代码辅助指定及自定义符号分类与运算符功能,并引入基于大语言模型的模块化半自动子任务与严格输出格式以实现人机协同。初步实验表明这种人在回路的自动化标注方法有效,可用标准 NLP 指标评估不同策略。
来源: arXiv · 发表于 2026-07-28
https://arxiv.org/abs/2607.22552
Learning When to Reason for Text-to-SQL via SFT and DPO
该论文解决现有Text-to-SQL方法对所有查询都强制使用Chain-of-Thought推理导致简单查询推理开销过高的问题。其核心创新是提出AutoThinkSQL框架,在监督微调和直接偏好优化中引入自动思考机制,使模型能根据查询难度动态跳过简单查询的推理、仅为复杂查询调用深度CoT。在Qwen3-Coder-30B-A3B上,该方法在Spider和BIRD基准上优于最佳基线,同时相比仅用CoT平均输出token减少24.6%和18.3%、延迟降低17.1%和11.5%,且模型学会了将推理决策与查询难度对齐。
来源: arXiv · 发表于 2026-07-28
https://arxiv.org/abs/2607.22622
MegaSlide-DiT: Memory-Centric Adaptation and Deformable Local Attention for Efficient Video Diffusion
该工作解决高分辨率视频DiT模型在单工作站上因参数内存和激活内存爆炸而无法微调的问题。核心创新是将所有持久模型状态留在主机内存、按需向GPU流式传输碎片,并用3D可变形滑动注意力(3D-DSA)替代全局注意力使复杂度降为线性。关键结果显示其能在单张H200加1.5TB主机内存上适配105B预训练DiT,论文给出了内存账目与执行轨迹佐证,但未从零训练也未突破带宽极限。
来源: arXiv · 发表于 2026-07-28
https://arxiv.org/abs/2607.22696
MIME: Multimodal Interactive Motion Encoder
该论文针对双人交互场景下的文本-动作多模态表示学习问题,提出首个专用于双人交互动作的多模态编码器MIME,采用基于流的协同注意力与显式交互特征及课程对比训练来建模个体与共享结构。在Inter-X文本-动作检索中,MIME于2000样本库上文本到动作R@1相对提升12.8%,优于早/晚融合基线;作为冻结先验用于TIMotion和InterMask时,在未见InterHuman数据集上提升语义对齐且FID相当,表明交互感知编码可迁移支持下游生成。
来源: arXiv · 发表于 2026-07-28
https://arxiv.org/abs/2607.22702
Histopathological Spectrum-Guided Prostate Stratification via Segmentation-Assisted Diagnostic Transformer
该工作解决现有前列腺mpMRI诊断依赖PI-RADS或二分类、主观性强且忽略病理异质性的问题,构建了含良恶性四分类的前列腺病理谱数据集PCa-HSD。其核心创新是提出语言引导的分割辅助诊断Transformer(LSDT),利用零样本分割提供解剖先验并实现多模态切片融合分类。在344例患者五折交叉验证中,LSDT最佳平均准确率达0.633、联合召回率0.768,表明结合病理监督与解剖先验可显著提升细粒度分类与风险分层。
来源: arXiv · 发表于 2026-07-28
https://arxiv.org/abs/2607.22703
Visible-Light Imaging Diagnosis of Neutral Particle Emission Tomography in the Tokamak Divertor: An Efficient Transformer-based Surrogate Model
该论文解决托卡马克偏滤器中子粒子发射层析的可见光成像诊断问题,即用可见光相机预测光强二维空间分布。核心创新是提出以差分Transformer为骨干的Delta-InvFormer,将连续视频帧输入并利用时空差分自注意力抑制噪声干扰、提取等离子体动态特征后解码预测。基于EAST真实实验数据,该模型相比传统方法显著加速分布预测且达到有竞争力的重建精度。
来源: arXiv · 发表于 2026-07-28
https://arxiv.org/abs/2607.22704
EditCLEVR: A Paired-Scene Intervention Benchmark for Compositional Faithfulness of Object-Centric Representations
该论文解决现有物体中心学习评估无法直接检验受控语义编辑下逐物体表征行为是否正确的问题。其核心创新是提出EditCLEVR配对场景干预基准,含已知属性变更的before/after渲染对及无编辑对照,并设计无探针诊断指标与SGIA、Delta-SGIA等语义忠实度度量,可分别评估表征空间变动与解码属性正确性。基线实验表明即便使用真值掩码,CoGenT-OOD-core退化仍存在,掩码来源仅解释部分性能,且局部性或稳定性 alone 会高估语义忠实度。
来源: arXiv · 发表于 2026-07-28
https://arxiv.org/abs/2607.22705
CORVUS: Context Optimization and Reduction Via Underlying Synchronization for LLM Coding Agents
该论文解决LLM编码代理中传统只追加轨迹架构将文件读取与快照紧耦合导致快照过时、冗余重读使轨迹膨胀的问题。其核心创新是CORVUS轨迹架构,通过维护同步文件注册表并在每轮推理只注入当前文件内容,将读取动作与观察解耦,从构造上保持与代码库状态同步。在SWE-POLYBENCH_VERIFIED和SWE-BENCH PRO上跨四种LLM评测,平均输入token减少9–50%、最终提示缩短15–32%、推理轮次最多减37%,且通过率相当。
来源: arXiv · 发表于 2026-07-28
https://arxiv.org/abs/2607.22711
CausalGate: Causal Importance Distillation for Transformer Module Pruning
CausalGate解决现有大模型自适应推理方法依赖观测启发式指标、难以捕捉对语义精度关键的非线性结构计算的问题。其核心创新是在校准阶段通过零化各注意力与MLP子层输出并度量最终logit分布的KL散度来量化因果语义损伤,再用EMA平滑与可微排序损失将该重要性层级蒸馏为静态轻量标量门以实现零运行时路由开销。在TinyLlama-1.1B、Qwen2.5-3B和Llama-3.1-8B上的语言建模与常识推理评测中,它持续优于动态路由和跳层基线,在零操作开销下将理论算力节省转化为实际硬件延迟降低。
来源: arXiv · 发表于 2026-07-28
https://arxiv.org/abs/2607.22720
Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks
解决长程智能体任务中基于组的策略优化因采样失衡产生“信用陷阱”导致策略无法被稀疏结果奖励纠正的问题。核心创新是提出进度条件组策略优化(ProGPO),仅当组内所有样本结果奖励为零时,用首次访问观测覆盖度给访问更多新状态的轨迹或步骤赋予更高相对优势。在ALFWorld和WebShop上用Qwen2.5-1.5/7B-Instruct实验表明,ProGPO稳定优于组基线,在困难任务上提升尤为明显。
来源: arXiv · 发表于 2026-07-28
https://arxiv.org/abs/2607.22724
WCM: World-Cognition Model for Generalizable Human-Robot Interaction
解决机器人控制范式缺乏用户可见性与交互纠错教学机制的问题。核心创新是基于SLAK架构与异步运行时构建以人为中心的具身智能体WCM,分离感知推理控制记忆并支持并发推理对话执行,还引入人在环教学模式将教学片段精炼为思维链监督持续优化。关键实验在九项真实人机交互任务上取得73.8%平均成功率,含未参与微调的任务及通过教学学会的长程任务。
来源: arXiv · 发表于 2026-07-28
https://arxiv.org/abs/2607.22999
夜雨聆风