乐于分享
好东西不私藏

AI智能体进入托管时代/NVIDIA更新算力平台/AI安全治理工具值得关注

AI智能体进入托管时代/NVIDIA更新算力平台/AI安全治理工具值得关注

· 今日提要

📌 谷歌发布无编码器多模态模型 Gemma 4 12B,可在消费级笔记本上运行

📌 微软发布 MAI-Thinking-1,不依赖蒸馏追平 Claude Opus 4.6

📌 GitHub 通过每日审计与 MCP 将 Agent Token 成本降低 62%

📌 字节跳动火山引擎上调 MaaS 营收目标至 150 亿元

📌 微软提出将 Agent 优化循环定义为搜索问题

📌 微软发布 Project Solara:面向 AI Agent 时代的硬件平台

📌 OpenAI 发布公共政策议程

📌 自主 AI 工具发现 Redis 中潜伏两年的远程代码执行漏洞

· 今日重点

谷歌 Gemma 4 12B:无编码器多模态 AI 模型

谷歌 DeepMind 发布了 Gemma 4 12B,这是一个采用无编码器架构的开源权重多模态模型。简单来说,传统多模态模型(比如 GPT-4V)需要用一个独立的视觉编码器把图像转成 token,再交给语言模型处理,这增加了延迟和内存占用。Gemma 4 12B 用一个轻量级的嵌入模块(只有 3500 万参数)取代了传统的视觉编码器,让模型可以直接处理图像和音频,从而降低延迟和内存占用。
这个模型可以在配备 16GB RAM 的消费级笔记本电脑上实际运行,可能加速编码、推理和教育等本地 AI 应用。它挑战了传统上对独立编码器的依赖,可能影响未来模型的设计。
(来源:Google AI Blog、Hacker News)

微软发布 MAI-Thinking-1,不依赖蒸馏追平 Claude Opus 4.6

微软发布了完全从零训练、不依赖任何第三方模型输出的推理模型 MAI-Thinking-1,其性能追平了 Claude Opus 4.6。知识蒸馏是一种让较小的“学生”模型模仿较大“教师”模型输出的技术,近期许多模型都使用了这种方法。微软的做法拒绝了这种依赖,完全从零训练模型,不借助任何外部教师模型。
这表明无需从现有模型进行知识蒸馏也能构建高性能推理模型,可能减少对大型专有模型的依赖,并推动更开放的 AI 研究。
(来源:InfoQ)

GitHub 通过每日审计与 MCP 将 Agent Token 成本降低 62%

GitHub 宣布通过每日审计和精简模型上下文协议(MCP),将 AI Agent 工作流的 Token 成本最高降低了 62%。MCP 是 Anthropic 推出的开放标准,用于规范 AI 模型与外部工具和数据源的连接方式。Agent 工作流常因冗长的上下文和重复的工具调用而产生高额 Token 成本,因此成本优化成为部署的关键挑战。
这一显著的成本降低使 AI Agent 工作流对企业更具经济可行性,可能加速基于 Agent 的自动化在软件开发中的采用。GitHub 的方法可应用于其他基于 MCP 的 Agent 系统。
(来源:InfoQ)

· 产业观察

字节跳动火山引擎上调 MaaS 营收目标至 150 亿元

字节跳动火山引擎已将 2026 年 MaaS 营收目标上调至 150 亿元,较 2025 年底的 100 亿元大幅提升,主要得益于视频模型 Seedance 2.0 的爆发,该模型单月营收已超过 10 亿元。MaaS(模型即服务)是一种通过标准化 API 提供 AI 模型的云服务模式,用户无需管理基础设施即可调用模型。Seedance 2.0 在 Artificial Analysis Video Arena 上获得 Elo 1269 分,超越了 Veo 3 和 Sora 2 等海外模型,在短剧行业的渗透率已达约 95%。
这标志着 AI 视频生成商业化的重要里程碑,表明顶尖模型质量能够驱动巨大的 Token 消耗和营收。同时凸显了视频和代码作为 MaaS 市场两大关键战场的战略重要性。
(来源:36氪)

微软发布 Project Solara:面向 AI Agent 时代的硬件平台

微软在 Build 2026 上宣布了 Project Solara,这是一个专为 AI Agent 优先体验设计的芯片到云端硬件与软件整合平台。传统硬件并未针对 Agent 所需的持续低延迟推理和多 Agent 协调进行优化,Project Solara 旨在通过提供从芯片到云端的全栈解决方案来填补这一空白。
这标志着微软为 AI Agent 构建专用基础设施的战略转变,可能加速基于 Agent 的应用在各行各业的开发与普及。
(来源:OSChina)

· AI安全

WhatsApp、Slack 通知可劫持 Android 上的 Google Gemini

研究人员发现,来自 WhatsApp、Slack、短信、Signal、Instagram 或 Messenger 等应用的单个恶意通知就能劫持 Android 上的 Google Gemini 语音助手,从而实现内存投毒或发送虚假消息等未经授权的操作。提示注入是一种安全漏洞,AI 模型会被嵌入看似无害数据中的恶意输入欺骗。在此案例中,来自消息应用的通知被 Gemini 语音助手处理,后者可能将文本解释为命令。
这种攻击向量新颖且技术深度高,直接影响 AI 安全和 Android 漏洞。它揭示了 AI 助手处理来自通知的不可信输入时的关键弱点,可能影响数百万用户。
(来源:The Hacker News)

自主 AI 工具发现 Redis 中潜伏两年的远程代码执行漏洞

一款自主 AI 工具在 Redis 的阻塞客户端代码中发现了一个释放后使用漏洞(CVE-2026-23479),允许经过身份验证的用户执行任意操作系统命令。Redis 是一种流行的内存数据结构存储,用作数据库、缓存和消息代理。该漏洞自 Redis 7.2.0 引入以来已潜伏超过两年未被发现。
这表明自主 AI 工具能够有效发现广泛使用的软件中真实存在的高危漏洞,可能通过自动化漏洞挖掘来改变网络安全格局。这也凸显了 AI 在安全研究中日益重要的作用,有望加速漏洞发现并缩短暴露窗口。
(来源:The Hacker News)

· 学习资源

在 SageMaker 上使用 SFT 和 DPO 提升智能体工具调用准确率

AWS 发布了一篇博客文章,演示如何在 Amazon SageMaker AI 上结合监督微调(SFT)和直接偏好优化(DPO)来提升小语言模型的工具调用准确率。监督微调是在带有标注示例的小型任务特定数据集上进一步训练预训练模型;直接偏好优化无需奖励模型或强化学习循环即可使语言模型与人类偏好对齐。工具调用准确率衡量模型在给定任务中选择并调用正确外部工具的频次。
提升工具调用准确率对于构建能与外部工具和 API 交互的可靠 AI 智能体至关重要。该方法利用托管训练基础设施提供了实用且可扩展的方案,支持基于数据做出模型质量决策。
(来源:AWS Machine Learning Blog)

Direct Preference Optimization Beyond Chatbots

一篇博客文章探讨了如何将直接偏好优化(DPO)应用于聊天机器人对齐之外的任务,例如科学和教育领域。DPO 是一种使语言模型与人类偏好对齐的技术,传统上主要用于聊天场景。该文章展示了 DPO 在更广泛领域的潜力,可能为教育和科研中的 AI 应用提供新思路。
(来源:Hugging Face Blog)
今天先整理到这里,后续继续跟踪。