每日AI安全速递
追踪AI行业动态 · 洞察安全风险趋势
今日核心洞察
AI行业动态
Anthropic就Fable 5隐性限制道歉撤回,头部厂商首次因安全不透明致歉
《Wired》曝光Anthropic在Fable 5系统说明中披露:针对"前沿大模型开发"相关请求,模型会在用户不知情的情况下被暗中降低性能。消息曝光后AI研究社区爆发强烈批评。Anthropic随即道歉并宣布撤回该政策,改为对用户可见——若判断某用户正试图利用Claude构建高能力AI模型,将明确告知其请求被拒绝或转至较弱模型。这是头部AI厂商首次因安全策略不透明而公开致歉,标志着AI安全"透明度"正成为行业竞争的新维度。
来源:https://www.wired.com/story/anthropic-responds-to-backlash-on-claudes-secret-sabotage-on-ai-researchClaude Fable 5遭"群体狩猎"多智能体越狱攻破,发布数日即被突破
安全研究员Pliny the Liberator在Fable 5上线数日后公开宣布突破防线,所用策略命名为"群体狩猎"——协调多智能体协同作战的攻击方式。Fable 5与Mythos 5共享底层模型,仅由一层安全分类器隔开;攻击渗透路径包括Unicode字符替换、长上下文引用追踪、文档结构框架伪装、虚构叙事框架及分解重组策略。Anthropic随即宣布将可见化所有防护功能,但承认这可能增加越狱攻击线索。
来源:https://mp.weixin.qq.com/s/zyAH304ki9PSDcieio_ZJQ腾讯混元开源HPC-Ops推理算子库,Sampler较vLLM提速4-7.5倍
腾讯混元AI Infra团队开源升级工业级推理算子库HPC-Ops,新增五大关键算子覆盖推理全链路:Attention动态调度长文本最高加速2.95倍、Router GEMM双BF16重构FP32精度最高提速3.22倍、FusedMoE较主流框架提速1.2-1.6倍、Fused AllReduce+Norm通信计算深度融合最高提速1.76倍、Sampler相较vLLM提速4-7.5倍。全部面向H20/SM90等主流推理硬件深度优化并正式开源。
来源:https://github.com/Tencent/hpc-ops谷歌开源DiffusionGemma 26B文本扩散模型,生成提速最高4倍
谷歌发布实验性开源模型DiffusionGemma,采用Apache 2.0许可,26B规模MoE推理仅激活3.8B参数。放弃逐token自回归,可一次性并行生成256个token整块文本,GPU上生成速度最高提升4倍。支持双向注意力与自我修正,适合行内编辑、代码补全等本地低并发场景,但输出质量低于标准版Gemma 4。
来源:https://mp.weixin.qq.com/s/Qf8788wjPUzs7s__hBBRkw小米发布MiMo Code编程助手,SWE-Bench Pro达62%超越Claude Code
小米发布终端AI编程助手MiMo Code V0.1.0,基于OpenCode二次开发,MIT协议开源,内置限免MiMo-V2.5模型。独创持久记忆系统与Compose模式,自动完成设计、规划、编码、测试、审查全流程;在SWE-Bench Pro达62%、Terminal Bench 2达73%,均优于Claude Code。
来源:https://mp.weixin.qq.com/s/WkMPz-eBK2Hz0ZTQEwtx6wMeshy发布全球首个3D创作AI Agent,建模成本从1000美元降至1美元
Meshy推出全球首个3D创作AI Agent,多轮对话完成从概念探索到模型导出全流程;打通生成、编辑、风格统一、打印检查与多格式导出,把单点生成工具升级为3D资产生产工作流入口。建模成本从约1000美元降至1美元、速度提升近千倍,已服务超千万用户、生成超1亿个3D模型。
来源:https://mp.weixin.qq.com/s/lk9WIL0AFCHW1yv2yekIbgCodex协助天体物理学家改写黑洞模拟,部分计算提速千倍
亚利桑那大学Chi-kwan Chan借助OpenAI Codex改进黑洞等离子体模拟算法,Codex帮助推导候选算法、发现新坐标变换与数值方法,某些计算速度据称可提升至1000倍。研究者强调AI不替代人,所有方案仍需实现验证,决策只在测试之后,保持可重复性基础。
来源:https://mp.weixin.qq.com/s/cjRQLHRIyiWR2OWNSRfcaQRamp报告:头部企业人均月花5万养AI,分层差距达680倍
Ramp最新AI Index显示,采用程度前1%企业人均每月AI支出达7500美元(约5万元人民币),上月环比涨14.1%。Token单价两年下降98%,但智能体放大用量令企业AI总账单上涨约320%,年均预算从120万增至700万美元;前1%与中位数公司支出差距高达680倍。
来源:https://mp.weixin.qq.com/s/gIlyBXnshWkMGpLcPrRQSarah Guo:能被Benchmark衡量的工作,都不是创业方向
Conviction创始人Sarah Guo撰文反驳"AI绝望论",认为凡可被基准测量的工作终将被商品化;真正有价值的工作天生"不可读",正确性只存在于企业私有数据与封闭系统中。应用公司机会在于做脏活、定义行业"什么叫好",用私有数据训练专用模型,而非在通用任务上硬拼算力。
来源:https://mp.weixin.qq.com/s/vJegO13eO0c4BumeWb6kxQAI安全漏洞事件
微软披露智能体AI系统七大新型安全故障模式
微软发布更新版《智能体AI系统故障模式分类》,在2025年首版基础上新增七种故障模式:智能体供应链攻击、目标劫持、智能体间信任提权、计算机使用智能体视觉攻击、会话上下文污染、MCP/插件滥用、能力与架构信息泄露。推动扩展的四大背景:智能体技术走向主流、MCP生态系统成熟、计算机使用智能体兴起、研究人员积累更多真实案例。建议为每个已部署智能体生成SBOM,以密码学方式验证身份,将新故障模式纳入红队测试矩阵。
来源:https://news.sina.cn/ai/2026-06-11/detail-inicaenm0660939.d.html黑客利用核武器设计提示词对抗AI恶意代码分析
黑客在恶意代码顶部添加生物武器合成和核武器设计提示词,利用AI模型内置的安全对齐策略——当检测到涉及危险内容时直接拒绝回答——导致自动化安全AI智能体在扫描时触发安全策略而终止分析,从而绕过检测。该手法主要针对自动化安全AI智能体,提示词放在恶意脚本顶部并用注释符号标注,脚本执行时不产生实际影响,但AI模型分析代码时会先读取到提示词并触发安全拦截。
来源:安全研究报告Langflow路径遍历漏洞CVE-2026-5027正遭在野利用
安全研究人员确认,开源AI应用开发平台Langflow的路径遍历漏洞CVE-2026-5027(CVSS 8.8)正在被积极利用。漏洞存在于POST /api/v2/files端点,攻击者可通过构造恶意filename参数实现任意文件写入,结合Langflow默认开启的自动登录机制,无需任何凭证即可完成利用,最终通过cron注入实现root权限远程代码执行。全球约7000个Langflow实例暴露在互联网上。
来源:https://www.tenable.com/plugins/90667Agent安全
360上报Flowise平台13个0day,AI基础设施安全再敲警钟
360漏洞挖掘智能体在开源AI应用搭建平台Flowise中自动发现13个0day漏洞,涉及身份认证、权限控制、跨组织访问等安全问题;若被利用,攻击者可窃取企业AI模型密钥、篡改业务数据或干扰系统运行。Flowise GitHub星标超5.3万,已被Workday收购并纳入HR、财务等核心业务场景;公网可见实例超3万。相关漏洞已上报CNNVD并反馈项目方,其中8个已获确认,部分已完成修复。
来源:https://so.html5.qq.com/page/real/searchnews?docid=700000210146a29137e94052语法约束解码可绕过大模型安全对齐,JSON格式化成为新攻击面
最新研究论文揭示,广泛使用的"语法约束解码"(GCD)技术存在严重安全隐患。通过强制模型输出符合特定语法格式(如JSON或特定代码格式),攻击者可轻易绕过大模型的安全对齐防御,诱导其生成恶意代码。语法约束解码本意是引导模型输出结构化内容,却成了安全防线的薄弱环节。
来源:https://arxiv.org/abs/2606.11817AI安全标准
《智能助手类智能体安全分级规范与建设指南》正式发布,L1-L5五级体系
新华网联合中国信息通信研究院等单位正式发布该指南,构建L1-L5五级递进式智能体安全分级体系:L1基础级(基本合规底线)、L2进阶级(常规风险抵御)、L3自主级(全生命周期防护)、L4协同级(跨系统安全协同)、L5自治级(纵深防御与高级威胁抵御)。围绕"输入→感知→决策→记忆→工具→执行→协作"运行闭环细化刚性安全要求,并在政务、金融、医疗等高危领域设置场景化增强要求。
来源:http://www.xinhuanet.com/digital/20260611/1c9dd2197b214716b3a49bad0062fcf8/c.htmlAI安全工具
NVIDIA garak:LLM漏洞扫描器,被称为"LLM版nmap"
garak是面向LLM的红队与安全评估工具,可检测幻觉、数据泄露、提示注入、越狱、毒性生成等多种弱点。由NVIDIA Research维护,支持Hugging Face Hub、OpenAI API、Replicate、NIM等多种LLM接口。
来源:https://github.com/NVIDIA/garakNVIDIA SkillSpector:Agent Skill安全扫描器,64种检测模式
SkillSpector是NVIDIA推出的AI Agent技能安全扫描工具,可在安装前检测技能中的漏洞、恶意模式和安全风险。内置64种漏洞检测模式,覆盖提示注入、数据外泄、权限提升、供应链攻击等16个类别;支持两阶段分析(快速静态+可选LLM语义评估)和0-100风险评分。
来源:https://github.com/NVIDIA/SkillSpectorSnyk agent-scan:自动发现AI客户端及MCP/Skill安全风险
Snyk agent-scan可自动发现本机安装的AI客户端(如Claude Desktop、Cursor等)及其连接的MCP服务器与技能,扫描其中是否存在提示注入、工具投毒等风险。支持15+风险类别,提供CLI模式与CI/CD集成,可输出JSON/SARIF等结构化报告。
来源:https://github.com/snyk/agent-scanAI安全法律与治理
G7 AI与安全政策研讨会在巴黎举行,推进国际治理协同
6月12日,G7 AI与安全政策研讨会在巴黎举行,聚焦推进国际AI治理协同倡议。两场专题讨论关注快速演变的政策挑战,各方认为制定协调一致的国际AI治理措施既关键又现实可行。研讨会讨论了AI安全治理框架、跨境AI安全合作机制等议题,旨在为全球AI安全治理提供政策共识。
来源:G7官方微软发布智能体安全治理指南:借鉴人类员工管理实现默认安全
微软发布智能体AI安全治理指南,指出智能体的安全管控须借鉴人类员工管理逻辑,实现"默认安全"。通过智能体网关、身份权限管理、分布式追踪及Model Armor等工具构建纵深防御体系,同时提出"弹性智能"概念,认为持续学习的智能体无需退役,可在运行时动态优化行为。
来源:微软安全博客CISA发布BOD 26-04:首次将"AI驱动网络威胁"写入联邦漏洞修复标准
美国网络安全与基础设施安全局(CISA)发布约束性操作指令BOD 26-04,要求联邦机构按四个维度(资产暴露面、KEV状态、利用自动化程度、技术影响)对漏洞进行分级修复。最高优先级漏洞须3天内完成修复并开展取证分析。该指令首次将"AI驱动的网络威胁"作为核心考量因素写入文件,标志着美国联邦网络安全防御体系的一次重大范式转变。
来源:https://www.darkreading.com/cyber-risk/cisa-rewrites-federal-patching-requirements-ai-threat-era安全会议
第8届智源大会举行,AI智能体安全论坛成焦点
第8届智源大会于6月12-13日在北京举行,汇聚200余位顶尖专家学者与40余位AI企业CEO及联合创始人,共同探讨Agent、世界模型、具身智能、AI自进化与AI安全等前沿议题。AI智能体安全论坛由智源研究院和安远AI联合主办,聚焦"研究与工程的交汇点",围绕自主智能体风险治理、安全评测、红队攻防、安全护栏与AI原生安全基础设施等方向展开讨论,推动智能体安全走向可验证、可落地的系统能力。
来源:智源大会官方
夜雨聆风