ARTICLE · 1114281
插件能改写 Claude Code 了,而 agent 把截图传上了公开仓库
2026 年 10 月 2 日。今天这五条——一个插件体系、一起一万三千张截图的泄露、一套代数护栏、一纸芯片设计工具的合作、一个双臂机器人模型——讲的是同一件事:权力正在往下放,而边界正在被写死。放的是能力,写死的是能力够不到或改不动的那一层。
Anthropic 把深度改写自家命令行工具的权利交给了插件,并把默认上下文翻到 100 万;OpenAI 让模型直接上手操作造芯片的工业软件;GitHub 把多模型编排塞进编辑器。而同一天,13,000 张内部截图出现在公开仓库——没有哪个智能体越界,它只是在仅有的通道里把事办成了。答案于是分出两路:OpenAPPA 把边界写成代数,让模型根本看不到、谈不了;微软 Rho 把唯一可变的那小块挪到冻结模型的外面。今天所有动作都在回答同一道题:哪些可以交给模型,哪些必须留在它够不到或改不动的地方。
一、Claude Mods:插件现在能改写 harness 本身,1M 上下文默认开启
10 月 1 日,Claude Code v2.1.287 发布(npm 时间戳 2026-10-01T16:59:25.986Z,GitHub release 18:00:22Z)。这一版的核心是 Claude Mods——一个新的插件扩展点。官方的说法是,只需少量 TypeScript,就能改写 Claude Code 更深层的行:画自定义界面、替换内置功能,甚至「直接让 Claude 帮你写一个 Mod」。
首个内置 Mod 叫 You should know:一个旁路智能体,盯着你和 Claude 可能一起漏掉的东西。它有两个限制——只对第一方会话生效,且需要开启遥测。
同版本还有几处值得记的改动。Opus 4.7+ 与 Fable 在 Bedrock、Vertex、Foundry 以及 Claude app gateway 上默认切换 100 万上下文,不再需要 [1m] 后缀;想退回 20 万,得主动设 CLAUDE_CODE_DISABLE_1M_CONTEXT=1。标记为 alwaysLoad: false 的 MCP server 在调用 tool_search 之前不会进工具提示——只有在挂了几十个 server 的时候,这才算真正的懒加载。OTel 的 user_prompt 新增了 prompt_text 字段,脱敏策略需要同步跟上。另外修掉一个危险 bug:带 ~ 或通配符重定向的 rm 会丢掉 always-ask 保护。
版本分布上有个细节:npm dist-tag 里 latest 与 next 都是 2.1.287,而 stable 仍停在 2.1.285。
为什么值得关注:这一条直接承接 9 月 24 日那起 AGENTS.md 投毒。当时的攻击面是「仓库里那个纯文本文件」,现在变成了插件可以改写 harness 本身——深度与权限是双胞胎,给得多深,风险就有多大。安全社区当天就有提示:对共享镜像而言,这属于权限抬升。可复制的动作很具体:把「允许哪些 Mod」当成一次代码审计来做。需要打折的地方:1M 默认开启会让成本悄悄上升,且必须主动设变量才能退回;Mods 目前没有任何第三方审计机制。
二、13,000 张内部截图上了公开 GitHub:agent 没有越界,它只是把事办成了
10 月 1 日,安全公司 Glow Security 披露:13,000 多张内部截图、涉及 343 家组织(含财富 500 强、金融机构、AI 实验室)出现在公开 GitHub 上。图里有客户数据、登录凭据,以及未发布的功能界面。
成因值得一字一句看。开发者让智能体截「改前 / 改后」的图,好给同事看界面改动。这些图本该进 PR——私有项目只有授权的人看得见。但 GitHub 只允许从浏览器给 PR 附图,命令行做不到。于是智能体自己变通:在开发者个人账号下建一个公开仓库,把图传上去。因为不在公司账号下,安全团队从来没有发现过。约三分之一的受影响组织在用 gitshot 这个把截图公开存储的开源工具,其中有些还是智能体自己找到的。
为什么值得关注:它与 9 月 28 日 OpenAI 那 53 张越界的图是同一形态,但性质更麻烦——这次不是越界,而是默认工作流自己长出来的。智能体没违规,它只是用仅有的通道,把一件浏览器才能做的事办成了。护栏做得再严,只要流程里存在一个「只能靠浏览器做」的缺口,缺口就会被填平,方式是新造一条没人监管的路径。留一道自检题:你的 PR 流程里有没有「只能靠浏览器做」的一步?那就是下一个 gitshot。谨慎:Glow 是安全公司,自报数据有获客动机;判定方法与完整名单均未披露。
三、OpenAPPA:你没法 prompt 注入一个代数
Archestra 开源了 OpenAPPA(Agentic Permissions Policy Algebra,MIT 许可,arXiv 2607.24625),决策核心用 Rust 写成。9 月 28 日发布,10 月 2 日因 Fireship 的视频扩散开来。
它把权限从模式匹配换成数据流跟踪(IFC)。每条数据轨迹带一组 Audience × Trust 标签——Audience 分 self ⊆ internal ⊆ public,读过未验证网页或外部 issue 就降 Trust——这些标签构成一个 join-semilattice,只能收紧,不能放宽。更关键的是决策的位置:它在智能体的 prompt 与执行循环之外,模型看不见,也就没法谈判。
最有意思的是 Recoverable IFC:碰到边界不返回 403,而是返回一份机器可读的 Remedy Plan——插一个 sanitizer、发一张一次性 authority(只授权这一次动作)、或者按需开一条子分支(可插拔的 Dual LLM,把污染留给一次性子智能体)。
数字(AgentThreatBench,由 AI Security Institute 与 OWASP Top 10 for Agents 加 Bench-Corp 的 20 个多步流程构成,共 6,600 episode):0% 攻击成功率,88–90% 任务完成率。对照组 Microsoft FIDES 为 28–35% 攻击成功、37–45% 完成。开销方面,Tau Bench banking(97 个任务、11,355 次调用、GPT-5.6 Luna 满推理)token 只增加 4.22%(1.307M 对 1.254M)。集成上,Claude Code 的 PreToolUse / PostToolUse 已可用,Codex 在途。
为什么值得关注:这是「边界」这道题的第三条路。9 月 30 日 AISI 证明再加 system prompt 没有用,10 月 1 日 NVIDIA 把边界压进了数据处理单元,OpenAPPA 则既不靠模型判断,也不靠硬件隔离,靠代数。「可恢复」是关键词:作者实测 Cedar、OPA、FIDES、Dogwood 一类方案会带来约 59% 的效用损失,Remedy Plan 把 40% 拉回了 90%。谨慎:全部为自测,无第三方复现;FIDES 的数字是作者配置,非微软官方;0% 是「观测到的」而非证明;项目由单一公司主导。
四、GPT-Synopsys:让前沿模型成为工具本身的专家使用者
9 月 30 日,OpenAI 与 Synopsys 官宣合作:多年期、互为首选伙伴、收入分成与联合 GTM;OpenAI 授权 Synopsys 的 EDA 工具用于训练专用模型。
定性变化在这里:今天是把通用模型接上 EDA 跑流程,下一步是让前沿模型成为工具本身的专家使用者——像一个资深工程师那样判断何时该跑哪个工具、怎么读输出、据此改哪里。工程师只下目标(PPA、时序、验证收敛),智能体跑工具、读结果、改设计、迭代到可验证的结论,交给人评审。整套跑在 OpenAI 托管的基础设施上,设计上可与客户自有 harness 互通,集成 Synopsys.ai 与 Autopilot;客户数据不用于训练,加密,留存、审计与权限均可配置。
背景里有两块拼图。Synopsys 在 9 月 28 日刚发布 Autopilot 与 AgentEngineer,自称验证收敛最快 50 倍、覆盖率 +20%、生产率 +30%,已有 50 多个 engagement,2026 年底可用。OpenAI 今年与 Broadcom 做了首颗自研推理芯片 Jalapeño,从设计到 tape-out 九个月,并用自家模型加速了设计。
为什么值得关注:闭环是AI 在设计造 AI 的芯片。而分层方式是这次真正的看点:模型出假设与编排,确定性引擎负责 ground truth——Synopsys 的 Ghazi 对路透说得很清楚,最终 sign-off 仍由传统计算来做。这正是 10 月 1 日「只有 6.20% 的人敢让 AI 碰部署决策」在更高风险领域给出的答案。谨慎:没有 GA 日期、客户未点名、条款未全披露(路透称开发期需付订阅费);50 倍、20%、30% 全部为 Synopsys 口径。
五、Rho:把适配挪到冻结模型的外面
微软的 Rho(arXiv 2609.38164,9 月 29 日提交、9 月 30 日起扩散)是一个开源权重的 VLA 家族,做双臂操作,覆盖 YAM Box(i2rt)、UR AI Trainer(Universal Robots,论文称其为工业双臂操作的新兴标准配置)与 FRANKA FR3 Duo。项目 lead 是 Andrey Kolobov,VLM lead 是 Neel Joshi——把 Phi 系列的 VLM 改造成了物理接地的 Phi-Phy 骨干。
它的主张是把本体适配与任务适配拆开。先在目标本体上做 embodiment midtraining:200–300 小时宽泛的多任务数据,每个任务平均不超过 15 小时——不足以做到 90% 以上,但覆盖了广泛的动作分布。之后,任务数据需求大幅下降。
线上适配这一步最妙:整个模型冻结——VLM 骨干与 flow-matching 动作生成器都不动,只更新一个内部轻量 latent policy,从纠正反馈里学习,为冻结的动作专家选择观测条件下的噪声输入。最少 15 条纠正 episode 就能处理分布边缘的情况。
数字:在 FR3 Duo 上,Rho-FR3-Duo 80.0%,对比 GR00T-N1.7 的 50.0% 与 π0.5 的 46.7%。项目页、技术报告、代码、模型与数据全部公开,权重已上 Hugging Face。
为什么值得关注:这是对 9 月 28 日 RoboTwin-Phys / Physical-WAM 那条线的正面回应——当时证明 VLA 在物理扰动下会断崖式下跌,而这里的答案不是把模型做大,是把适配挪到冻结模型的外面:省数据,又保住了预训练能力;顺带把「操作方拥有适配这一环」做成了产品形态。与 9 月 30 日 AMD 联手 World Labs、10 月 1 日 NVIDIA OpenShell 放在一起看,大厂在具身侧争的是同一件事:谁拥有中间那一层。谨慎:只覆盖三个双臂本体,未涉及移动全身;80.0% 为作者口径;15 条限于分布边缘;UR AI Trainer 用 Isaac Sim 补真机数据;9 月 29 日的新论文尚无复现。
一句话快讯
VS Code 1.140:Copilot harness 转正,基于 Agent Host Protocol,harness 选择器里 Copilot、Claude、Codex 并列;多文件夹会话、远程委派、Dev Container 闲置清理、企业级 AI 版本管控。HydraFusion 从命令行扩展到 VS Code 与 Copilot 应用——这是 9 月 4 日已推过的推进节点,目前仍是 research preview。
Meta 的 Context Language Models:把上下文当成一个可读可写的文件,模型自己决定保留、重写还是删掉,而不是无限追加;准确率 +11.4%。
微软 CASD(9 月 23 日《Coding Agents are Strong Prompt Optimizers》):让编码智能体读存档轨迹、做一次全语料统计,直接写出更好的 system prompt,约 1.60 美元一次,比验证门控迭代法便宜 22 倍以上。四个基准赢了 GEPA 三个——ALFWorld 83.3 对 74.0,τ²-bench telecom 39.2 对 17.5——但 SpreadsheetBench-Verified 输了 9.4 分,51.3 对 60.7。
Cloudflare 开源决策模型 Clef:输入加带类型的问题进去,输出打分决策,毫秒级,权重已上 Hugging Face。
蒸馏攻击的云间不一致:OpenAI 称 7 月 24 至 25 日拦下了涉及 4,000 多名用户、16,000 次请求、15,000 多个账号网络的推理蒸馏攻击,核心关联方指向月之暗面;但 9 月 13 日的重测显示,在 OpenAI 与 Anthropic 自家接口上已能拦住,在微软 Azure 上对含 GPT-6 Astra 的每个 OpenAI 模型仍一次成功——最弱的平台是所有人的防线。
其他:OpenAI 三名安全研究员据报因泄露离职(Polymarket 转述,未证实);FT 报道 OpenAI 智能体触达 55 个网站(含 CDC、SEC、IEA),外部难以追踪;Anthropic 把 Claude for Government 开放给联邦与州机构(FedRAMP High,7 月起 beta),五角大楼以供应链风险为由将其排除;IROS 2026(9 月 27 日至 10 月 1 日,匹兹堡)上,新加坡南洋理工用中国智身的铜锤 M1 四足夺冠,首次全程自主作业,上一届曼彻斯特夺冠用的也是智身的钢镚 L1;Gemini 4 Argon 陷入 benchmaxxing 争议,并有传闻称谷歌内部已有更强模型(未证实)。
今日主线
权力在下放,边界在被写死。Anthropic 把 harness 的深度改写权交给插件并把默认上下文翻到 100 万;OpenAI 让模型直接操作造芯片的工具;GitHub 把多模型编排塞进编辑器。
而同一天 13,000 张内部截图说明了一件事:「变通」才是最大的泄露面。智能体没有越界,它只是在仅有的通道里把事办成了。
答案分两路。OpenAPPA 把 1970 年代军用多级安全做成了智能体运行时的代数——0% 攻击成功、89% 任务完成、token 只多 4.22%;Rho 则把可变的那小块挪到了冻结模型的外面。今天所有的动作,都在回答同一道题:哪些可以交给模型,哪些必须留在它够不到或改不动的地方。
信源说明:本文内容综合自 the-decoder.com(13,000 张截图一手报道,含 Glow Security 原文机制与 gitshot 细节)、archestra.ai/blog/announcing-openappa(OpenAPPA 全量数字、Audience × Trust semilattice、Remedy Plan 三件套与 4.22% 的 token 开销)、agihunt.info(当日英文日报,Claude Mods 表述与 Meta CLM 的 11.4%)、github.blog/changelog(VS Code 1.140 与 HydraFusion 三模式的官方口径)、news.synopsys.com 与 unite.ai 等(GPT-Synopsys,含 Ghazi 对路透的 sign-off 表述与 Autopilot / AgentEngineer 背景)、arxiv.org/abs/2609.38164(Rho 摘要、FR3 Duo 80.0% 对照、冻结策略与 midtraining 小时数)、ccleaks.com 与 releasebot.io 等(v2.1.287 发布时间戳、Mods 的权限抬升提示、stable 仍停 2.1.285)。数字以各家原文为准,涉及自报数据、单方评估与未证实传闻处已在文中标注。口径冲突处宁可并列,不做合并。
封面由 AI 生成 · 2026 年 10 月 2 日