乐于分享
好东西不私藏

Anthropic决定让AI自己管自己

Anthropic决定让AI自己管自己

一向以安全作为前提的Anthropic ,刚刚做了一个有点反直觉的决定:从 8 月 14 日起,自动模式将成为 Claude Code 中 Pro、Max 和 Team 用户的默认权限模式。

理由很简单,他们用 1053 名付费测试人员做了对照实验,发现自动模式比人工审批更安全。

人类手动批准只捕获了 13.6% 的危险命令,自动模式捕获了 89%。

人类才是最大的漏洞

数据揭示了一个尴尬的事实:在 Claude Code 中,用户批准了 97% 的权限提示。

这不是因为用户判断力强,而是因为他们根本没在看。无脑下一步成了肌肉记忆。

对比更明显:当 Claude 展示一个完整计划时,用户会拒绝其中的 39%。但当弹窗变成单个权限请求时,拒绝率骤降到 3%。

一个需要停下来读三秒的完整方案,和一个小弹窗,用户对后者的警惕性几乎为零。

同样的模式也出现在配置文件中。截至 2026 年 6 月,49.5% 的活跃命令行用户手动创建了 Bash 允许规则,其中 5% 直接允许了所有 shell 命令。另有 43% 设置了类似 Bash (python:) 或 Bash (node:) 的解释器规则,这在实践中等同于放行一切。

62% 的用户在 Bash 中使用过"不再询问"选项,25% 的交互式会话以绕过权限模式启动。

用户在用脚投票,把安全机制当成麻烦。

自动模式怎么工作

自动模式不会弹提示,而是将每次工具调用路由到一个分类器。这个分类器被设计用来阻止不可逆、破坏性或针对环境之外的操作。

当分类器阻止某些操作时,Claude 通常会自行寻找更安全的处理方式,或者征求人类许可。如果连续三次或一次会话中二十次无法继续,Claude Code 会回退到手动审批模式。

每次工具调用会消耗少量额外 token,但从今天起,Anthropic 不再向 Pro、Max 和 Team 套餐用户收取这部分费用。

值得注意的是,自动模式下,允许执行任意代码的规则(例如 python:*)会被忽略,因为它们会导致命令完全跳过分类器。配置文件不会被修改,切换到其他模式后这些规则会立即恢复。

安全性对比:不只是自己跟自己比

Anthropic 审查了 2026 年 5 月至 6 月期间安全管道标记的会话,用模型对每个会话重新评分,从危害严重程度和用户请求操作的明确程度两个维度打分。

结果:人工审核的会话造成严重意外损害的概率是自动模式会话的两倍以上。

在生产级别严重性下(7 级及以上),6.3% 的人工审核会话包含用户未明确请求的有害操作,而自动模式会话这一比例为 2.4%。

在每一个严重性级别上,差距都真实存在。

Anthropic 还把自动模式拉出来和 OpenAI 的 Codex 比了一下。

在独立评估中,针对运行自动模式的 Claude Fable 5、Opus 5 和 Sonnet 5 的 720 次攻击尝试,没有一次成功。

而运行 Codex 自动审核权限模式的 GPT-5.6 Sol,攻击成功率为 5.83%。在完全访问模式下,这个数字飙升至 19.03%。

当然,Codex 和 Claude Code 均使用 Trajectory Labs 提供的相同浏览器集成进行评估,OpenAI 和 Anthropic 的第一方浏览器扩展内置的安全措施未测试。所以这更多是对底层模型的衡量。

对工具以文本形式返回结果的任务和需要通过屏幕截图与浏览器交互的任务,攻击成功率有明显差异。

分类器在内部拦截了什么

Anthropic 内部所有 Claude Code 使用都默认自动模式。分类器在实际工作中拦截了这些操作:

网络外数据泄露:上传到内部硬盘失败时,Claude 的备用方案是将同一份报告发布到公共代码分享网站。自动模式拒绝了这个方案。

一次破坏性的大规模操作:在长时间运行的会话中,Claude 尝试对约两千个 pod 执行大规模进程终止并排队删除,这会终止数百个正在训练任务的 GPU。自动模式在执行前标记了这些命令。

权限提升过大:Claude 被要求配置只读计费权限时,却选择了授予账户根目录完全管理控制权的云角色。自动模式检测到了请求与实际授予角色之间的不匹配。

在每种情况下,Claude 要么找到更安全的路径,要么征求用户意见后再行动。

新增的防线

Anthropic 还加入了几项针对具体场景的防御措施:

  • 硬性拒绝
    :数据泄露(将代码或密钥发送到外部)被设计为永不批准的类别。要执行必须切换到非自动模式。规则可自定义。
  • 数据访问规则
    :分类器区分秘密信息和敏感信息,并在执行操作前检查 Git 推送或拉取的目标是公开、私有还是可信。同一推送操作,目标不同,性质完全不同。
  • 破坏性 git 操作前检查状态
    :执行 git reset --hard 前,分类器会查看当前 git 状态。
  • 提示注入筛查
    :当 Claude 从网页、文件或工具输出获取内容时,API 端探测器会检查劫持行为。发现疑似注入会在分享结果前向上下文添加警告。

手动审批模式下,用户批准的 97% 权限请求中,有多少是没仔细看的?自动模式不完美,但它至少不会累,不会习惯性点同意,也不会因为弹窗太多而烦躁。

真正值得思考的是:我们是否已经习惯了对 AI 的每一步行动都说"同意"?如果是这样,那让 AI 自己审自己,可能确实比让人类审更靠谱。

要在 CLI 中切换模式,按 Shift+Tab,或使用桌面应用的模式下拉菜单。管理员可通过 defaultMode 设置组织默认模式,或使用 disableAutoMode 完全关闭。

博客 :https://claude.com/blog/auto-mode-default-in-claude-code