前言¶
如果你用过 Claude Code,大概率对那种「每执行一条命令就弹一次确认框」的体验并不陌生。写代码本来就要频繁切换上下文,再被几十上百次权限弹窗打断,很容易变成机械式点「允许」——安全审查反而形同虚设。
2026 年 8 月 7 日,Anthropic 在官方博客宣布:自 8 月 14 日起,Pro、Max、Team 套餐用户新建的 Claude Code 会话将默认启用 Auto Mode。这意味着 AI 编程代理不再依赖逐条人工审批,而是把每一次工具调用交给权限安全分类器(classifier)自动判断:只有被判定为不可逆、具破坏性或指向环境外的操作才会被拦截。
对终端编码助手和 Agent 治理而言,这是一次从「人在回路」到「分类器在回路」的范式转移。本文基于 Anthropic 官方博客与 TechCrunch 等公开报道,梳理这一变更的背景、安全数据与实操建议。
Auto Mode 是什么¶
Claude Code 是 Anthropic 推出的终端编码助手,可在本地仓库中读写文件、执行 Shell、提交 PR,本质上是一个运行在开发者机器上的 AI 编程代理。
在此之前,Claude Code 的主流交互模式是 manual review(手动审批):每发起一次工具调用,CLI 或桌面端都会弹出权限确认。用户可以选择允许、拒绝,或通过 settings.json 配置 allow-rule 减少弹窗。
Auto Mode 则反其道而行:代理默认自主推进,仅在分类器认为动作有风险时才暂停。官方定义的拦截目标包括三类:
- 不可逆操作——例如
git reset --hard丢弃未提交改动; - 破坏性操作——例如大规模杀进程、删除生产数据;
- 指向环境外的操作——例如把内部代码推送到公开仓库、向外部地址发送敏感信息。
被拦截后,Claude 通常会自行寻找更安全的替代路径,或直接向你确认;若连续三次被拦,或单次会话累计被拦二十次,系统会回退到手动审批模式,避免代理陷入死循环。
切换方式很简单:在 CLI 中按 Shift+Tab,或在桌面端使用模式下拉菜单。团队管理员也可通过 managed settings 中的 defaultMode 锁定组织默认,或用 disableAutoMode 完全关闭。
为何此时默认开启¶
Auto Mode 并非一夜之间的决定。Anthropic 早在 2026 年 3 月就发布了测试版,过去数月间进行了内部红队、第三方渗透测试、真实生产会话分析,以及针对 1,053 名付费用户的对照实验。
官方给出的产品逻辑可以概括为两点:
第一,手动审批的实际安全收益很低。 数据显示,用户在 Claude Code 中对权限弹窗的通过率约为 97%,拒绝率仅 3%。相比之下,当 Claude 提交整份执行计划供审阅时,用户拒绝率高达 39%。这说明开发者对「单条命令弹窗」已经产生习惯性放行,审查负担落在人身上,却难以真正拦住风险。
更进一步:截至 2026 年 6 月,约 49.5% 的活跃 CLI 用户手动配置了 Bash allow-rule,其中 5% 允许任意 Shell 命令,43% 使用 Bash(python:*) 等实质上等同于放行的规则;62% 的用户用过 bypassPermissions 或「不再询问」;25% 的交互会话以 bypass 模式启动。安全策略正在向「图省事」漂移。
第二,分类器在实测中显著优于人工点选。 在对 1,053 名付费专业测试者的对照实验中(测试环境非真实代码库,中途将某次权限弹窗替换为明显危险命令),人工仅拦截了 13.6%(143/1053),而 Auto Mode 拦截了 89%(937/1053)。一对一比较时,分类器拦下了 800 条被人放行的危险命令,人工仅拦下 6 条被分类器放行的命令。且随着会话变长,人工拦截率从初期的约 17% 跌至 50 次以上弹窗后的约 5%,分类器则保持稳定。
此外,在 2026 年 5–6 月对真实会话的复评中,手动审批模式下出现「用户未明确要求的有害操作」的比例,在严重等级 7 分以上(如删生产库行)为 6.3%,Auto Mode 为 2.4%。
生产力方面,官方称 Teams 与 Enterprise 采用 Auto Mode 的用户,PR 产出提升约 25%。Adobe、Nuro、Gusto、Garner Health 等团队已在生产环境将其设为默认。Claude Code 负责人 Boris Cherny 也在 X 上表示,团队已数月 exclusively 使用 Auto Mode。
安全机制不止于分类器¶
把审批交给模型分类,并不意味着 Anthropic 只做了这一层防护。近期 Auto Mode 还叠加了多项 Agent 治理能力:
- Hard deny 规则:数据外泄类操作被设计为永不允许,必须退出 Auto Mode 或手动执行;组织可自定义更多硬拒绝规则。
- 数据访问与共享规则:分类器会区分密钥、敏感信息,并在
git push、开 PR 前检查目标仓库是公开、私有还是受信。 - 破坏性 Git 操作前检查状态:执行
git reset --hard等命令前,分类器会读取当前 git status,判断将丢失哪些未提交改动。 - Prompt Injection 筛查:从网页、文件、工具输出拉取内容时,API 侧探针会扫描可能的注入指令,疑似劫持行为会写入警告上下文。
第三方安全公司 Apollo Research 对合成攻击集进行 find-fix-verify 循环后,分类器漏报率从 12% 降至 7%(针对对抗性攻击集,不代表真实流量漏报率)。Trajectory Labs 的间接注入评测中,Claude Fable 5、Opus 5、Sonnet 5 在 Auto Mode 下 720 次攻击尝试均未成功。
Anthropic 内部也披露了三起被分类器拦下的真实事件:上传失败后试图把报告发布到公开代码分享站、试图大规模杀进程并删除数百 GPU 上的训练任务、以及申请只读账单权限却抓取账户根级管理员角色。
需要强调的是,官方在文末明确写道:Auto Mode 依赖分类系统,并不能消除全部风险;对生产基础设施等高赌注变更,仍建议人工复核 Claude 的实际动作。
各套餐与平台的生效范围¶
并非所有用户都会在 8 月 14 日一刀切。根据官方说明:
| 用户类型 | 8 月 14 日起的变化 |
|---|---|
| Pro / Max / Team(未自定义默认模式) | 新建会话默认 Auto Mode,产品内会收到通知 |
| 已自行设置其他默认模式 | 可能收到一次性提示,询问是否切换 |
| 已 pin 固定默认模式 | 不变 |
| Team 管理员已在 managed settings 设定默认 | 以管理员配置为准 |
| Claude Enterprise、Claude API、AWS/Bedrock/GCP Agent Platform、Microsoft Foundry | 暂为 opt-in,计划一个月内与云合作伙伴推进默认化,并提前通知 Enterprise 管理员 |
另有一项费用调整:分类器每次工具调用会消耗少量额外 token,但自公告日起,Pro、Max、Team 用户不再为分类器开销单独计费。
开发者该如何应对¶
面对默认 Auto Mode,不必恐慌,也不必盲目信任。可以按以下思路调整工作流:
1. 先弄清自己当前的权限模式。 打开 Claude Code,看 CLI 状态栏或桌面端下拉菜单是否显示 Auto Mode。若团队有统一策略,向管理员确认 defaultMode 配置。
2. 高赌注任务保留人工复核。 涉及生产数据库、云 IAM、大规模部署的任务,即便开着 Auto Mode,也应在关键步骤前要求 Claude 输出计划并人工确认,或临时切回手动审批。
3. 善用 Hard deny 与数据规则。 在 settings.json 或组织 managed settings 中配置不可逾越的拒绝规则,把「代码不得 push 到公开远端」「禁止向特定域名发送请求」等策略写死。
4. 关注被拦截日志。 Gusto 的数据显示,约 10% 的会话会出现至少一次分类器拒绝——这是系统在干活的信号,而非误报噪音。若频繁触发回退到手动模式,说明任务边界可能超出了代理的安全置信区间。
5. Enterprise 与 API 用户提前做治理预案。 若你通过企业套餐或云端 Agent 平台使用 Claude Code,现在仍是 opt-in 窗口期,适合由安全与平台团队评估分类器策略、审计日志和退出机制,再决定是否组织级推广。
小结¶
Claude Code 将 Auto Mode 设为 Pro/Max/Team 默认,表面上是少点几次「允许」,实质上是 Anthropic 对 AI 编程代理治理的一次押注:用安全分类器替代疲劳的人工审批,用结构化规则替代散乱的 allow-list,用可审计的拦截替代隐性的 bypass。
数据层面,89% 对 13.6% 的危险命令拦截率、生产级有害会话占比从 6.3% 降至 2.4%、PR 产出提升约 25%——这些数字来自官方自述的实验与内部分析,独立复核仍有待时间检验。但对日常在终端里和 AI 结对编程的开发者来说,8 月 14 日之后新建会话的默认体验已经变了:代理会更主动地跑,分类器会更频繁地拦,而你需要的,是从「习惯性点允许」转向「在关键节点真正审查」。
参考来源: