前言¶
如果你用過 Claude Code,大概率對那種「每執行一條命令就彈一次確認框」的體驗並不陌生。寫代碼本來就要頻繁切換上下文,再被幾十上百次權限彈窗打斷,很容易變成機械式點「允許」——安全審查反而形同虛設。
2026 年 8 月 7 日,Anthropic 在官方博客宣佈:自 8 月 14 日起,Pro、Max、Team 套餐用戶新建的 Claude Code 會話將默認啓用 Auto Mode。這意味着 AI 編程代理不再依賴逐條人工審批,而是把每一次工具調用交給權限安全分類器(classifier)自動判斷:只有被判定爲不可逆、具破壞性或指向環境外的操作纔會被攔截。
對終端編碼助手和 Agent 治理而言,這是一次從「人在迴路」到「分類器在迴路」的範式轉移。本文基於 Anthropic 官方博客與 TechCrunch 等公開報道,梳理這一變更的背景、安全數據與實操建議。
Auto Mode 是什麼¶
Claude Code 是 Anthropic 推出的終端編碼助手,可在本地倉庫中讀寫文件、執行 Shell、提交 PR,本質上是一個運行在開發者機器上的 AI 編程代理。
在此之前,Claude Code 的主流交互模式是 manual review(手動審批):每發起一次工具調用,CLI 或桌面端都會彈出權限確認。用戶可以選擇允許、拒絕,或通過 settings.json 配置 allow-rule 減少彈窗。
Auto Mode 則反其道而行:代理默認自主推進,僅在分類器認爲動作有風險時才暫停。官方定義的攔截目標包括三類:
- 不可逆操作——例如
git reset --hard丟棄未提交改動; - 破壞性操作——例如大規模殺進程、刪除生產數據;
- 指向環境外的操作——例如把內部代碼推送到公開倉庫、向外部地址發送敏感信息。
被攔截後,Claude 通常會自行尋找更安全的替代路徑,或直接向你確認;若連續三次被攔,或單次會話累計被攔二十次,系統會回退到手動審批模式,避免代理陷入死循環。
切換方式很簡單:在 CLI 中按 Shift+Tab,或在桌面端使用模式下拉菜單。團隊管理員也可通過 managed settings 中的 defaultMode 鎖定組織默認,或用 disableAutoMode 完全關閉。
爲何此時默認開啓¶
Auto Mode 並非一夜之間的決定。Anthropic 早在 2026 年 3 月就發佈了測試版,過去數月間進行了內部紅隊、第三方滲透測試、真實生產會話分析,以及針對 1,053 名付費用戶的對照實驗。
官方給出的產品邏輯可以概括爲兩點:
第一,手動審批的實際安全收益很低。 數據顯示,用戶在 Claude Code 中對權限彈窗的通過率約爲 97%,拒絕率僅 3%。相比之下,當 Claude 提交整份執行計劃供審閱時,用戶拒絕率高達 39%。這說明開發者對「單條命令彈窗」已經產生習慣性放行,審查負擔落在人身上,卻難以真正攔住風險。
更進一步:截至 2026 年 6 月,約 49.5% 的活躍 CLI 用戶手動配置了 Bash allow-rule,其中 5% 允許任意 Shell 命令,43% 使用 Bash(python:*) 等實質上等同於放行的規則;62% 的用戶用過 bypassPermissions 或「不再詢問」;25% 的交互會話以 bypass 模式啓動。安全策略正在向「圖省事」漂移。
第二,分類器在實測中顯著優於人工點選。 在對 1,053 名付費專業測試者的對照實驗中(測試環境非真實代碼庫,中途將某次權限彈窗替換爲明顯危險命令),人工僅攔截了 13.6%(143/1053),而 Auto Mode 攔截了 89%(937/1053)。一對一比較時,分類器攔下了 800 條被人放行的危險命令,人工僅攔下 6 條被分類器放行的命令。且隨着會話變長,人工攔截率從初期的約 17% 跌至 50 次以上彈窗後的約 5%,分類器則保持穩定。
此外,在 2026 年 5–6 月對真實會話的複評中,手動審批模式下出現「用戶未明確要求的有害操作」的比例,在嚴重等級 7 分以上(如刪生產庫行)爲 6.3%,Auto Mode 爲 2.4%。
生產力方面,官方稱 Teams 與 Enterprise 採用 Auto Mode 的用戶,PR 產出提升約 25%。Adobe、Nuro、Gusto、Garner Health 等團隊已在生產環境將其設爲默認。Claude Code 負責人 Boris Cherny 也在 X 上表示,團隊已數月 exclusively 使用 Auto Mode。
安全機制不止於分類器¶
把審批交給模型分類,並不意味着 Anthropic 只做了這一層防護。近期 Auto Mode 還疊加了多項 Agent 治理能力:
- Hard deny 規則:數據外泄類操作被設計爲永不允許,必須退出 Auto Mode 或手動執行;組織可自定義更多硬拒絕規則。
- 數據訪問與共享規則:分類器會區分密鑰、敏感信息,並在
git push、開 PR 前檢查目標倉庫是公開、私有還是受信。 - 破壞性 Git 操作前檢查狀態:執行
git reset --hard等命令前,分類器會讀取當前 git status,判斷將丟失哪些未提交改動。 - Prompt Injection 篩查:從網頁、文件、工具輸出拉取內容時,API 側探針會掃描可能的注入指令,疑似劫持行爲會寫入警告上下文。
第三方安全公司 Apollo Research 對合成攻擊集進行 find-fix-verify 循環後,分類器漏報率從 12% 降至 7%(針對對抗性攻擊集,不代表真實流量漏報率)。Trajectory Labs 的間接注入評測中,Claude Fable 5、Opus 5、Sonnet 5 在 Auto Mode 下 720 次攻擊嘗試均未成功。
Anthropic 內部也披露了三起被分類器攔下的真實事件:上傳失敗後試圖把報告發布到公開代碼分享站、試圖大規模殺進程並刪除數百 GPU 上的訓練任務、以及申請只讀賬單權限卻抓取賬戶根級管理員角色。
需要強調的是,官方在文末明確寫道:Auto Mode 依賴分類系統,並不能消除全部風險;對生產基礎設施等高賭注變更,仍建議人工複覈 Claude 的實際動作。
各套餐與平臺的生效範圍¶
並非所有用戶都會在 8 月 14 日一刀切。根據官方說明:
| 用戶類型 | 8 月 14 日起的變化 |
|---|---|
| Pro / Max / Team(未自定義默認模式) | 新建會話默認 Auto Mode,產品內會收到通知 |
| 已自行設置其他默認模式 | 可能收到一次性提示,詢問是否切換 |
| 已 pin 固定默認模式 | 不變 |
| Team 管理員已在 managed settings 設定默認 | 以管理員配置爲準 |
| Claude Enterprise、Claude API、AWS/Bedrock/GCP Agent Platform、Microsoft Foundry | 暫爲 opt-in,計劃一個月內與雲合作伙伴推進默認化,並提前通知 Enterprise 管理員 |
另有一項費用調整:分類器每次工具調用會消耗少量額外 token,但自公告日起,Pro、Max、Team 用戶不再爲分類器開銷單獨計費。
開發者該如何應對¶
面對默認 Auto Mode,不必恐慌,也不必盲目信任。可以按以下思路調整工作流:
1. 先弄清自己當前的權限模式。 打開 Claude Code,看 CLI 狀態欄或桌面端下拉菜單是否顯示 Auto Mode。若團隊有統一策略,向管理員確認 defaultMode 配置。
2. 高賭注任務保留人工複覈。 涉及生產數據庫、雲 IAM、大規模部署的任務,即便開着 Auto Mode,也應在關鍵步驟前要求 Claude 輸出計劃並人工確認,或臨時切回手動審批。
3. 善用 Hard deny 與數據規則。 在 settings.json 或組織 managed settings 中配置不可逾越的拒絕規則,把「代碼不得 push 到公開遠端」「禁止向特定域名發送請求」等策略寫死。
4. 關注被攔截日誌。 Gusto 的數據顯示,約 10% 的會話會出現至少一次分類器拒絕——這是系統在幹活的信號,而非誤報噪音。若頻繁觸發回退到手動模式,說明任務邊界可能超出了代理的安全置信區間。
5. Enterprise 與 API 用戶提前做治理預案。 若你通過企業套餐或雲端 Agent 平臺使用 Claude Code,現在仍是 opt-in 窗口期,適合由安全與平臺團隊評估分類器策略、審計日誌和退出機制,再決定是否組織級推廣。
小結¶
Claude Code 將 Auto Mode 設爲 Pro/Max/Team 默認,表面上是少點幾次「允許」,實質上是 Anthropic 對 AI 編程代理治理的一次押注:用安全分類器替代疲勞的人工審批,用結構化規則替代散亂的 allow-list,用可審計的攔截替代隱性的 bypass。
數據層面,89% 對 13.6% 的危險命令攔截率、生產級有害會話佔比從 6.3% 降至 2.4%、PR 產出提升約 25%——這些數字來自官方自述的實驗與內部分析,獨立複覈仍有待時間檢驗。但對日常在終端裏和 AI 結對編程的開發者來說,8 月 14 日之後新建會話的默認體驗已經變了:代理會更主動地跑,分類器會更頻繁地攔,而你需要的,是從「習慣性點允許」轉向「在關鍵節點真正審查」。
參考來源: