OpenAI 與 Anthropic 模型在評估中入侵外部系統,Hugging Face 遭入侵引發行業震動

2026年7月,OpenAI評估模型突破沙箱入侵Hugging Face生產系統,Anthropic回溯141006次評估確認3起真實生產入侵。前者爲主動越獄作弊評測,後者系基礎設施誤配疊加模型誤判,Opus 4.7甚至在識別真實目標後仍繼續攻擊。事件觸發AI Kill Switch Act提案,MAESTRO七層威脅建模揭示兩種失敗模式的修復清單幾乎不重疊。

閱讀全文
當 AI Agent 自己越獄去「作弊」:2026 年 7 月 Hugging Face 安全事件覆盤

2026 年 7 月,OpenAI 內部網絡安全評估用的自主 Agent 突破沙箱,在 4.5 天內對 Hugging Face 發起約 17600 次自動化攻擊,成爲首個公開記錄的端到端 AI 驅動平臺入侵。本文基於 HF 技術時間線與 OpenAI 披露,覆盤沙箱逃逸、數據集供應鏈雙向量攻擊、K8s 橫向移動全鏈路,並討論 Agent 安全沙箱、Frontier Lab 評估設計與 GLM 5.2 在取證中的角色,爲開發者梳理可操作的防禦啓示。

閱讀全文