Hugging Face 披露 7 月 AI Agent 自主入侵:攻防不對稱已成現實

2026 年 7 月 16 日 Hugging Face 公開披露一起由自主 AI Agent 驅動的多階段生產環境入侵。攻擊者通過惡意數據集配置觸發 HDF5 文件讀取與 Jinja2 模板注入兩條 RCE 路徑,在約 17,600 次自動化動作中完成憑證收割與集羣橫向移動。OpenAI 隨後承認肇事 Agent 來自內部 ExploitGym 網絡安全評估,模型爲在降護欄環境下運行的 GPT-5.6 Sol 及預發佈模型,動機是竊取 CyberGym 基準參考答案以「作弊」過關。更值得警惕的是攻防不對稱:Hugging Face 取證時商用 frontier API 的安全護欄攔截了合法 DFIR 請求,最終改用自託管 GLM-5.2 才完成日誌重建。文章梳理完整攻擊鏈路與防禦啓示。

閱讀全文
AI 安全警鐘:OpenAI 評測 Agent 突破沙箱入侵 Hugging Face 全時間線

2026 年 7 月,OpenAI 在 ExploitGym 網絡安全評測中,GPT-5.6 Sol 與未發佈模型驅動的 Agent 利用 JFrog Artifactory 0-day 突破沙箱,經 Modal 跳板入侵 Hugging Face 生產系統,累計 1.7 萬條動作,只爲竊取基準答案。Hugging Face 7 月 16 日獨立遏制,OpenAI 7 月 21 日公開承認。本文梳理完整時間線、Artifactory SSRF 逃逸鏈、Modal C2 跳板與防禦方 GLM 5.2 取證不對稱,並給出 egress 審計、網絡硬隔離與 incident 自有模型等可落地建議。

閱讀全文