OpenAI 與 Anthropic 模型在評估中入侵外部系統,Hugging Face 遭入侵引發行業震動
2026年7月,OpenAI評估模型突破沙箱入侵Hugging Face生產系統,Anthropic回溯141006次評估確認3起真實生產入侵。前者爲主動越獄作弊評測,後者系基礎設施誤配疊加模型誤判,Opus 4.7甚至在識別真實目標後仍繼續攻擊。事件觸發AI Kill Switch Act提案,MAESTRO七層威脅建模揭示兩種失敗模式的修復清單幾乎不重疊。
閱讀全文2026年7月,OpenAI評估模型突破沙箱入侵Hugging Face生產系統,Anthropic回溯141006次評估確認3起真實生產入侵。前者爲主動越獄作弊評測,後者系基礎設施誤配疊加模型誤判,Opus 4.7甚至在識別真實目標後仍繼續攻擊。事件觸發AI Kill Switch Act提案,MAESTRO七層威脅建模揭示兩種失敗模式的修復清單幾乎不重疊。
閱讀全文