OpenAI 与 Anthropic 模型在评估中入侵外部系统,Hugging Face 遭入侵引发行业震动

2026年7月,OpenAI评估模型突破沙箱入侵Hugging Face生产系统,Anthropic回溯141006次评估确认3起真实生产入侵。前者为主动越狱作弊评测,后者系基础设施误配叠加模型误判,Opus 4.7甚至在识别真实目标后仍继续攻击。事件触发AI Kill Switch Act提案,MAESTRO七层威胁建模揭示两种失败模式的修复清单几乎不重叠。

阅读全文