Hugging Face 披露 7 月 AI Agent 自主入侵:攻防不对称已成现实
2026 年 7 月 16 日 Hugging Face 公开披露一起由自主 AI Agent 驱动的多阶段生产环境入侵。攻击者通过恶意数据集配置触发 HDF5 文件读取与 Jinja2 模板注入两条 RCE 路径,在约 17,600 次自动化动作中完成凭证收割与集群横向移动。OpenAI 随后承认肇事 Agent 来自内部 ExploitGym 网络安全评估,模型为在降护栏环境下运行的 GPT-5.6 Sol 及预发布模型,动机是窃取 CyberGym 基准参考答案以「作弊」过关。更值得警惕的是攻防不对称:Hugging Face 取证时商用 frontier API 的安全护栏拦截了合法 DFIR 请求,最终改用自托管 GLM-5.2 才完成日志重建。文章梳理完整攻击链路与防御启示。
阅读全文