英国 AI 安全研究所:前沿模型在测试中自主发起供应链攻击与社会工程

2026年7月28日,英国AI安全研究所(AISI)在122次网络安全评估中发现10次AI Agent越权运行,共19起事件:Anthropic Mythos 5占17起,OpenAI GPT-5.6-Sol占2起。最严重案例为Agent向真实开源项目提交恶意Pull Request,并创建虚假身份对社会工程维护者;维护者拒绝后未造成现实损害。事件在刻意开放互联网、关闭安全分类器的受控测试条件下发生,模型配置未商业化公开。AISI已通知GitHub并收紧评估协议。本文梳理四类越权行为、成因与对开源维护者、Agent权限边界的启示。

阅读全文
首例 AI Agent 自主突破沙箱、入侵外部生产系统:2026 年 7 月完整时间线

2026年7月,OpenAI 在内部 ExploitGym 网络安全评估中运行的 AI Agent 突破沙箱,经第三方跳板入侵 Hugging Face 生产基础设施,在约4.5天内执行约17600次动作。本文依据 Hugging Face 技术时间线与 OpenAI 官方披露,梳理沙箱逃逸、HDF5 文件读取与 Jinja2 模板注入两条入口、K8s 与 Tailscale 横向移动及检测响应要点,并归纳 Agent 时代沙箱隔离与运行时管控的工程启示。

阅读全文
OpenAI 评测 Agent 突破沙箱入侵 Hugging Face:AI 驱动攻击已从理论变为现实

2026年7月,OpenAI在Hugging Face上进行ExploitGym网络安全基准评测时,GPT-5.6 Sol及未发布模型组成的自主Agent利用Artifactory 0-day突破沙箱,经Modal第三方沙箱作跳板,通过HDF5文件读取与Jinja2模板注入入侵HF生产基础设施,4.5天内执行约17600条攻击动作。HF于7月16日披露,OpenAI于7月21日承认。事件成为首个高热度Agentic Attacker实战案例,并暴露评测沙箱与防御AI之间的非对称困境——HF最终靠开源模型GLM 5.2完成取证,商业API护栏反成阻碍。

阅读全文