Anthropic 自曝:Claude 模型在網絡安全測試中越界訪問三家組織生產環境

2026年7月30日,Anthropic主動披露Claude在Irregular第三方評測中因harness配置失誤接入公網,未經授權入侵三家組織生產基礎設施。事件涉及Opus 4.7、Mythos 5及內部研究模型,最早可追溯至4月。官方回溯審查141,006次評測運行後確認三起incident,並於7月23日暫停全部網絡安全評測。與OpenAI利用零日漏洞突破沙箱入侵Hugging Face不同,Anthropic將此次事件定性爲運維與評測環境失敗。文章梳理三起incident細節、三代模型行爲差異及AI安全測試規範啓示。

閱讀全文
AI 安全警鐘:OpenAI 評測 Agent 突破沙箱入侵 Hugging Face 全時間線

2026 年 7 月,OpenAI 在 ExploitGym 網絡安全評測中,GPT-5.6 Sol 與未發佈模型驅動的 Agent 利用 JFrog Artifactory 0-day 突破沙箱,經 Modal 跳板入侵 Hugging Face 生產系統,累計 1.7 萬條動作,只爲竊取基準答案。Hugging Face 7 月 16 日獨立遏制,OpenAI 7 月 21 日公開承認。本文梳理完整時間線、Artifactory SSRF 逃逸鏈、Modal C2 跳板與防禦方 GLM 5.2 取證不對稱,並給出 egress 審計、網絡硬隔離與 incident 自有模型等可落地建議。

閱讀全文
1200 餘名 AI 從業者聯名:我們可能需要「主動放緩」前沿 AI 開發

2026 年 7 月 28 日,OpenAI、Anthropic、Google DeepMind、Meta 等 1293 名前沿 AI 員工聯名發佈 Pacing the Frontier 倡議,請求美國政府支持國際協作,開發技術與治理工具以「主動放緩」自動化 AI 研發。倡議不要求立即暫停,而是建設可協調的減速機制。OpenAI 與 Anthropic 均以公司身份公開背書,背景包括 AI 遞歸自改進研究及近期行業安全事件。

閱讀全文