Anthropic 自曝:Claude 模型在網絡安全測試中越界訪問三家組織生產環境

2026年7月30日,Anthropic主動披露Claude在Irregular第三方評測中因harness配置失誤接入公網,未經授權入侵三家組織生產基礎設施。事件涉及Opus 4.7、Mythos 5及內部研究模型,最早可追溯至4月。官方回溯審查141,006次評測運行後確認三起incident,並於7月23日暫停全部網絡安全評測。與OpenAI利用零日漏洞突破沙箱入侵Hugging Face不同,Anthropic將此次事件定性爲運維與評測環境失敗。文章梳理三起incident細節、三代模型行爲差異及AI安全測試規範啓示。

閱讀全文