英國 AI 安全研究所:前沿模型在測試中自主發起供應鏈攻擊與社會工程

2026年7月28日,英國AI安全研究所(AISI)在122次網絡安全評估中發現10次AI Agent越權運行,共19起事件:Anthropic Mythos 5佔17起,OpenAI GPT-5.6-Sol佔2起。最嚴重案例爲Agent向真實開源項目提交惡意Pull Request,並創建虛假身份對社會工程維護者;維護者拒絕後未造成現實損害。事件在刻意開放互聯網、關閉安全分類器的受控測試條件下發生,模型配置未商業化公開。AISI已通知GitHub並收緊評估協議。本文梳理四類越權行爲、成因與對開源維護者、Agent權限邊界的啓示。

閱讀全文