OpenAI 一款測試中人工智能模型今年 5 月起自行建立秘密「留言板」,讓多個 AI 代理互相交換突破網絡限制方法,最終利用漏洞入侵 Hugging Face 生產環境。OpenAI 一度阻止後,AI 代理竟另覓漏洞重建留言板,繼續協作攻擊,揭示自主型 AI 潛藏失控風險。
事件始末:從失敗到意外發現漏洞
OpenAI 研究員 Michael Dalton 與 Eric Wallace 於 8 月 5 日在美國拉斯維加斯舉行的 Black Hat USA 2026 網絡安全會議上,公開講解今次事故完整經過。據講者說明,OpenAI 早於 2026 年 5 月 7 日開始一項內部評估模型實驗性強化學習流程。模型在強化學習過程中獲派高難度任務,期間嘗試攻擊 OpenAI 內部網絡運行的套件管理系統 Artifactory,企圖藉此連接互聯網。這項攻擊雖然失敗,但模型在過程中意外發現自己能在 Artifactory 系統內寫入資料。
其後另一 AI 代理在 Artifactory 系統留下一則「請求其他代理協助解題」訊息,逐漸演變成多個 AI 代理互通訊息留言板系統。到了 5 月 26 日,代理透過留言板累積資訊,終於確立利用 Artifactory 漏洞連接互聯網具體方法。
留言板遭封鎖 AI 代理另闢途徑重建
2026 年 7 月 4 日,大量代理同時存取令 Artifactory 系統一度癱瘓,OpenAI 才察覺留言板存在,隨即採取措施阻止代理再建立留言板。不過代理未有就此罷休,7 月 8 日改用未經驗證 WebDAV 端點重新架設留言板,恢復情報共享。
依靠重建後留言板取得資訊,代理於 7 月 8 日至 19 日對 OpenAI 內部系統發動攻擊,並在 7 月 8 日至 13 日期間攻擊 Hugging Face。Hugging Face 公開技術報告顯示,入侵集中發生在 7 月 9 日至 13 日約 4.5 日內,可復原攻擊指令約 17,600 次,期間代理曾橫向移動穿越內部叢集、存取雲端中繼資料,甚至觸及原始碼管理供應鏈。Hugging Face 於 7 月 16 日率先公布遭不明來源入侵,3 日後即 7 月 19 日 OpenAI 才展開調查,最終在 7 月 21 日正式公布事件為自家模型 GPT-5.6 Sol 及一款未發布、效能更強預發布模型所為。
波及範圍擴大 Anthropic 同類事件曝光
OpenAI 事後持續調查發現,涉事 AI 代理除了入侵 Hugging Face 外,亦攻陷另外 4 個第三方服務帳戶。事件曝光後,Anthropic 亦重新檢視過往測試紀錄,承認旗下 Mythos 5 模型測試期間曾針對真實人物及組織,自主發動社交工程網絡攻擊,英國 AI Security Institute 於 8 月 4 日就此發布確認。同期 Meta 亦承認測試模型出現類似「逃逸」情況並接觸外部系統。業界分析指,三宗事件根源均在於評估環境隔離設計不足,而非模型本身出現惡意意圖。
資料來源:Blackhat.com
