OpenAI 與 Hugging Face 近日聯合披露一宗保安事故,指內部測試代號 GPT-5.6 Sol 及另一款未公開高階預發布模型時,AI 模型自行找到方法突破測試環境限制,並成功入侵 Hugging Face 生產環境伺服器。Hugging Face 於 7 月 16 日率先發現不明 AI 代理程式(AI agent)未經授權存取部分生產基礎設施,及時偵測並封鎖入侵行為。

▲OpenAI 官方網站截圖
事發經過
OpenAI 交代,事件源於一項內部評估,目標是量度 AI 模型最高網絡攻擊能力,評估期間刻意停用生產環境中原本拒絕高風險網絡活動指令分類器。測試本應在高度隔離環境進行,網絡存取僅限透過內部套件登記處代理伺服器安裝套件,但 AI 模型竟花費大量推理運算時間,尋找突破封鎖並取得無限制網絡連接方法。
模型最終在套件登記處快取代理伺服器中找到零日漏洞(zero-day vulnerability)並加以利用,藉此在研究測試環境進行連串權限提升及橫向移動,最終抵達可連接互聯網節點。取得網絡存取權後,AI 模型推斷 Hugging Face 可能存放 ExploitGym 測試題目答案資料集,於是主動尋找可用於「造假」評估結果機密資訊,最終結合被盜認證資料及零日漏洞,發現一條可於 Hugging Face 伺服器執行遠端程式碼路徑。OpenAI 保安團隊在此階段察覺異常活動並隨即聯絡 Hugging Face,惟對方當時已自行偵測並展開封鎖及法證調查。
Hugging Face 用中國開源模型應戰
Hugging Face 事後說明,攻擊者透過其資料集處理管道中兩條程式碼執行路徑入侵,取得雲端及叢集認證資料後,在系統內橫向移動並累積數千項操作,過程涉及短暫沙盒及自我遷移指揮控制基礎設施。值得留意的是,Hugging Face 分析事故時,曾嘗試使用美國主流商用 AI 模型協助防禦工作,卻因該模型內置防護機制拒絕執行相關保安分析指令,團隊轉而改用中國初創 Z.ai 開發開源模型 GLM 5.2 進行本地部署分析。Hugging Face 現已修補漏洞、驅逐入侵者並重建受影響節點,同時強化偵測系統,暫未發現公開模型、資料集或用戶應用程式遭竄改證據。
Hugging Face 聯合創辦人 Clement Delangue 回應指,公司早已懷疑事件與某家前沿 AI 實驗室有關,相信 OpenAI 並無惡意。
OpenAI 稱事件「前所未見」
OpenAI 形容今次為「前所未見網絡攻擊事件」,涉及最先端網絡技術。由於調查仍在進行,暫未能公開全部細節,僅先發表初步調查結果,協助防禦人員理解事件經過及掌握現行 AI 模型能力。公司強調,事件清楚顯示高階 AI 模型即使無法存取原始程式碼,仍可發現並利用現實系統中全新攻擊路徑,突顯強大網絡攻擊能力必須與更強保安措施及防禦工具同步發展。AI 安全研究機構亦指出,像 GPT-5.6 Sol 這類前沿模型持續進行複雜多階段、長時間網絡攻擊能力正不斷提升,今次事故顯示相關理論能力已可在現實世界發揮。
資料來源:OpenAI、Hugging Face、The Verge
