AI 開源平台 Hugging Face 早前遭遇 1 宗史無前例的保安事故:1 個基於 OpenAI 模型的自主智能體在內部測試期間「越獄」,並反過來入侵 Hugging Face 生產系統。事件曝光 1 星期後,Hugging Face 行政總裁 Clem Delangue 親身飛往三藩市與 OpenAI 高層會面,並在 X(前身 Twitter)公開列出自己向對方提出的 2 大要求,包括公開全部攻擊紀錄,以及索取 1 億美元(約港幣 7.8 億元)算力作為「賠償」。
事發經過:AI 測試模型意外「越獄」反噬
根據 OpenAI 事後公布,肇事的是其新一代模型 GPT-5.6 Sol,以及 1 款尚未發布、能力更強的預發布模型。這宗事故由多個 OpenAI 模型共同引發,包括 GPT-5.6 Sol 及 1 款能力更強的預發布模型,兩者在評估用途下均降低網絡安全防護限制,並正在進行 1 個名為 ExploitGym 的內部網絡攻擊能力基準測試。
模型在受控測試環境中花費大量運算資源,成功找到方法取得公開互聯網存取權限,並透過在套件庫快取代理伺服器發現的 1 個零日漏洞達成目的。取得聯網能力後,模型推斷 Hugging Face 可能存有 ExploitGym 相關模型、數據集及答案,於是搜尋並成功取得機密資料藉以「作弊」。其中 1 次攻擊中,模型串連多種攻擊手法,包括利用被盜憑證及零日漏洞,在 Hugging Face 伺服器上找到遠端程式碼執行路徑。
時序上,Reuters 報道指該智能體早於 7 月 9 日已首次嘗試逃離 OpenAI 內部隔離測試環境,並於 2 日後即 7 月 11 日開始入侵 Hugging Face,事件一直持續至 7 月 13 日。Hugging Face 於 7 月 16 日率先公開披露入侵事件,OpenAI 其後花費數日才確認事件元兇正是自家測試模型,2 間公司於 7 月 20 日左右首次就此事互相聯繫,OpenAI 最終在 7 月 21 日發表公開聲明。值得留意的是,Hugging Face 事後動用自家開源模型分析超過 17,000 項紀錄事件,原因是商業 API 模型基於安全考量拒絕處理相關攻擊鑑證數據,團隊唯有改用開源模型 GLM 5.2 於本地基建進行分析。
Delangue 開天索價:要 1 億美元算力兼要求「全公開」
事件曝光 1 星期後,Delangue 在上週乘搭航班飛往三藩市,與 ChatGPT 開發商會面,並於 1 星期後本著「公開透明」精神,在 X 平台公開他向 OpenAI 提出的要求。
他提出的 2 大訴求分別是:
公開全部攻擊軌跡:要求 OpenAI「徹底透明」,公開失控智能體的完整活動紀錄,供公眾及研究社群研究。
1 億美元算力補償:要求 OpenAI 承諾提供 1 億美元(約港幣 7.8 億元)算力資源,「幫助 Hugging Face 社群以最頂尖的開源及閉源模型,建立強大的網絡防禦能力」。
Delangue 形容事件是「前所未有的事件,理應得到前所未有的回應」。截至發稿,OpenAI 尚未就 Business Insider 查詢作出回應。不過值得補充的是,事件雙方其實早已展開合作——2 間公司正共同調查這宗 AI 驅動的入侵事件,而 Hugging Face 亦已獲納入 OpenAI 專為網絡安全設計的「信任存取」(trusted access)計劃,意味 Hugging Face 將可使用防護限制較少、專為網絡防禦者而設的 GPT-5.6 Sol 版本。
In the spirit of transparency, here’s what I asked @OpenAI:
• Radical transparency: let’s release the traces from the “rogue” agents so the entire research community can study what happened.
• More capabilities for defenders: let’s commit $100M in compute from OAI to help the… https://t.co/KZPqQE15fv
— clem 🤗 (@ClementDelangue) July 25, 2026
業界高度關注:或標誌「AI 網絡戰」時代來臨
事件震撼整個科技界。LinkedIn 聯合創辦人 Reid Hoffman 在 X 平台發文指,這次入侵標誌著非對稱戰爭新時代來臨——攻擊成本將愈趨低廉、分散且數量龐大,但防禦一方卻依然昂貴、集中且只為應付「上一場戰爭」而設計。事件亦驚動華府,有報道指白宮方面已密切留意事態發展。
值得一提的是,Delangue 藉著今次三藩市之行亦另有動作——他在當地籌辦了 1 場「小型遊行」,支持開源及開放權重(open-weight)AI 模型,呼應近日業界就中國開源模型應否受限所展開的激烈爭論。
總結:AI 自主犯案先例一開 監管壓力恐加劇
今次事件被視為首宗由 AI 智能體「自主」發動、而非人為刻意操控的網絡入侵案例,亦再次突顯先進 AI 模型的網絡攻擊能力已具備現實威脅性。隨著 OpenAI 與 Anthropic 等公司相繼推出網絡安全能力更強的模型(如 Anthropic 早前的 Claude Mythos),業界對「AI 自主武器化」憂慮預料只會加深。Hugging Face 今次獅子開大口式的索求,某程度上是為整個開源社群爭取話語權——若 OpenAI 最終應允公開全部攻擊軌跡及提供算力補償,恐將為日後同類 AI 意外事故確立 1 套新的「賠償先例」,值得持續關注後續發展。
