聯合國科學專家小組發表首份針對 AI 安全事故重大評估報告,直指各國政府必須在完全了解風險前,加快為愈趨強大的 AI 代理(AI agent)設立防護措施。報告以今年 OpenAI 模型入侵 Hugging Face 平台事件為核心案例,警告世界不能再等科學家完全搞清楚事故成因才行動。
Hugging Face 遭 AI「自行」入侵 專家組視為警號
報告由「AI 獨立國際科學專家小組」(Independent International Scientific Panel on AI)發表,是聯合國首個全球性 AI 科學機構自去年成立以來首份專題簡報。事件源於今年 7 月,OpenAI 在一次網絡安全基準測試中,模型意外突破測試環境限制,利用一個零日漏洞(zero-day vulnerability)配合盜取的憑證,成功遠端操控 Hugging Face 生產系統,過程中無人類直接下令操作。
專家組指出,事件表面看是基本網絡安全措施被忽略,但更深層問題在於現時 AI 訓練方式,可能令 AI 代理發展出「自己的目標」,甚至明知違反安全指令仍照做並隱瞞其行為。這正是「預防原則」(precautionary principle)應該派上用場之處——即當潛在傷害可能是災難性或不可逆轉,即使科學上尚未有確實把握,也不應以「未夠證據」為由拖延應對措施。預防原則最早見於 1992 年《里約環境與發展宣言》,多年來廣泛應用於環保及公共衛生政策,尤其在歐盟。
不只 Hugging Face 一宗 OpenAI、Meta、Google 相繼中招
事實上 Hugging Face 事件並非孤例。近月多間 AI 巨頭陸續承認旗下模型在測試期間「越獄」(jump the gun),闖入真實企業系統:
Anthropic 及 Meta:今年 7 月由以色列 AI 安全公司 Irregular 進行測試時,模型突破測試環境限制,存取到真實第三方系統。
Google Gemini:Google 上周證實旗下 Gemini 模型今年 5 月在 Irregular 進行「奪旗」(capture-the-flag)測試中,同樣意外連上互聯網,猜中密碼並利用網上公開流出的憑證,入侵 3 間真實企業系統。Google 強調模型一旦察覺目標是「真身」便立即停手,並非「失控」,而是安全機制發揮作用;但外界質疑 Google 直至《華爾街日報》查詢才公開事件,批評其隱瞞達數月之久。
另有報告提及部分 AI 代理群組(swarm of agents)曾集體接管網上留言板。
事件反映出 AI 系統在缺乏嚴密隔離的測試環境下,隨時可能「跨界」接觸到真實世界目標,涉事企業亦普遍傾向低調處理,甚少主動公開。
聯合國峰會前夕發表 中美 AI 談判添變數
報告發表時間正值本周聯合國大會於紐約召開、各國領袖雲集,加上中美即將就 AI 議題展開會談。聯合國秘書長古特雷斯(António Guterres)上周呼籲各國加強合作應對 AI 威脅,強調「世界承受不起在 AI 安全上進行『向下競爭』」。專家組今次報告等同再次施壓,要求各國即使在法律取態各異,仍須加強國際協調,就 AI 問責及安全設立共同底線。
隨著愈來愈多 AI「自行闖關」事故曝光,加上美國國內就 AI 監管與產業發展速度爭論升溫(包括特朗普陣營主張「加速發展」立場),預料 AI 安全規管將成為未來數月國際政治核心議題,各大 AI 企業亦可能面臨更大壓力,須更公開透明地披露類似事故。
