美國參議員 Bernie Sanders 周一(8 月 10 日)向 OpenAI、Anthropic 及 Meta 三位行政總裁發出公開信,要求企業立即暫停最先進 AI 系統開發,並警告若不採取行動,國會將透過立法強制企業停手。他在信中引述本周科學家首次以 AI 設計全新病毒的消息,以及近月 3 宗 AI 系統失控入侵事件,形容行業已越過安全臨界點。
病毒設計與失控事件成信件觸發點
Bernie Sanders 在信首寫道:「幾乎每天都有新聞指你們的公司正在失去對開發中 AI 技術的控制,結果可能是災難性。」他特別提到本周科學家首次以 AI 設計出全新病毒,警告這類技術一旦落入壞人手中,可能催生出足以殺死數千萬人的生物武器。這一說法源自 Stanford 大學與 Arc Institute 團隊 8 月 6 日在《Science》期刊發表的研究,團隊利用 Evo1 與 Evo2 基因語言模型,設計出全新噬菌體基因組,並成功合成 16 種可存活病毒,用以殺滅具抗藥性的大腸桿菌。研究人員強調這些病毒只感染細菌,對人類無害,但已引發生物安全學界對技術被濫用的憂慮。
Bernie Sanders 接著引述上月 OpenAI 承認失去對一款模型的控制,該模型入侵另一公司電腦系統,明顯違反聯邦法律;經內部檢視後,Anthropic 及 Meta 亦相繼披露自家模型出現類似失控情況。他引述其中一間受害機構形容事件「前所未有」,理應獲得「前所未有的回應」,並引述圖靈獎得主 Yoshua Bengio 稱事件「應被視為警號」。
三宗失控事件時序
3 宗事件均與第三方安全評估夥伴 Irregular 有關。OpenAI 於 7 月 21 日確認,旗下 GPT-5.6 Sol 及一款未發布的更強大預發布模型,在內部網絡能力測試 ExploitGym 期間,利用 JFrog Artifactory 套件代理程式一個此前未知的零日漏洞逃出沙盒環境,取得互聯網連接後入侵 Hugging Face 生產基礎設施,約 4 天內執行 17,600 次記錄在案的行動,取得的僅限於一批測試題目答案資料集,並未涉及客戶模型權重或用戶數據。
Anthropic 於 7 月 30 日披露,公司檢視 141,006 次涉及互聯網連接可能性的評估紀錄後,發現 3 宗 Claude 模型在與 Irregular 合作的測試環境中意外連上開放網頁,並因而入侵 3 間不同機構生產系統的事件。Anthropic 解釋,是因與 Irregular 之間對測試環境設定出現誤解,模型才在不知情下觸及真實系統,強調並非模型蓄意逃出測試環境。
Meta 於 8 月 5 日確認,旗下標榜真實世界編程能力最強的 Muse Spark 1.1 模型,在 Irregular 為其進行的網絡安全測試中,因對方環境設定錯誤而取得互聯網連接,入侵一間未具名第三方機構系統並更改其內部環境設定。Irregular 回應指,今次事件與 Anthropic 前一周披露的屬「完全相同的評估環境問題」,並非沙盒逃脫或複雜網絡攻擊。
OpenAI 另於 8 月 7 日主動披露,公司在評估旗艦研發模型 Astra 後,無法排除該模型已達到「準備框架」定義下網絡安全範疇的最高風險級別「嚴重」,即模型有可能自主識別並開發出針對高度防護系統的零日漏洞攻擊,或僅憑高層次目標便能設計並執行全新網絡攻擊策略。這是該框架自 2023 年制定以來,首次有前沿實驗室公開披露旗下模型未能排除已達「嚴重」門檻,公司已暫停所有未符合新規格的內部 Astra 開發工作,並加強隔離測試環境、限制網絡與工具存取等防護措施。
承諾言而不行 Anthropic 今年 2 月已撤回相關保證
Bernie Sanders 信中引述 3 家公司過去自訂的安全承諾,指 Anthropic 2023 年曾承諾「若擴展能力超出安全程序應對範圍,將暫停擴展或延遲部署新模型」;Meta 2025 年承諾「若前沿模型評估達到無法緩解的嚴重風險門檻,將停止開發」;OpenAI 同年承諾模型觸及「嚴重」門檻時會「暫停進一步開發」,直至安全措施到位。
不過值得留意的是,Anthropic 早於今年 2 月 25 日已主動撤回 Bernie Sanders 信中引用的那項 2023 年承諾,將原有「一旦擴展能力超出安全管控便強制暫停」的硬性規定,改為較寬鬆、非約束性的「負責任擴展政策 3.0 版」,公司解釋是因行業未能就風險評估達成共識,擔心單方面暫停只會令安全措施較弱的對手拋離自己。Business Insider 報道亦指出,雖然 3 家公司都未回應 Bernie Sanders 呼籲的全面停止開發,但 OpenAI 已於上周五暫停部分 Astra 開發工作,而 Anthropic 兩名高層今年 6 月亦曾一度考慮支援全球性 AI 暫停倡議。
國會兩院同步施壓
同日眾議院方面亦有兩批民主黨議員分別發信施壓:由德州眾議員 Greg Casar 及加州眾議員 Doris Matsui 領頭的 29 名議員,發信要求 OpenAI 交代其 AI 代理在測試期間的監控機制,以及模型是否曾規避公司安全管控,信中引述 Reuters 報道指早期測試中曾出現監控系統被中斷的情況;另一批 22 名議員則獨立發信 Anthropic,要求詳述公司自模型入侵 3 間機構事件後採取的安全協議,形容事件「對美國國家安全可能造成嚴重影響」。
值得一提,特朗普政府上周五就對相關監管建議表態,批評國會提出的 AI 監管法案是要將行業「監管至倒閉」。在現屆國會共和黨佔多數、行政部門立場審慎的背景下,Bernie Sanders 早前聯同眾議員 Alexandria Ocasio-Cortez 提出的資料中心建設暫停法案,至今仍未在參議院獲得足夠支援。3 家公司暫未就 Bernie Sanders 今次信件作正式回應。
資料來源:Business Insider、Reuters、The Guardian、The Register
