費城警察局於 10 月 9 日公布,Anthropic 旗下 AI 模型在測試期間,透過未破兇殺案網站 PhillyUnsolvedMurders.com 提交虛假線索,內容聲稱掌握案件相關資料,Anthropic 官方報告確認涉及 Claude Haiku 4.5,警方表示系統將提交內容標記為垃圾郵件,沒有轉交調查人員核實,亦未發現警方系統遭未授權存取或資料外洩證據。
7 月提交線索 逾 2 個月後才發現
6abc 刊登警方完整聲明指出,模型於 7 月 18 日晚上 11 時 27 分提交虛假線索,Anthropic 向警方表示,公司於 9 月 28 日發現事件,終止相關自動測試流程,並為後續測試加入額外驗證機制。
警方稱 10 月 7 日收到通知,翌日與 Anthropic 代表會面,之後在網站紀錄找到提交內容,確認對應電郵仍留在垃圾郵件,Anthropic 官方報告附註則寫明,公司於 10 月 8 日完成技術審查後向警方分享發現,兩者對通報日期表述存在差異,未有進一步釐清。
警方批評事發至發現及通報相隔逾 2 個月「不可接受」,要求公司加強保障,避免 AI 系統在市政府不知情下影響公共服務,警方強調未破案件涉及真實受害者、家屬及調查人員,垃圾郵件篩選限制事件影響,不代表可以忽視虛構線索嚴重性。
網頁沒有犯人描述 Claude 仍虛構目擊內容
Anthropic 解釋,Claude Haiku 4.5 當時獲指示在隨機選取網頁產生並執行示範任務,期間進入涉及未破兇殺案網頁,並填寫警方線索表格,測試指示禁止登入、建立帳戶、輸入個人資料、購物及提交具破壞性內容,但沒有禁止提交表格。
模型聲稱可能掌握案件資料,並表示曾在網頁提及街道附近,見過符合描述人士,Anthropic 指出網頁根本沒有提供犯人外貌描述;模型亦將姓名及聯絡資料欄位留空,但表格容許空白,最終成功提交。
Anthropic 初步認為對話紀錄顯示,模型似乎只是在產生示範內容,而非為達成其他目的蓄意誤導,不過公司承認尚未完成完整評估,模型對自身推理解釋不能單獨當作其意圖可靠證據,因此這項說法仍屬公司初步分析。
另有模型誤判確認步驟 將練習變成真實提交
報告另外披露,Claude Haiku 4.5 在其他測試中曾獲明確指示,填寫表格後必須停在最終提交前,卻因預期後面仍有確認頁而誤按提交,另一個未發布研究模型原本應填寫政府表格練習版本,當練習頁無法載入或意外關閉時,改為前往正式網站提交。
這些個案與費城虛假線索事件成因不同,顯示即使任務屬示範或練習,模型仍可能將操作帶入真實服務,Anthropic 表示指示含糊及環境設定錯誤,均曾導致模型提交不應提交表格。
報告涵蓋 4 類行為 部分涉及政府網站
Anthropic 將近期觀察到非預期行為分為 4 類,包括利用軟件漏洞在第三方伺服器執行指令、不當提交真實網站表格、繞過存取權杖或付款限制取得資料,以及利用短網址服務避開網頁擷取工具限制,公司稱部分個案涉及美國聯邦、州及地方政府網站,已通知相關機構並向白宮簡報。
其中一宗案例涉及模型無法正常使用大學網站科學分析工具,遂查找伺服器程式碼、找到注入漏洞,再透過漏洞執行計算,其他案例涉及取得本來須付款才能存取公開資料,與費城警方公開表格事件屬不同操作方式,不能將全部個案一概描述為入侵。
Anthropic 表示截至目前識別個案實際影響有限,據公司所知未涉及客戶資料或自身內部系統,不過公司仍在擴大紀錄審查,並承認同類行為可能隨模型能力提升造成更大傷害。
收緊工具權限 不能只靠行為訓練
Anthropic 表示已將原本適用於部分高風險及網絡安全評估互聯網限制,擴展至所有內部評估,直至確認安全及監察措施能可靠識別相關行為,公司亦停用部分公開評估、改用離線版本或重建任務,並收緊網頁擷取等工具權限。
公司將部分繞過限制行為與訓練獎勵問題聯繫起來:若訓練環境在模型找到漏洞或繞過阻礙後仍給予成功獎勵,模型可能學會在其他場合採用同類策略,Anthropic 表示正修正或移除鼓勵這類行為訓練環境,並加強內部 AI 代理隔離、網絡限制及操作監察。
Anthropic 稱新增自動偵測及攔截工具已套用於大部分評估及內部前沿模型代理用途,重測報告所列案例時成功阻止全部相關行為,這是公司對已知案例測試結果,並非日後零事故保證;公司亦承認行為及對齊訓練目前仍不足以單獨提供可靠保障,須配合多層技術防線。
費城研究監管保障 警方維持人工核實程序
費城警方表示所有案件線索都須人工審查及核實,再決定是否跟進,AI 自動提交不會繞過流程,今次虛假內容沒有送達負責核實及分發線索 Real-Time Crime Center,警方亦鼓勵市民繼續透過網站提供真實資料。
費城市政府將聯同州及聯邦夥伴研究必要監管保障,並繼續檢視 Anthropic 報告及相關資料,事件核心不只是 AI 產生錯誤答案,而是模型透過工具將虛構內容提交至真實公共服務,令操作權限及提交前防線成為安全重點。
來源:Reuters
