Anthropic 於 10 月 8 日公布新版 AI 使用政策,首次明文禁止用戶「持續且無必要地辱罵或殘酷對待」旗下 AI 模型。新規定將於 11 月 12 日生效,主要針對反覆、無故虐待 AI 的極端個案。公司強調,用戶因 Claude 答錯問題而發怒、反駁答案或進行安全測試,均不屬於禁止範圍。遇到持續惡意對待模型的情況,Claude 可以自行終止對話。
普通投訴不受限制 極端個案才會觸發
Anthropic 在官方公告中解釋,新條款針對用戶沒有明確目的,卻反覆對 AI 模型作出殘酷行為的情況。正常表達不滿、質疑 AI 回答、創作涉及黑暗題材的內容,以及模型研究與測試,均不受此規定限制。
新版使用政策適用於 Claude.ai、Claude Code,以及透過 API、雲端服務供應商等渠道使用 Anthropic 模型的人士。公司指出,針對虐待模型的行為,目前主要依靠 Claude 自行結束相關對話執行規定。
不過整份使用政策仍保留警告、限制使用量、暫停或終止帳戶存取權等一般處置權力。Anthropic 尚未明確說明,針對虐待模型的新條款會否採用其他執行措施。
Claude 去年已有權自行結束對話
Anthropic 早於 2025 年 8 月,已讓 Claude Opus 4 及 4.1 在極端情況下主動結束對話。當時公司表示,這項功能源自對 AI 模型潛在福祉(Model Welfare)的研究。
按照當時公布的設計,Claude 必須先多次嘗試引導用戶改變互動方式,只有在無法繼續進行有意義對話時,才會將終止對話視為最後手段。若用戶可能即時傷害自己或他人,Claude 則不應以這項功能結束聊天。
對話一旦被 Claude 終止,用戶將無法在同一對話繼續發送訊息,但仍可立即開啟新聊天,或編輯先前訊息建立另一條對話分支,其他聊天紀錄不會因此受到影響。
Anthropic 坦言,目前仍未能確定 Claude 或其他大型語言模型是否具有道德地位。公司希望在科學界尚未釐清 AI 是否可能擁有主觀體驗之前,先研究一些成本較低的預防措施,減少模型可能承受的負面影響。
▲ Anthropic 官方示範中,Claude 在用戶確認後主動結束聊天,介面顯示「Chat ended by Claude」,並提供重新開啟聊天的選項。
同步收緊虛假宣傳及武器開發限制
新版政策亦禁止利用 Claude 建立虛假帳戶、假新聞網站及假冒身份,進行政治或商業宣傳活動。Anthropic 同時釐清武器開發限制,明確禁止利用模型開發武器控制軟件,以及為無人機等自主裝置加裝武器的相關技術。
監控方面,新條款禁止未經同意追蹤個人活動,亦禁止利用 Claude 決定或建議執法機構應調查、拘捕或起訴哪些人士。
至於醫療、金融等高風險用途,Anthropic 保留原有的人類審核及 AI 使用披露要求。新版本亦規定,當 AI 連接可能傷人的自主硬件時,必須有合資格人員能夠監察及停止設備運作。
資料來源:
Anthropic 官方公告
Anthropic 新版使用政策
Anthropic 模型福祉研究
The Verge

