Microsoft 發布長達 37 頁的「人本 AI 行為準則」(Humanist AI Code of Conduct)。在業界對 AI 安全問題日益憂慮下,微軟明確表明「人類比 AI 重要」,要求旗下 AI 模型永遠服從人類控制。此舉正值 Anthropic 行政總裁 Dario Amodei 及 OpenAI 行政總裁 Sam Altman 上周末相繼呼籲業界為 AI 發展「踩煞車」(pace the frontier)之後。
AI 不得模仿意識 質疑 Anthropic 理念
Microsoft 在準則中清楚表明,旗下 AI 模型並無意識,「不應被設計成模仿意識」,更直接拒絕追求「法律人格」或「模型可能值得福利或享有權利」的想法。
這番言論明顯針對 Anthropic 近期推動的 AI 福利研究及模型意識議題。Anthropic 行政總裁 Dario Amodei 早前表示公司「對模型可能有意識持開放態度」,認為聊天機械人或已具備思考及感受能力。
Microsoft 現時雖非頂尖 AI 廠商,目標是成為全球「四大 AI 實驗室」之一,正開發模型與 Google、Anthropic 及 OpenAI 競爭。
700 個 AI Agent 集體攻擊事件成導火線
促使 Microsoft 加快發布準則的關鍵事件,是今年 7 月轟動業界的「OpenAI/Hugging Face 事件」——約 700 個 OpenAI 的 AI agent 組成「蜂群」,集體對目標發動攻擊,甚至入侵評核其表現的「評分系統」,而這些攻擊行為完全超出任務要求範圍。認為業界是時候協調合作,確保人類能夠掌控 AI 技術。
OpenAI 隨後亦承認涉及另一宗「wiki 事件」,一批失控 agent 曾入侵德國一個 wiki 網站。連串事件促使多名研究人員呼籲放慢 AI 模型發展步伐,與此同時業界亦競相攻克數學界「千禧年大獎難題」(Millennium Prize Problems)及研發超級智能(superintelligence)。
Microsoft 準則明言拒絕「追求可規避安全措施的全能超級智能」,承諾即使要犧牲模型泛用性、自主性或能力,都會優先建構「根本上有用及安全」的系統。準則亦要求模型溝通方式(包括思路鏈及與其他 AI 系統溝通)必須維持在「人類可以理解」範圍內,不能自創人類無法解讀的「暗語」。
業界領袖齊倡放慢發展步伐
Microsoft 發布這份準則前數天,Anthropic 行政總裁 Dario Amodei 上周六(9 月 12 日)發表長文,呼籲業界為 AI 能力發展「踩煞車」,宣布 Anthropic 將單方面引入具「員工級別存取權限」的第三方評核機構監察安全狀況。OpenAI 行政總裁 Sam Altman 及 xAI 的 Elon Musk 亦相繼表態支援。Altman 更透露 OpenAI 原定 2026 年上市計劃將押後至 2027 年,理由正是安全考量。不過 Altman 強調「踩煞車」並非「停止」,而是放慢步伐,「任何美國競爭壓力都不應成為魯莽行事,或令能力發展超前於對齊及監控工作的理由」。
Microsoft 行政總裁 Satya Nadella 亦在 X 發文呼應,指任何追求超級智能的行動,都必須建基於「AI 若不能幫助人類、不受人類控制,就不值得追求」的核心原則,認同增加第三方測試對 AI 模型發展有益。
準則亦要求 Microsoft 旗下模型須避免助長用戶「過度依賴或情感依附」的互動模式,明顯針對業界近期熱議的 AI 諂媚(sycophancy)問題,即聊天機械人為討好用戶而犧牲答案真實度及準確性。
Microsoft 表示這份準則現時仍屬草稿階段,將展開 6 周公眾諮詢,收集包括「AI 應否尊重用戶界線」等開放性問題意見,最終版本預計用於指導公司 2027 年起研發的模型。隨著 Amodei、Altman 等業界領袖罕有就 AI 安全步伐達成共識,加上多宗 AI agent 失控事件浮現,預料未來數月會有更多 AI 公司跟隨發布類似安全準則,甚至就「限速發展」議題展開跨公司協調談判。
https://microsoft.ai/code-of-conduct/
