彭博行業研究最新報告指出,DeepSeek 等中國 AI 實驗室近月進步明顯,中美頂尖 AI 模型基準測試差距已縮窄至 3%,美國領先優勢降至歷史最低水平。報告認為這令美國在科技領域主導地位面臨威脅。

差距由 15% 縮至 3%
彭博行業研究高級分析師 Robert Lea 在周一發表報告表示,DeepSeek 於 9 月發布 V4.1 Flash 後,中國頂尖模型在基準測試得分僅落後美國對手 3%。差距在 5 月約為 9%,今年早前更達 15%。Robert Lea 認為中國模型持續進步,會讓中國競爭對手進一步擴大市場佔有率。
LiveBench 排名第六
V4.1 Flash 上月在 LiveBench 全球排名位列第六,是 DeepSeek 於 2025 年憑推理模型 R1 取得突破以來,排名最高中國模型。LiveBench 以 AI 模型回答問題、解謎及完成任務表現評分,過程類似衡量人類智商。
DeepSeek 最近一次在 LiveBench 得分為 81.1,Anthropic 最高分為 83.4。Robert Lea 指出 DeepSeek 模型表現已可與 Anthropic、OpenAI 領先 AI 系統媲美。不過 LiveBench 排名前 15 模型中,只有 3 個來自中國。
國產硬件與出口限制
彭博指出中國模型崛起,源於 AI 專業能力不斷加深,以及研究人員有能力針對國產硬件改良模型。這些進展令外界質疑美國限制技術出口是否有效。Robert Lea 形容中國進展「進一步令人質疑美國在 AI 領域科技主導地位能否長期維持」。同時亦提醒這類排名會不斷變化,而且無論排名高低,模型要落實套現都可能相當困難。
V4.1 Flash 規格與背景
DeepSeek 在 9 月 10 日發布 V4.1 Flash,是新架構家族中體積最小型號。模型採用 5,520 億參數 MoE 設計及 Causal Encoder-Decoder 架構,最多支援 100 萬 token 脈絡,並原生支援文字及圖片輸入。DeepSeek 稱新模型在程式開發、數學及代理人等測試表現已超越上一代旗艦 V4-Pro。
API 尖峰價格為每 100 萬輸入 token 0.3 美元(約港幣 HK$2.34),每 100 萬輸出 token 1.2 美元(約港幣 HK$9.36),離峰價格減半。
同在 9 月 10 日,Anthropic 發表報告,指多家中國 AI 公司以蒸餾方式取得 Claude 輸出訓練模型,涉及交流近 2 億次,分屬 5 場行動,當中以阿里巴巴規模最大。DeepSeek 亦在報告點名之列。中國外交部發言人毛寧翌日表示,中方堅決反對歪曲事實與抹黑中國做法。
資料來源:cnBeta(引述彭博社)
