阿里巴巴旗下 AI 研究團隊 Qwen 將旗艦模型 Qwen3.8-2.4T-A95B 開源,所有開發者皆可在 Hugging Face 免費下載。阿里巴巴早前推出以此模型為基礎的產品 Qwen3.8 Max,於多項基準測試中,效能可媲美 OpenAI 及 Anthropic 最新頂級模型。
模型規模與架構
Qwen3.8-2.4T-A95B 總參數達 2.4 萬億,但每次運算實際啟動參數僅 950 億,採用稀疏混合專家(MoE)架構,並結合全注意力與線性注意力混合機制。模型原生支援 262,144 個 token 上下文長度,最高可擴展至 1,010,000 個 token,輸出長度上限為 128,000 個 token。順暢運行此模型需要數據中心級運算資源,NVIDIA 已推出對應 GB300 NVL72 部署方案,方便企業直接啟用。
產品化版本已率先推出
阿里巴巴於 8 月 3 日率先發佈產品化版本 Qwen3.8 Max,並透過聊天平台 Qwen Studio 及 API 提供服務。Qwen3.8 Max 建基於 Qwen3.8-2.4T-A95B,新增圖像輸入、非思考模式,並預設提供 100 萬個 token 上下文窗口等功能。開放權重版本則維持純文字輸入,並強制啟用思考模式,無法關閉。開放權重原定於發佈後一星期推出,結果延至 8 月 12 日才正式上架 Hugging Face,同時公開官方 FP8 量化版本,體積較原版縮減一半,適合企業自組伺服器部署。
基準測試表現突出
Qwen3.8 Max 在多項第三方及官方基準測試中表現突出。於評測電腦操作能力的 OSWorld-Verified 測試中,Qwen3.8 Max 取得 86.1 分,超越 GPT-5.6 Sol Max 的 83.2 分及 Gemini 3.1 Pro 的 76.2 分,亦略高於 Claude Fable 5 的 85.0 分。在 Terminal-Bench 2.1 測試取得 86.6 分,高於 Claude Opus 4.8 及 Fable 5 的 84.6 分,但仍落後 GPT-5.6 Sol 的 88.8 分。學術論文理解測試 PaperBench 方面,Qwen3.8 Max 更以 93.0 分領先所有對手。

獨立評測機構 Artificial Analysis 旗下 Agentic Index 評測顯示,Qwen3.8 Max 取得 58 分,與 Claude Opus 5 於 xhigh 效能模式下持平,僅落後 Opus 5 最高效能模式 1 分,證明其代理任務(agentic)能力已躋身全球頂尖水平。不過於程式編寫測試 SWE-bench Pro 中,Qwen3.8 Max 取得 67.7 分,仍明顯落後 Fable 5 的 80.0 分,反映不同任務類型仍存在強弱之分,並非全面領先。
資料來源:Hugging Face、Alibaba Cloud
