深度求索(DeepSeek)旗艦模型 V4 正式版(亦稱「滿血版」)於昨日(7 月 20 日)正式發佈。官方先前已明確承諾將於 7 月中旬推出新版本,目前距離正式亮相僅剩一日。
近日 AI 業界最受矚目的消息,莫過於月之暗面正式發佈新一代大模型 Kimi K3。這款模型擁有 2.8 兆參數,寫下國內最高紀錄,同時亦是目前全球規模最大的開源大模型。相比之下,美國頂尖閉源模型如 GPT-5.6 Sol 與 Claude Fable 5 均未公布具體參數,雖然 Elon Musk 先前曾透露相關規模達 5 至 10 兆參數,但業界普遍推測其實際規模約在 3 至 5 兆之間。
受限於龐大的運算規模,不論是 Kimi K3 或是 GPT-5.6、Fable 5 的使用成本均相當高昂。雖然 Kimi K3 的定價僅為後兩者的 3 分之 1 至 2 分之 1,但若頻繁調用,高昂的費用依然會讓企業感到吃力。
相比之下,即將登場的 DeepSeek V4 正式版無疑更具吸引力。即使官方已明確表示將首次引入峰谷計費模式,在高峰時段收費將上調一倍,其整體價格優勢依然極其顯著。同時,該模型具備極高的快取命中率(Cache Hit Rate),且 API 採用即付即用機制,用戶無需綁定固定月費套餐。根據網絡上開發者對各家大模型 API 價格的整合統計,DeepSeek V4 的收費標準大約僅為 OpenAI 與 Anthropic 兩大龍頭的 30 分之 1 至 70 分之 1,平均運算成本低出 40 至 50 倍。
正式版效能備受期待 程式碼能力或迎突破
除了價格震撼,DeepSeek V4 正式版的實際效能更受關注。先前的 V4 預覽版雖被視為全球開源領域的第一名,但其程式碼編寫能力尚未達到頂尖水平,官方當時自評其效能僅接近 Claude 3 Opus。然而過去 3 個月內,國內外 AI 技術已完成了新一輪更新迭代。
不過,近日在 Bilibili 等平台上流出的多項灰度測試結果令人眼前一亮。這些流出的測試主要集中在「一句話生成完整遊戲」等高難度任務,這亦是目前公認最考驗大模型邏輯與程式碼生成能力的核心範疇。從現有的測試表現來看,DeepSeek V4 正式版展現出的推理能力相當驚人,預計超越 Anthropic 的舊款模型問題不大,實際效能可能僅略低於目前的頂級模型 Fable 5。
不過,由於 V4 在多模態(Multimodal)支援上仍有不足,目前仍無法確定正式版會否原生整合視覺等理解能力。有業界迷因(Meme)甚至戲稱,V4 正式版問世的震撼程度堪比原子彈爆炸,能讓研發團隊與創辦人梁文鋒震驚得癱坐椅上。
網絡瘋傳造假質疑 業界駁斥不符商業邏輯
由於流出的效能表現過於強大,市場上亦出現了不少質疑聲音。部分質疑者指出,現時大部分灰度測試渠道主要來自 Bilibili 用戶,其餘來源極其稀少。甚至有人懷疑,DeepSeek V4 正式版私下將用戶的 API 請求路由(Route)至競爭對手的 Fable 5 模型,從而借用對方的效能交出漂亮成績。
然而這種「偷樑換柱」的說法顯然不符合商業邏輯。這類造假手段極易被技術分析戳穿,一旦敗露將對品牌形象造成毀滅性打擊,且廠商毫無實質收益。DeepSeek 絕不可能收取用家 0.1 元人民幣(約港幣 HK$0.11)的低廉費用,卻在背後倒貼 100 元人民幣(約港幣 HK$108)的高昂成本去調用 Fable 5。何況不少測試者已公開了 OpenCode 對話連結及全程不剪輯的錄影影片,令「造假論」不攻自破。
這種盲目的造假質疑,反映出部分群眾根深蒂固的心理,盲目認定西方技術必然領先。每當本土企業在頂尖技術上有所突破,輿論往往第一時間將其標籤為造假。正如近日 Kimi K3 走向國際市場時,雖然獲得不少同行祝賀,但也引來大量海外帳號惡意攻擊,指控 K3 是透過「蒸餾」(Distillation)Fable 5 的數據抄襲而來,甚至有 AMD 前企業副總裁等外國科技高管公開指責其缺乏道德。然而,這恰恰證明了國產開源模型在技術上已對海外巨頭構成實質威脅。
來源:快科技
