Google 於 9 月 30 日宣布推出新一代先進模型 Gemini 4 Argon,把輸出詞元 (token) 上限由 6.4 萬個提升至 100 萬個,專為複雜而需要長時間處理的工作流程設計,Argon 暫時只透過 Fairwind 計劃向受信任的網絡安全防禦專家開放,Google 期望加強安全措施後再向開發者、企業及一般用戶推出。
100 萬詞元輸出上限
Google 表示模型有足夠空間深入思考,能在單次運算中產生數十萬個詞元,從而一次過解決較複雜的問題,Argon 擅長軟件工程、法律及金融等企業知識工作,也能分析專業圖表、辨識長影片內的細節,以及根據一系列檔案採取行動。
領先多項評測
Google 公布 Argon 在評測長時間軟件工程任務的 DeepSWE v1.1 取得 77.9%,創下新高,模型在 Vals Index 位列第一,並在 Zapier 的 AutomationBench 以 51.3% 排名榜首。在評測長影片理解的 LVBench 上,Argon 取得 91.7%。至於評測修補保安漏洞的 CWE-bench v1,Argon 則以 68% 與其他模型並列首位。
第三方分析顯示這場競爭依然接近,根據 VentureBeat 統計,Google 公布的 18 項評測中,Argon 獨佔 12 項第一及並列 1 項,而 OpenAI 的 GPT-6 Astra 及 Anthropic 的 Claude Opus 5.5 在部分項目仍然領先。The Decoder 則引述 Artificial Analysis 指數,指出 Argon 取得 53 分,與 GPT-6 Astra 及 Claude Fable 5.1 並列。
內部應用與網絡安全
Google 內部已使用 Argon 處理日常工作,量子運算研究人員利用 Argon,將一項子程序的資源用量比已發表基準再減 40%。多個 Argon 代理程式分析數據中心效能數據後,自動套用記憶體最佳化,預計可釋出超過 300 TiB 記憶體。團隊亦運用 Argon 把 C/C++ 程式碼轉寫成 Rust,規模由數萬行擴展至 Fuchsia Zircon 核心逾 80 萬行。
在 libgav1 影片解碼器項目中,Argon 代理程式替換 3.2 萬行 SIMD 程式碼,令解碼器比原有 Rust 版本快 2.7 倍,影片輸出品質亦維持一致。
網絡安全方面,Argon 能自行找出、驗證及修補嚴重軟件漏洞,Google 現向受信任的防禦專家及內部團隊提供沒有網絡安全限制的版本。雲端保安公司 Wiz 亦已透過公益項目 Scan for Good 使用 Argon,發現全球醫院所用醫療軟件存在嚴重漏洞,有關漏洞可導致敏感個人資料外洩,此前其他先進模型均未能發現。
推出前強化四項防護
Google 表示正在參與美國政府自願性的模型預先測試程序,同時在 4 個範疇加強防護:
- 防範濫用:防止模型協助發動網絡,以及化學、生物、放射或核子攻擊,並改良內部運作監察技術。
- 防範提示詞注入攻擊:Argon 在 Gray Swan 的間接提示詞注入評測中表現領先。
- 監察對齊偏差:系統監察模型的思考鏈與行動,必要時中止執行。
- 強化系統:進行高風險訓練或評測前,先隔離並封閉沙盒環境。
定價與推出時間
Argon 推出初期定價為每 100 萬個輸入詞元 2 美元(約港幣 HK$15.6)、輸出詞元 10 美元(約港幣 HK$78),優惠期過後價格分別升至 4 美元(約港幣 HK$31.2)及 20 美元(約港幣 HK$156)。Google 未有公布正式推出日期,僅表示會盡快開放,並由付費 API 客戶及 Google AI Ultra 訂戶優先使用。
來源:Google
