Google DeepMind 於 2026 年 7 月 21 日一口氣發表三款新 Gemini 模型,當中 Gemini 3.6 Flash 為主打型號,強調編碼、知識工作及多模態表現均較上代 3.5 Flash 有所提升,同時大幅降低運算成本。新模型建基於 3.5 Flash 用戶及開發者反饋而成,目標是協助企業更有效擴展 agentic 工作流程。
▲ Google 稱,3.6 Flash 輸出 token 用量較 3.5 Flash 減少 17%
Token 效率大幅改善
根據 Artificial Analysis Index 測試,3.6 Flash 輸出 token 用量較 3.5 Flash 減少 17%,部分基準測試如 DeepSWE 更錄得減少多達 65%。模型同時需要較少推理步驟及工具調用,便可完成多步驟工作流程,直接降低每個 agentic 任務成本。
▲ Google稱 3.6 Flash 模型需要較少推理步驟及工具調用,便可完成多步驟工作流程
編碼及電腦操作能力提升
在 DeepSWE 編碼測試中,3.6 Flash 準確率由 3.5 Flash 的 37% 提升至 49%,減少不必要程式碼修改及重複執行迴圈。ML Research 基準 MLE Bench 表現亦由 49.7% 躍升至 63.9%,而電腦操作能力測試 OSWorld-Verified 分數由 78.4% 提升至 83.0%,電腦操作功能現已成為 Gemini API 及 Gemini Enterprise 內置工具。知識工作表現方面,GDPval-AA v2 分數由 1,349 提升至 1,421,客戶 Hebbia 及 Harvey 反映模型在檔案解析、圖表數據分析及報告撰寫方面表現特別出色。
▲ 3.6 Flash 在 Gemini Canvas 有助開發用 3D 工作流程的攝影紋理提取器
同步推出 Flash-Lite 及 Cyber 專用模型
Google 同時發表 Gemini 3.5 Flash-Lite,主打低延遲及高吞吐量任務,每秒可輸出 350 個 token,收費為每 100 萬 input tokens 0.3 美元(約港幣 HK$2.34),每 100 萬 output tokens 2.5 美元(約港幣 HK$19.5)。該模型在 Terminal-Bench 2.1 編碼測試中錄得 54%,對比舊代 3.1 Flash-Lite 為 31%,長文本測試 GDM-MRCR v2 亦由 60.1% 提升至 72.2%。另外,專攻網絡安全的 Gemini 3.5 Flash Cyber 建基於 3.5 Flash 並經微調,在 CyberGym 基準測試中表現接近業界頂尖水平,將結合 CodeMender 代理系統,率先以有限度試行計劃形式提供予政府及可信合作夥伴使用。
旗艦 Gemini 3.5 Pro 仍未現身
今次發布並無包括外界期待已久的旗艦模型 Gemini 3.5 Pro,該模型自今年 2 月更新後一直未有新版本。同期 OpenAI 已推出 GPT-5.5 並開始推行 GPT-5.6,Anthropic 亦已發布 Claude Opus 4.8 及 Claude Sonnet 5,競爭對手發布節奏明顯較快。Google DeepMind 產品負責人 Logan Kilpatrick 表示,3.5 Pro 目前正與合作夥伴測試,希望盡快推出,同時團隊已展開規模最大的 Gemini 4 預訓練工作。有媒體報道指,Google 因內部效能未達標而延遲 3.5 Pro 發布時間。
收費同步下調
3.6 Flash 收費為每 100 萬 input tokens 1.5 美元(約港幣 HK$11.7),每 100 萬 output tokens 7.5 美元(約港幣 HK$58.5),較 3.5 Flash 原先每 100 萬 output tokens 9 美元(約港幣 HK$70.2)明顯便宜。Google 表示新定價配合效能提升,可進一步降低整體 agentic 任務成本。
資料來源:Google Newsroom
