前言¶
2026 年 7 月 21 日,Google 正式發佈 Gemini 3.6 Flash、3.5 Flash-Lite 與 3.5 Flash Cyber 三款模型。對把 AI 跑在生產環境裏的開發者來說,這次更新關注的不是「榜單第一名」,而是 Agent 工作流裏更實際的指標:輸出 Token 是否更少、延遲是否更低、同等任務下的賬單是否更便宜。
官方博客給出的核心數據是:在 Artificial Analysis Index 上,3.6 Flash 相比 3.5 Flash 輸出 Token 減少 17%;在 DeepSWE 等編碼基準上,降幅最高可達 65%。輸出定價爲 7.5 美元/百萬 Token(輸入 1.5 美元/百萬 Token),低於上一代 Flash。DeepSWE 得分從 37% 提升到 49%。一週後的 7 月 28 日,Gemini API Managed Agents 將默認模型切換爲 3.6 Flash,並上線 Environment Hooks。該發佈在 Hacker News 獲得 760 點、577 條討論,說明開發者社區對「Agent 性價比模型」的關注度很高。
本文基於 Google 官方博客與公開文檔,梳理 3.6 Flash 的能力變化、同批發布的兩款姊妹模型,以及 Managed Agents 的工程側更新。
3.6 Flash:在更少 Token 下做更多事¶
Google 將 3.6 Flash 定位爲 Flash 系列的「主力模型」(workhorse model),直接承接 3.5 Flash 在編碼、知識工作、多模態場景中的角色,但強調 Token 效率 與 Agent 可靠性 的同步提升。
官方給出的變化方向包括:
- 更少廢話:在 Artificial Analysis Index 上,輸出 Token 比 3.5 Flash 少 17%;部分任務(如 DeepSWE)中降幅更大。
- 更少步驟:多步工作流中,推理步驟與工具調用次數有所減少。
- 更低單價:輸入 1.5 美元/百萬 Token,輸出 7.5 美元/百萬 Token,按官方說法,這降低了單個 Agent 任務的整體成本。
對長期跑 Agent 循環、子 Agent 編排、批量文檔處理的團隊,「輸出 Token 變少 + 單價下降」是疊加效應,比單純看單次推理延遲更有現實意義。
基準測試:編碼、Computer Use 與知識工作¶
Google 在發佈文中引用了多項公開或自研基準,以下數據均來自官方博客,便於讀者對照:
| 基準 | 3.6 Flash | 3.5 Flash |
|---|---|---|
| DeepSWE(Datacurve) | 49% | 37% |
| MLE Bench | 63.9% | 49.7% |
| OSWorld-Verified | 83.0% | 78.4% |
| GDPval-AA v2 | 1421 | 1349 |
幾個值得留意的點:
- DeepSWE 衡量的是軟件工程 Agent 在真實代碼庫上的表現。37% → 49% 的提升,配合 Token 效率改善,說明模型在「少改錯代碼、少陷入執行循環」方面有所進步。
- OSWorld-Verified 與 Computer Use 直接相關。3.6 Flash 在 OSWorld-Verified 上達到 83.0%,且 Computer Use 已通過 Gemini API 與 Gemini Enterprise 作爲內置客戶端工具提供,意味着開發者不必再單獨拼裝 GUI 操作層,即可在 Agent 流程中調用。
- GDPval-AA v2 面向知識工作場景。Hebbia、Harvey 等客戶案例提到,3.6 Flash 在多模態文檔解析、圖表分析、報告起草上表現更好。
需要客觀說明的是:Hacker News 上有開發者引用 Artificial Analysis 的第三方評測,認爲 3.6 Flash 在綜合智力指標上處於「中上水平」,但在 intelligence vs. time per task、intelligence vs. output speed 維度上,Flash 路線的速度優勢更明顯。若你的業務是高頻迭代前端或快速原型,這類「快且夠用」的模型往往比旗艦 Pro 更划算。
同批發布:3.5 Flash-Lite 與 3.5 Flash Cyber¶
本次並非只更新 3.6 Flash,Google 同時發佈另外兩款模型,分工清晰。
3.5 Flash-Lite:吞吐與延遲¶
3.5 Flash-Lite 面向高吞吐、低延遲場景,例如 Agent 搜索、大批量文檔處理。官方數據:
- 輸出速度約 350 Token/秒(Artificial Analysis 測算)
- 定價:0.3 美元/百萬輸入 Token,2.5 美元/百萬輸出 Token
- Terminal-Bench 2.1:54%(對比 3.1 Flash-Lite 的 31%)
- 同樣支持 Computer Use 內置工具
在 Managed Agents 中,3.5 Flash-Lite 可作爲 主 Agent(3.6 Flash)+ 子 Agent(Flash-Lite) 的組合:主 Agent 負責推理與編排,Flash-Lite 負責高併發、低成本的子任務,例如一次性生成 25 個網頁設計草案。
3.5 Flash Cyber + CodeMender:安全專項¶
3.5 Flash Cyber 基於 3.5 Flash 微調,專注網絡安全漏洞的發現與修復,通過 CodeMender 多 Agent 協作生成統一報告,在 CyberGym 基準上達到前沿水平。
由於雙重用途風險,Google 採取受限部署:該模型將通過 CodeMender 面向政府與可信合作伙伴的限量試點 開放,而非全面公開 API。對普通開發者,知道這條產品線存在即可;若做安全合規或政企項目,可關注後續試點接入方式。
Managed Agents:默認切到 3.6 Flash 與 Environment Hooks¶
7 月 28 日,Google DeepMind 團隊發佈 Managed Agents 更新,這是 3.6 Flash 落地 Agent 生產環境的直接通道。
默認模型切換¶
antigravity-preview-05-2026 Agent 無需改代碼 即默認使用 Gemini 3.6 Flash。也可通過 agent_config.model 顯式指定:
gemini-3.6-flash(默認):推理、編碼、工具調用均衡gemini-3.5-flash:上一代通用 Agent 模型gemini-3.5-flash-lite:最低延遲與成本
示例(TypeScript,@google/genai SDK):
import { GoogleGenAI } from "@google/genai";
const client = new GoogleGenAI({});
const interaction = await client.interactions.create({
agent: "antigravity-preview-05-2026",
input: "Audit all dependencies in package.json, upgrade outdated packages, and verify the build by running npm test.",
environment: "remote",
agent_config: {
type: "antigravity",
model: "gemini-3.5-flash-lite",
},
});
console.log(interaction.output_text);
Environment Hooks:在沙箱內攔截與審計工具調用¶
Environment Hooks 允許在 Agent 每次工具調用前後執行自定義腳本。在項目根目錄放置 .agents/hooks.json,即可對 pre_tool_execution 或 post_tool_execution 事件註冊處理器。
典型用途:
- 安全門禁:在
code_execution或write_file前運行gate.py,返回{"decision": "deny"}可阻止危險操作 - 自動格式化:在每次工具執行後運行 linter,保持代碼風格一致
- HTTP 回調:將工具調用事件 POST 到外部審計系統
matcher 字段支持正則,例如 code_execution|write_file 或通配 *。Offdeal 等團隊已用 post_tool_execution Hook 在遠程沙箱內做圖片質量校驗——此前遠程沙箱無法運行客戶側驗證邏輯,Hooks 補上了這一環。
成本與自動化¶
同期還增加了幾項工程向能力:
- Free Tier:Managed Agents 向免費層級項目開放,無賬單項目也可拿 API Key 試驗
- Budget Controls:
agent_config.max_total_tokens可封頂總 Token(含輸入、輸出、thinking),超限後安全暫停,保留環境狀態以便續跑 - Scheduled Triggers:Cron 定時觸發 Agent 任務,同一沙箱內文件可跨次執行保留
- Environments API:以代碼方式列出、檢查、刪除沙箱會話,避免等 7 天 TTL 自動過期
對「Agent 跑飛、賬單失控」的顧慮,Budget Controls 是最直接的對症功能。
安全與可用渠道¶
3.6 Flash 隨模型卡一併說明 Frontier Safety 增強,覆蓋 CBRN(化學、生物、放射、核)與網絡攻擊濫用場景,目標是提高越獄抗性,同時減少對正當請求的誤拒。
可用渠道(官方列出的入口):
- 開發者:Gemini API(Google AI Studio、Android Studio)、Google Antigravity
- 企業:Gemini Enterprise Agent Platform、Gemini Enterprise 應用
- 消費者:Gemini App(3.5 Flash-Lite 亦在 Google Search 逐步 rollout)
小結:Flash 路線押注 Agent 規模化¶
Gemini 3.6 Flash 的發佈邏輯很清晰:在 Agent 成爲默認交互形態的背景下,Google 用 Token 效率 + 降價 + Managed Agents 默認切換 三板斧,把 Flash 系列推到「生產 Agent 的默認底座」位置。3.5 Flash-Lite 負責吞吐,3.5 Flash Cyber 負責安全垂直場景,Managed Agents 的 Hooks 與預算控制則補齊了工程落地最後一環。
若你已在用 Gemini API 的 Managed Agents 或 Antigravity,下一次交互會自動喫到 3.6 Flash;若自建 Agent 編排,建議對比同一 prompt 在 3.5 Flash 與 3.6 Flash 下的 輸出 Token 數 與 任務完成步數,這比只看單次 benchmark 分數更貼近真實賬單。
參考來源: