Google 發佈 Gemini 3.6 Flash:Token 效率提升 17%、Agent 默認模型的性價比之戰

前言

2026 年 7 月 21 日,Google 正式發佈 Gemini 3.6 Flash3.5 Flash-Lite3.5 Flash Cyber 三款模型。對把 AI 跑在生產環境裏的開發者來說,這次更新關注的不是「榜單第一名」,而是 Agent 工作流裏更實際的指標:輸出 Token 是否更少、延遲是否更低、同等任務下的賬單是否更便宜。

官方博客給出的核心數據是:在 Artificial Analysis Index 上,3.6 Flash 相比 3.5 Flash 輸出 Token 減少 17%;在 DeepSWE 等編碼基準上,降幅最高可達 65%。輸出定價爲 7.5 美元/百萬 Token(輸入 1.5 美元/百萬 Token),低於上一代 Flash。DeepSWE 得分從 37% 提升到 49%。一週後的 7 月 28 日,Gemini API Managed Agents 將默認模型切換爲 3.6 Flash,並上線 Environment Hooks。該發佈在 Hacker News 獲得 760 點577 條討論,說明開發者社區對「Agent 性價比模型」的關注度很高。

本文基於 Google 官方博客與公開文檔,梳理 3.6 Flash 的能力變化、同批發布的兩款姊妹模型,以及 Managed Agents 的工程側更新。

3.6 Flash:在更少 Token 下做更多事

Google 將 3.6 Flash 定位爲 Flash 系列的「主力模型」(workhorse model),直接承接 3.5 Flash 在編碼、知識工作、多模態場景中的角色,但強調 Token 效率Agent 可靠性 的同步提升。

官方給出的變化方向包括:

  • 更少廢話:在 Artificial Analysis Index 上,輸出 Token 比 3.5 Flash 少 17%;部分任務(如 DeepSWE)中降幅更大。
  • 更少步驟:多步工作流中,推理步驟與工具調用次數有所減少。
  • 更低單價:輸入 1.5 美元/百萬 Token,輸出 7.5 美元/百萬 Token,按官方說法,這降低了單個 Agent 任務的整體成本。

對長期跑 Agent 循環、子 Agent 編排、批量文檔處理的團隊,「輸出 Token 變少 + 單價下降」是疊加效應,比單純看單次推理延遲更有現實意義。

基準測試:編碼、Computer Use 與知識工作

Google 在發佈文中引用了多項公開或自研基準,以下數據均來自官方博客,便於讀者對照:

基準 3.6 Flash 3.5 Flash
DeepSWE(Datacurve) 49% 37%
MLE Bench 63.9% 49.7%
OSWorld-Verified 83.0% 78.4%
GDPval-AA v2 1421 1349

幾個值得留意的點:

  1. DeepSWE 衡量的是軟件工程 Agent 在真實代碼庫上的表現。37% → 49% 的提升,配合 Token 效率改善,說明模型在「少改錯代碼、少陷入執行循環」方面有所進步。
  2. OSWorld-VerifiedComputer Use 直接相關。3.6 Flash 在 OSWorld-Verified 上達到 83.0%,且 Computer Use 已通過 Gemini API 與 Gemini Enterprise 作爲內置客戶端工具提供,意味着開發者不必再單獨拼裝 GUI 操作層,即可在 Agent 流程中調用。
  3. GDPval-AA v2 面向知識工作場景。Hebbia、Harvey 等客戶案例提到,3.6 Flash 在多模態文檔解析、圖表分析、報告起草上表現更好。

需要客觀說明的是:Hacker News 上有開發者引用 Artificial Analysis 的第三方評測,認爲 3.6 Flash 在綜合智力指標上處於「中上水平」,但在 intelligence vs. time per taskintelligence vs. output speed 維度上,Flash 路線的速度優勢更明顯。若你的業務是高頻迭代前端或快速原型,這類「快且夠用」的模型往往比旗艦 Pro 更划算。

同批發布:3.5 Flash-Lite 與 3.5 Flash Cyber

本次並非只更新 3.6 Flash,Google 同時發佈另外兩款模型,分工清晰。

3.5 Flash-Lite:吞吐與延遲

3.5 Flash-Lite 面向高吞吐、低延遲場景,例如 Agent 搜索、大批量文檔處理。官方數據:

  • 輸出速度約 350 Token/秒(Artificial Analysis 測算)
  • 定價:0.3 美元/百萬輸入 Token2.5 美元/百萬輸出 Token
  • Terminal-Bench 2.1:54%(對比 3.1 Flash-Lite 的 31%)
  • 同樣支持 Computer Use 內置工具

在 Managed Agents 中,3.5 Flash-Lite 可作爲 主 Agent(3.6 Flash)+ 子 Agent(Flash-Lite) 的組合:主 Agent 負責推理與編排,Flash-Lite 負責高併發、低成本的子任務,例如一次性生成 25 個網頁設計草案。

3.5 Flash Cyber + CodeMender:安全專項

3.5 Flash Cyber 基於 3.5 Flash 微調,專注網絡安全漏洞的發現與修復,通過 CodeMender 多 Agent 協作生成統一報告,在 CyberGym 基準上達到前沿水平。

由於雙重用途風險,Google 採取受限部署:該模型將通過 CodeMender 面向政府與可信合作伙伴的限量試點 開放,而非全面公開 API。對普通開發者,知道這條產品線存在即可;若做安全合規或政企項目,可關注後續試點接入方式。

Managed Agents:默認切到 3.6 Flash 與 Environment Hooks

7 月 28 日,Google DeepMind 團隊發佈 Managed Agents 更新,這是 3.6 Flash 落地 Agent 生產環境的直接通道。

默認模型切換

antigravity-preview-05-2026 Agent 無需改代碼 即默認使用 Gemini 3.6 Flash。也可通過 agent_config.model 顯式指定:

  • gemini-3.6-flash(默認):推理、編碼、工具調用均衡
  • gemini-3.5-flash:上一代通用 Agent 模型
  • gemini-3.5-flash-lite:最低延遲與成本

示例(TypeScript,@google/genai SDK):

import { GoogleGenAI } from "@google/genai";

const client = new GoogleGenAI({});

const interaction = await client.interactions.create({
  agent: "antigravity-preview-05-2026",
  input: "Audit all dependencies in package.json, upgrade outdated packages, and verify the build by running npm test.",
  environment: "remote",
  agent_config: {
    type: "antigravity",
    model: "gemini-3.5-flash-lite",
  },
});

console.log(interaction.output_text);

Environment Hooks:在沙箱內攔截與審計工具調用

Environment Hooks 允許在 Agent 每次工具調用前後執行自定義腳本。在項目根目錄放置 .agents/hooks.json,即可對 pre_tool_executionpost_tool_execution 事件註冊處理器。

典型用途:

  • 安全門禁:在 code_executionwrite_file 前運行 gate.py,返回 {"decision": "deny"} 可阻止危險操作
  • 自動格式化:在每次工具執行後運行 linter,保持代碼風格一致
  • HTTP 回調:將工具調用事件 POST 到外部審計系統

matcher 字段支持正則,例如 code_execution|write_file 或通配 *。Offdeal 等團隊已用 post_tool_execution Hook 在遠程沙箱內做圖片質量校驗——此前遠程沙箱無法運行客戶側驗證邏輯,Hooks 補上了這一環。

成本與自動化

同期還增加了幾項工程向能力:

  • Free Tier:Managed Agents 向免費層級項目開放,無賬單項目也可拿 API Key 試驗
  • Budget Controlsagent_config.max_total_tokens 可封頂總 Token(含輸入、輸出、thinking),超限後安全暫停,保留環境狀態以便續跑
  • Scheduled Triggers:Cron 定時觸發 Agent 任務,同一沙箱內文件可跨次執行保留
  • Environments API:以代碼方式列出、檢查、刪除沙箱會話,避免等 7 天 TTL 自動過期

對「Agent 跑飛、賬單失控」的顧慮,Budget Controls 是最直接的對症功能。

安全與可用渠道

3.6 Flash 隨模型卡一併說明 Frontier Safety 增強,覆蓋 CBRN(化學、生物、放射、核)與網絡攻擊濫用場景,目標是提高越獄抗性,同時減少對正當請求的誤拒。

可用渠道(官方列出的入口):

  • 開發者:Gemini API(Google AI Studio、Android Studio)、Google Antigravity
  • 企業:Gemini Enterprise Agent Platform、Gemini Enterprise 應用
  • 消費者:Gemini App(3.5 Flash-Lite 亦在 Google Search 逐步 rollout)

小結:Flash 路線押注 Agent 規模化

Gemini 3.6 Flash 的發佈邏輯很清晰:在 Agent 成爲默認交互形態的背景下,Google 用 Token 效率 + 降價 + Managed Agents 默認切換 三板斧,把 Flash 系列推到「生產 Agent 的默認底座」位置。3.5 Flash-Lite 負責吞吐,3.5 Flash Cyber 負責安全垂直場景,Managed Agents 的 Hooks 與預算控制則補齊了工程落地最後一環。

若你已在用 Gemini API 的 Managed Agents 或 Antigravity,下一次交互會自動喫到 3.6 Flash;若自建 Agent 編排,建議對比同一 prompt 在 3.5 Flash 與 3.6 Flash 下的 輸出 Token 數任務完成步數,這比只看單次 benchmark 分數更貼近真實賬單。

參考來源:

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜