Google 发布 Gemini 3.6 Flash:Token 效率提升 17%、Agent 默认模型的性价比之战

前言

2026 年 7 月 21 日,Google 正式发布 Gemini 3.6 Flash3.5 Flash-Lite3.5 Flash Cyber 三款模型。对把 AI 跑在生产环境里的开发者来说,这次更新关注的不是「榜单第一名」,而是 Agent 工作流里更实际的指标:输出 Token 是否更少、延迟是否更低、同等任务下的账单是否更便宜。

官方博客给出的核心数据是:在 Artificial Analysis Index 上,3.6 Flash 相比 3.5 Flash 输出 Token 减少 17%;在 DeepSWE 等编码基准上,降幅最高可达 65%。输出定价为 7.5 美元/百万 Token(输入 1.5 美元/百万 Token),低于上一代 Flash。DeepSWE 得分从 37% 提升到 49%。一周后的 7 月 28 日,Gemini API Managed Agents 将默认模型切换为 3.6 Flash,并上线 Environment Hooks。该发布在 Hacker News 获得 760 点577 条讨论,说明开发者社区对「Agent 性价比模型」的关注度很高。

本文基于 Google 官方博客与公开文档,梳理 3.6 Flash 的能力变化、同批发布的两款姊妹模型,以及 Managed Agents 的工程侧更新。

3.6 Flash:在更少 Token 下做更多事

Google 将 3.6 Flash 定位为 Flash 系列的「主力模型」(workhorse model),直接承接 3.5 Flash 在编码、知识工作、多模态场景中的角色,但强调 Token 效率Agent 可靠性 的同步提升。

官方给出的变化方向包括:

  • 更少废话:在 Artificial Analysis Index 上,输出 Token 比 3.5 Flash 少 17%;部分任务(如 DeepSWE)中降幅更大。
  • 更少步骤:多步工作流中,推理步骤与工具调用次数有所减少。
  • 更低单价:输入 1.5 美元/百万 Token,输出 7.5 美元/百万 Token,按官方说法,这降低了单个 Agent 任务的整体成本。

对长期跑 Agent 循环、子 Agent 编排、批量文档处理的团队,「输出 Token 变少 + 单价下降」是叠加效应,比单纯看单次推理延迟更有现实意义。

基准测试:编码、Computer Use 与知识工作

Google 在发布文中引用了多项公开或自研基准,以下数据均来自官方博客,便于读者对照:

基准 3.6 Flash 3.5 Flash
DeepSWE(Datacurve) 49% 37%
MLE Bench 63.9% 49.7%
OSWorld-Verified 83.0% 78.4%
GDPval-AA v2 1421 1349

几个值得留意的点:

  1. DeepSWE 衡量的是软件工程 Agent 在真实代码库上的表现。37% → 49% 的提升,配合 Token 效率改善,说明模型在「少改错代码、少陷入执行循环」方面有所进步。
  2. OSWorld-VerifiedComputer Use 直接相关。3.6 Flash 在 OSWorld-Verified 上达到 83.0%,且 Computer Use 已通过 Gemini API 与 Gemini Enterprise 作为内置客户端工具提供,意味着开发者不必再单独拼装 GUI 操作层,即可在 Agent 流程中调用。
  3. GDPval-AA v2 面向知识工作场景。Hebbia、Harvey 等客户案例提到,3.6 Flash 在多模态文档解析、图表分析、报告起草上表现更好。

需要客观说明的是:Hacker News 上有开发者引用 Artificial Analysis 的第三方评测,认为 3.6 Flash 在综合智力指标上处于「中上水平」,但在 intelligence vs. time per taskintelligence vs. output speed 维度上,Flash 路线的速度优势更明显。若你的业务是高频迭代前端或快速原型,这类「快且够用」的模型往往比旗舰 Pro 更划算。

同批发布:3.5 Flash-Lite 与 3.5 Flash Cyber

本次并非只更新 3.6 Flash,Google 同时发布另外两款模型,分工清晰。

3.5 Flash-Lite:吞吐与延迟

3.5 Flash-Lite 面向高吞吐、低延迟场景,例如 Agent 搜索、大批量文档处理。官方数据:

  • 输出速度约 350 Token/秒(Artificial Analysis 测算)
  • 定价:0.3 美元/百万输入 Token2.5 美元/百万输出 Token
  • Terminal-Bench 2.1:54%(对比 3.1 Flash-Lite 的 31%)
  • 同样支持 Computer Use 内置工具

在 Managed Agents 中,3.5 Flash-Lite 可作为 主 Agent(3.6 Flash)+ 子 Agent(Flash-Lite) 的组合:主 Agent 负责推理与编排,Flash-Lite 负责高并发、低成本的子任务,例如一次性生成 25 个网页设计草案。

3.5 Flash Cyber + CodeMender:安全专项

3.5 Flash Cyber 基于 3.5 Flash 微调,专注网络安全漏洞的发现与修复,通过 CodeMender 多 Agent 协作生成统一报告,在 CyberGym 基准上达到前沿水平。

由于双重用途风险,Google 采取受限部署:该模型将通过 CodeMender 面向政府与可信合作伙伴的限量试点 开放,而非全面公开 API。对普通开发者,知道这条产品线存在即可;若做安全合规或政企项目,可关注后续试点接入方式。

Managed Agents:默认切到 3.6 Flash 与 Environment Hooks

7 月 28 日,Google DeepMind 团队发布 Managed Agents 更新,这是 3.6 Flash 落地 Agent 生产环境的直接通道。

默认模型切换

antigravity-preview-05-2026 Agent 无需改代码 即默认使用 Gemini 3.6 Flash。也可通过 agent_config.model 显式指定:

  • gemini-3.6-flash(默认):推理、编码、工具调用均衡
  • gemini-3.5-flash:上一代通用 Agent 模型
  • gemini-3.5-flash-lite:最低延迟与成本

示例(TypeScript,@google/genai SDK):

import { GoogleGenAI } from "@google/genai";

const client = new GoogleGenAI({});

const interaction = await client.interactions.create({
  agent: "antigravity-preview-05-2026",
  input: "Audit all dependencies in package.json, upgrade outdated packages, and verify the build by running npm test.",
  environment: "remote",
  agent_config: {
    type: "antigravity",
    model: "gemini-3.5-flash-lite",
  },
});

console.log(interaction.output_text);

Environment Hooks:在沙箱内拦截与审计工具调用

Environment Hooks 允许在 Agent 每次工具调用前后执行自定义脚本。在项目根目录放置 .agents/hooks.json,即可对 pre_tool_executionpost_tool_execution 事件注册处理器。

典型用途:

  • 安全门禁:在 code_executionwrite_file 前运行 gate.py,返回 {"decision": "deny"} 可阻止危险操作
  • 自动格式化:在每次工具执行后运行 linter,保持代码风格一致
  • HTTP 回调:将工具调用事件 POST 到外部审计系统

matcher 字段支持正则,例如 code_execution|write_file 或通配 *。Offdeal 等团队已用 post_tool_execution Hook 在远程沙箱内做图片质量校验——此前远程沙箱无法运行客户侧验证逻辑,Hooks 补上了这一环。

成本与自动化

同期还增加了几项工程向能力:

  • Free Tier:Managed Agents 向免费层级项目开放,无账单项目也可拿 API Key 试验
  • Budget Controlsagent_config.max_total_tokens 可封顶总 Token(含输入、输出、thinking),超限后安全暂停,保留环境状态以便续跑
  • Scheduled Triggers:Cron 定时触发 Agent 任务,同一沙箱内文件可跨次执行保留
  • Environments API:以代码方式列出、检查、删除沙箱会话,避免等 7 天 TTL 自动过期

对「Agent 跑飞、账单失控」的顾虑,Budget Controls 是最直接的对症功能。

安全与可用渠道

3.6 Flash 随模型卡一并说明 Frontier Safety 增强,覆盖 CBRN(化学、生物、放射、核)与网络攻击滥用场景,目标是提高越狱抗性,同时减少对正当请求的误拒。

可用渠道(官方列出的入口):

  • 开发者:Gemini API(Google AI Studio、Android Studio)、Google Antigravity
  • 企业:Gemini Enterprise Agent Platform、Gemini Enterprise 应用
  • 消费者:Gemini App(3.5 Flash-Lite 亦在 Google Search 逐步 rollout)

小结:Flash 路线押注 Agent 规模化

Gemini 3.6 Flash 的发布逻辑很清晰:在 Agent 成为默认交互形态的背景下,Google 用 Token 效率 + 降价 + Managed Agents 默认切换 三板斧,把 Flash 系列推到「生产 Agent 的默认底座」位置。3.5 Flash-Lite 负责吞吐,3.5 Flash Cyber 负责安全垂直场景,Managed Agents 的 Hooks 与预算控制则补齐了工程落地最后一环。

若你已在用 Gemini API 的 Managed Agents 或 Antigravity,下一次交互会自动吃到 3.6 Flash;若自建 Agent 编排,建议对比同一 prompt 在 3.5 Flash 与 3.6 Flash 下的 输出 Token 数任务完成步数,这比只看单次 benchmark 分数更贴近真实账单。

参考来源:

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜