Gemini 3.6 Flash 来了:输出 token 直降 17%,还能操控电脑,开发者现在该怎么接?

Google 在 7 月 21 日连发三款 Gemini 新模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite,以及面向网络安全的 Gemini 3.5 Flash Cyber。其中最值得普通人上手的是 Gemini 3.6 Flash——它不只是常规迭代,而是把「更快、更省、更能干」三件事同时往前推了一步。

如果你正在用 Gemini 3.5 Flash 写代码、跑 Agent、处理文档,这篇文章会告诉你:要不要换、怎么换、以及换完之后能立刻用在哪些场景里。

一、Gemini 3.6 Flash 到底升级了什么?

先一句话总结:同样的活,它用的 token 更少、推理步骤更少、代码改得更准。

根据 Google 官方数据和第三方基准测试机构 Artificial Analysis 的实测,3.6 Flash 相比 3.5 Flash 的核心变化包括:

  • 输出 token 减少 17%(部分复杂任务如 DeepSWE 能减少 65%),直接意味着账单变便宜、响应变快。
  • 价格下调:输入 $1.50 / 百万 token,输出 $7.50 / 百万 token(3.5 Flash 输出是 $9)。
  • 代码能力上涨:DeepSWE 从 37% 提升到 49%,MLE-Bench 从 49.7% 提升到 63.9%。
  • 知识工作更强:GDPval-AA 得分从 1349 涨到 1421。
  • Computer Use 内置:OSWorld-Verified 从 78.4% 提升到 83%,意味着它可以通过截图看界面、模拟鼠标键盘操作浏览器或桌面。
  • 知识截止更新到 2026 年 3 月,不再卡在 2025 年 1 月。

对开发者来说,最直观的感受是:以前让 Gemini 改一段代码,它可能会反复试探、改一堆无关地方、甚至进入死循环;现在它收敛得快了,token 消耗也少了。

二、三款新模型怎么区分?

Google 这次不是只发一个,而是发了三个定位完全不同的模型:

模型定位价格(输入/输出 per 1M token)适合场景
Gemini 3.6 Flash主力工作模型$1.50 / $7.50编程、Agent、多模态文档分析、Computer Use
Gemini 3.5 Flash-Lite极致性价比$0.30 / $2.50高并发搜索、文档处理、简单分类、摘要
Gemini 3.5 Flash Cyber安全专用未公开(限政府/可信伙伴)漏洞扫描、代码安全审计

普通人能直接用的是前两个。Cyber 版本目前只通过 Google 的 CodeMender 向政府和特定合作伙伴开放,不在公开 API 里。

3.5 Flash-Lite 的速度非常夸张,第三方测到 350 tok/s 的输出速度,适合对延迟敏感、对推理深度要求不高的任务。你可以把它理解为 Gemini 家族里的「高频小工」,而 3.6 Flash 是「主力开发」。

三、怎么用上 Gemini 3.6 Flash?

目前有几个入口:

1. Gemini App(普通用户):已经在 App 里可用,直接选模型即可。

2. Google AI Studio(开发者):最适合先免费试水,界面里直接切换模型。

3. Gemini API / Vertex AI(生产环境):适合写代码接入。

4. Android Studio / GitHub Copilot:Google 宣布会陆续接入这些工具。

5. OpenRouter:预计很快会上,方便国内开发者通过统一 API 调用。

如果你只是想先体验一下,推荐从 Google AI Studio 开始,不用绑卡就能跑。

四、代码接入:三行就能跑起来

Google 的新版 Python SDK 已经支持 `gemini-3.6-flash`。下面是一个最小可用示例:

Python
import google.genai as genai

client = genai.Client(api_key="YOUR_API_KEY")
response = client.models.generate_content(
    model="gemini-3.6-flash",
    contents="写一个线程安全的 LRU Cache,Python 实现",
    config={"temperature": 0.7, "max_output_tokens": 1024}
)
print(response.text)

如果你要开启思考模式(Thinking),可以这样配置:

Python
response = client.models.generate_content(
    model="gemini-3.6-flash",
    contents="找出这段代码里的 bug 并解释修复方法",
    config={"thinking_config": {"thinking_budget": 8192}}
)

for part in response.candidates[0].content.parts:
    if part.thought:
        print("思考过程:", part.text)
    else:
        print("回答:", part.text)

注意:从 3.5 Flash 迁移到 3.6 Flash,大部分情况下只需要改模型名字。API 结构基本保持一致,这是 Google 这次比较良心的一点。

五、Computer Use 能干什么?

这是 3.6 Flash 里最值得关注的新能力。它不再只是「读文本回答问题」,而是可以:

  • 看屏幕截图,理解当前界面状态。
  • 模拟点击、输入、滚动等操作。
  • 在浏览器里填表、查信息、操作没有 API 的老系统。

比如你可以让它:「打开这个后台管理系统,帮我导出上个月的订单报表。」它会把任务拆成:截图 → 识别按钮 → 点击登录 → 导航到报表页 → 选择日期 → 点击导出。

这个能力跟 Claude Sonnet 5 的 Computer Use、以及 Gemini Spark 在 Mac 上的桌面操作 是同一类方向。区别只在于:3.6 Flash 是通过 API 给开发者用的,而 Spark 是面向终端用户的桌面 Agent。

六、三个立刻能试的实战场景

1. 把旧代码库交给它重构

3.6 Flash 在代码编辑上的「收敛性」变强了,不会像以前那样东改一点西改一点。适合让它:

  • 把 Python 2 风格的代码迁移到现代写法。
  • 给 legacy 项目补类型注解。
  • 把一段业务逻辑拆成更清晰的函数。

2. 做多步骤文档分析

1M token 的上下文窗口 + 多模态输入,意味着你可以一次性丢进去:

  • 一份 60 页的 PDF 财报。
  • 几张 Excel 截图。
  • 一段会议录音转写。

然后问它:「这份材料里有哪些数据互相矛盾?列出来并说明原因。」

3. 搭一个浏览器 Agent

配合 Computer Use,3.6 Flash 现在可以作为浏览器自动化的「大脑」。比如你经常要从某个没有 API 的网站下载数据,以前要写 Selenium/Playwright 脚本,现在可以让 Agent 看着页面自己点。

当然,这种场景下一定要加好边界:哪些网站能访问、哪些按钮不能点、出错时怎么回退。

七、和其他模型怎么选?

如果你纠结该用 Gemini 3.6 Flash、Claude Sonnet 5,还是 GPT-5.6 系列,这里给一个简单决策框架:

  • 要便宜又快,还要能看图看文档:Gemini 3.6 Flash。
  • 要编程最强、愿意多花点钱:Claude Sonnet 5 或 Claude Opus 4.8。
  • 要最均衡、已经有 OpenAI 生态:GPT-5.6 Terra / Luna。
  • 要高并发、低延迟、简单任务:Gemini 3.5 Flash-Lite。
  • 要本地跑、不开源不放心:参考 本地部署大模型完全指南

具体到我们站点的 AI 实战应用指南,3.6 Flash 特别适合「文档处理」「代码辅助」「浏览器自动化」这三类场景。

八、迁移时要注意什么?

1. 模型名直接换:从 `gemini-3.5-flash` 改成 `gemini-3.6-flash`,代码改动很小。

2. Thinking 配置参数名可能变化:不同 SDK 版本对思考模式的字段命名不统一(常见为 `thinking_budget` 或 `thinking_level`),升级后先用小请求验证一次。

3. 温度、top_p、top_k 等参数:在 thinking 模式下某些 SDK 要求移除,遇到报错时优先检查官方文档。

4. 输出更精简了:同样的 prompt,返回内容可能比 3.5 Flash 更短,如果你依赖固定格式输出,建议加更明确的格式要求。

5. Computer Use 不是默认开启:需要显式调用客户端工具,且目前对界面复杂度的支持还有上限。

九、一个省钱的组合打法

生产环境里,其实可以 3.5 Flash-Lite 和 3.6 Flash 搭配用:

  • 第一步粗筛/摘要:3.5 Flash-Lite($0.30 / $2.50)。
  • 第二步深度处理:3.6 Flash($1.50 / $7.50)。
  • 第三步验证/敏感操作:Claude Sonnet 5 或人工复核。

这种分层路由的思路,在 AI 编程工程化 这篇文章里也提过:不是每个任务都需要最强模型,关键是把对的模型放到对的环节。

十、写在最后

Gemini 3.6 Flash 这次最大的意义,不是某项指标刷到第一,而是把「好用且不贵」这件事落到了实处。对普通开发者来说,它意味着你可以用更低的成本跑更复杂的 Agent;对企业来说,它意味着文档处理、客服、代码审查这些高频场景,终于有了性价比足够高的主力模型。

如果你还没试过,建议今天就打开 Google AI Studio,把你最近一个最常用 prompt 跑一遍 3.5 Flash 和 3.6 Flash 的对比。 token 少了多少、结果稳了多少,数字会告诉你答案。


参考链接:

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

推荐阅读

  • Gemini 3.6 Flash 来了:输出 token 直降 17%,还能操控电脑,开发者现在该怎么接?

    Google 在 7 月 21 日连发三款 Gemini 新模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite,以及面向网络安全的 Gemini 3.5 Flash C…

  • 阿里通义千问终于出了个能干正事的 AI 画图工具:Qwen-Image-3.0 上手指南

    这几个月 AI 画图工具一个接一个地出——ChatGPT Images 2.0 学会了推理构图,Meta Muse Image 直接塞进了 Instagram,Seedance 2.5 一次能生成 3…

  • Adobe Project Indigo 1.1 使用指南:在相机 App 里用 AI 一键修图

    7 月 21 日,Adobe 给实验性相机应用 Project Indigo 推送了 1.1 版本。这次更新不是加滤镜、调参数那么简单,而是直接塞进去了一套生成式 AI 照片编辑工具——AI Play…

  • 别只刷 AI 视频了,现在你可以走进画面里:阿里 HappyOyster 1.0 上手指南

    WAIC 2026 的余热还没散,阿里又放出一个新东西。 7 月 19 日,阿里云百炼正式上线 HappyOyster 1.0(中文名“快乐生蚝”),不是文生图,也不是文生视频,而是“世界模型”——你…

暗夜独行