Google 在 7 月 21 日连发三款 Gemini 新模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite,以及面向网络安全的 Gemini 3.5 Flash Cyber。其中最值得普通人上手的是 Gemini 3.6 Flash——它不只是常规迭代,而是把「更快、更省、更能干」三件事同时往前推了一步。
如果你正在用 Gemini 3.5 Flash 写代码、跑 Agent、处理文档,这篇文章会告诉你:要不要换、怎么换、以及换完之后能立刻用在哪些场景里。
一、Gemini 3.6 Flash 到底升级了什么?
先一句话总结:同样的活,它用的 token 更少、推理步骤更少、代码改得更准。
根据 Google 官方数据和第三方基准测试机构 Artificial Analysis 的实测,3.6 Flash 相比 3.5 Flash 的核心变化包括:
- 输出 token 减少 17%(部分复杂任务如 DeepSWE 能减少 65%),直接意味着账单变便宜、响应变快。
- 价格下调:输入 $1.50 / 百万 token,输出 $7.50 / 百万 token(3.5 Flash 输出是 $9)。
- 代码能力上涨:DeepSWE 从 37% 提升到 49%,MLE-Bench 从 49.7% 提升到 63.9%。
- 知识工作更强:GDPval-AA 得分从 1349 涨到 1421。
- Computer Use 内置:OSWorld-Verified 从 78.4% 提升到 83%,意味着它可以通过截图看界面、模拟鼠标键盘操作浏览器或桌面。
- 知识截止更新到 2026 年 3 月,不再卡在 2025 年 1 月。
对开发者来说,最直观的感受是:以前让 Gemini 改一段代码,它可能会反复试探、改一堆无关地方、甚至进入死循环;现在它收敛得快了,token 消耗也少了。
二、三款新模型怎么区分?
Google 这次不是只发一个,而是发了三个定位完全不同的模型:
| 模型 | 定位 | 价格(输入/输出 per 1M token) | 适合场景 |
|---|---|---|---|
| Gemini 3.6 Flash | 主力工作模型 | $1.50 / $7.50 | 编程、Agent、多模态文档分析、Computer Use |
| Gemini 3.5 Flash-Lite | 极致性价比 | $0.30 / $2.50 | 高并发搜索、文档处理、简单分类、摘要 |
| Gemini 3.5 Flash Cyber | 安全专用 | 未公开(限政府/可信伙伴) | 漏洞扫描、代码安全审计 |
普通人能直接用的是前两个。Cyber 版本目前只通过 Google 的 CodeMender 向政府和特定合作伙伴开放,不在公开 API 里。
3.5 Flash-Lite 的速度非常夸张,第三方测到 350 tok/s 的输出速度,适合对延迟敏感、对推理深度要求不高的任务。你可以把它理解为 Gemini 家族里的「高频小工」,而 3.6 Flash 是「主力开发」。
三、怎么用上 Gemini 3.6 Flash?
目前有几个入口:
1. Gemini App(普通用户):已经在 App 里可用,直接选模型即可。
2. Google AI Studio(开发者):最适合先免费试水,界面里直接切换模型。
3. Gemini API / Vertex AI(生产环境):适合写代码接入。
4. Android Studio / GitHub Copilot:Google 宣布会陆续接入这些工具。
5. OpenRouter:预计很快会上,方便国内开发者通过统一 API 调用。
如果你只是想先体验一下,推荐从 Google AI Studio 开始,不用绑卡就能跑。
四、代码接入:三行就能跑起来
Google 的新版 Python SDK 已经支持 `gemini-3.6-flash`。下面是一个最小可用示例:
import google.genai as genai
client = genai.Client(api_key="YOUR_API_KEY")
response = client.models.generate_content(
model="gemini-3.6-flash",
contents="写一个线程安全的 LRU Cache,Python 实现",
config={"temperature": 0.7, "max_output_tokens": 1024}
)
print(response.text)如果你要开启思考模式(Thinking),可以这样配置:
response = client.models.generate_content(
model="gemini-3.6-flash",
contents="找出这段代码里的 bug 并解释修复方法",
config={"thinking_config": {"thinking_budget": 8192}}
)
for part in response.candidates[0].content.parts:
if part.thought:
print("思考过程:", part.text)
else:
print("回答:", part.text)注意:从 3.5 Flash 迁移到 3.6 Flash,大部分情况下只需要改模型名字。API 结构基本保持一致,这是 Google 这次比较良心的一点。
五、Computer Use 能干什么?
这是 3.6 Flash 里最值得关注的新能力。它不再只是「读文本回答问题」,而是可以:
- 看屏幕截图,理解当前界面状态。
- 模拟点击、输入、滚动等操作。
- 在浏览器里填表、查信息、操作没有 API 的老系统。
比如你可以让它:「打开这个后台管理系统,帮我导出上个月的订单报表。」它会把任务拆成:截图 → 识别按钮 → 点击登录 → 导航到报表页 → 选择日期 → 点击导出。
这个能力跟 Claude Sonnet 5 的 Computer Use、以及 Gemini Spark 在 Mac 上的桌面操作 是同一类方向。区别只在于:3.6 Flash 是通过 API 给开发者用的,而 Spark 是面向终端用户的桌面 Agent。
六、三个立刻能试的实战场景
1. 把旧代码库交给它重构
3.6 Flash 在代码编辑上的「收敛性」变强了,不会像以前那样东改一点西改一点。适合让它:
- 把 Python 2 风格的代码迁移到现代写法。
- 给 legacy 项目补类型注解。
- 把一段业务逻辑拆成更清晰的函数。
2. 做多步骤文档分析
1M token 的上下文窗口 + 多模态输入,意味着你可以一次性丢进去:
- 一份 60 页的 PDF 财报。
- 几张 Excel 截图。
- 一段会议录音转写。
然后问它:「这份材料里有哪些数据互相矛盾?列出来并说明原因。」
3. 搭一个浏览器 Agent
配合 Computer Use,3.6 Flash 现在可以作为浏览器自动化的「大脑」。比如你经常要从某个没有 API 的网站下载数据,以前要写 Selenium/Playwright 脚本,现在可以让 Agent 看着页面自己点。
当然,这种场景下一定要加好边界:哪些网站能访问、哪些按钮不能点、出错时怎么回退。
七、和其他模型怎么选?
如果你纠结该用 Gemini 3.6 Flash、Claude Sonnet 5,还是 GPT-5.6 系列,这里给一个简单决策框架:
- 要便宜又快,还要能看图看文档:Gemini 3.6 Flash。
- 要编程最强、愿意多花点钱:Claude Sonnet 5 或 Claude Opus 4.8。
- 要最均衡、已经有 OpenAI 生态:GPT-5.6 Terra / Luna。
- 要高并发、低延迟、简单任务:Gemini 3.5 Flash-Lite。
- 要本地跑、不开源不放心:参考 本地部署大模型完全指南。
具体到我们站点的 AI 实战应用指南,3.6 Flash 特别适合「文档处理」「代码辅助」「浏览器自动化」这三类场景。
八、迁移时要注意什么?
1. 模型名直接换:从 `gemini-3.5-flash` 改成 `gemini-3.6-flash`,代码改动很小。
2. Thinking 配置参数名可能变化:不同 SDK 版本对思考模式的字段命名不统一(常见为 `thinking_budget` 或 `thinking_level`),升级后先用小请求验证一次。
3. 温度、top_p、top_k 等参数:在 thinking 模式下某些 SDK 要求移除,遇到报错时优先检查官方文档。
4. 输出更精简了:同样的 prompt,返回内容可能比 3.5 Flash 更短,如果你依赖固定格式输出,建议加更明确的格式要求。
5. Computer Use 不是默认开启:需要显式调用客户端工具,且目前对界面复杂度的支持还有上限。
九、一个省钱的组合打法
生产环境里,其实可以 3.5 Flash-Lite 和 3.6 Flash 搭配用:
- 第一步粗筛/摘要:3.5 Flash-Lite($0.30 / $2.50)。
- 第二步深度处理:3.6 Flash($1.50 / $7.50)。
- 第三步验证/敏感操作:Claude Sonnet 5 或人工复核。
这种分层路由的思路,在 AI 编程工程化 这篇文章里也提过:不是每个任务都需要最强模型,关键是把对的模型放到对的环节。
十、写在最后
Gemini 3.6 Flash 这次最大的意义,不是某项指标刷到第一,而是把「好用且不贵」这件事落到了实处。对普通开发者来说,它意味着你可以用更低的成本跑更复杂的 Agent;对企业来说,它意味着文档处理、客服、代码审查这些高频场景,终于有了性价比足够高的主力模型。
如果你还没试过,建议今天就打开 Google AI Studio,把你最近一个最常用 prompt 跑一遍 3.5 Flash 和 3.6 Flash 的对比。 token 少了多少、结果稳了多少,数字会告诉你答案。
参考链接:




发表回复