谷歌新一批 Flash 模型,只为一件事:让 AI 智能体更便宜、更快
Gemini 3.6 Flash、3.5 Flash-Lite,以及一款只做安全的 3.5 Flash Cyber,全都瞄准同一目标——大规模跑 AI 智能体,花更少的钱、少说废话。
60 秒版本
谷歌发布三款新的 Gemini Flash 模型——3.6 Flash、3.5 Flash-Lite 和只做安全的 3.5 Flash Cyber——全都为大规模、低成本地跑 AI 智能体而调优,卖点是效率(每个任务用更少 token)。
要点
- 3.6 Flash:主力——谷歌称输出 token 比 3.5 Flash 少约 17%,并降价至每百万 token 1.5/7.5 美元。
- 3.5 Flash-Lite:最快最便宜(输入三毛美元),每秒 350 token;谷歌称在部分智能体测试中打赢更老更大的「3 Flash」。
- 3.5 Flash Cyber:双刃的漏洞查补工具,仅通过 CodeMender 试点向政府和可信伙伴开放。
- 3.5 Pro 即将上线;Gemini 4 预训练已启动。
结论. 这是一个明确的赌注:智能体时代奖励的是便宜的效率,而非纯粹的体量——但几乎所有数字都是谷歌自测,姑且当作有前景的说法,而非已证实的结果。
发布了什么三款模型,一个执念:效率
谷歌刷新了主打「又便宜又快」的 Gemini Flash 系列,一口气推出三款新模型,全都瞄准同一目标:大规模、低成本地跑 AI 智能体——那种靠调用工具、边做边自查来完成多步任务的系统。它们的共同点不是脑子更大,而是用更少的 token 干同样的活,而 token 正是智能体真正花钱的地方。
阵容:3.6 Flash,更强的日常主力;3.5 Flash-Lite,超便宜的速度型;以及 3.5 Flash Cyber,一款锁在试点计划里的安全专用版。
主力马3.6 Flash:同样的活,更少的话
3.6 Flash 的看点不是跑分,而是省。谷歌说在第三方的 Artificial Analysis 指数上,它完成任务用掉的输出 token 比 3.5 Flash 少约 17%(部分编程测试里最多少 65%),而且所需的推理步骤和工具调用更少。价格也降了。既然智能体按 token 付费,每个任务少用 token 就是实打实省钱。
质量上,谷歌称相比 3.5 Flash 全面提升——编程更精准、机器学习研究类任务大幅进步,以及更强的电脑操作能力(让模型像人一样操作屏幕),现已成为 Gemini API 的内置工具。
| 跑分(3.6 对比 3.5 Flash) | 分数 |
|---|---|
| DeepSWE(编程) | 49% 对 37% |
| MLE Bench(机器学习研究) | 63.9% 对 49.7% |
| OSWorld-Verified(电脑操作) | 83.0% 对 78.4% |
| GDPval-AA v2(知识工作) | 1421 对 1349 |

省钱速度型3.5 Flash-Lite:便宜、快,还意外能打
Flash-Lite 是 3.5 家族里最快的——谷歌测得每秒 350 个输出 token——也是最便宜的,每百万输入 token 三毛美元、输出 2.5 美元。它的活是高吞吐、低延迟:智能体搜索、文档处理、大流水线。开发者还能调高或调低它的「思考」档位,在速度和深度之间权衡。
最抓眼的说法:在若干智能体和编程测试里,谷歌称 Flash-Lite 打赢了更老、更大的「3 Flash」——比如 SWE-Bench Pro(54.2% 对 49.6%)、OSWorld-Verified(74.0% 对 65.1%)。更小更便宜,未必更弱。
上了锁的门3.5 Flash Cyber:安全专家,却被刻意雪藏
第三款模型属性不同。3.5 Flash Cyber 是专为找漏洞、补漏洞而微调的 Flash,跑在一个叫 CodeMender 的系统里。设计上的巧思:CodeMender 让多个 Flash Cyber 智能体协同工作,再汇成一份综合报告。谷歌说它在 CyberGym 基准上达到了有竞争力的前沿水平。
为何重要行业正从「最大」转向「够用又最便宜」
拉远看,这次发布讲的是一个更大的故事:竞争正从*一个巨型模型能有多聪明*,转向*一个够用的模型能多便宜地跑几百万个智能体任务*。效率,而非纯粹的规模,成了新战场——因为智能体会把每个 token 乘上成千上万步。
对 AI 智能体来说,赢家不是最聪明的模型,而是用最少 token 就得出答案的那个。
谷歌还补充,Gemini 3.5 Pro 正在与伙伴测试、即将上线,而最让人挑眉的一句是——Gemini 4 的预训练已经开始。