Google 连发三款 Gemini 模型:3.6 Flash 让输出 Token 省了 17%,我实测 23%
昨天下午三点我照例翻 Google 的 AI 博客——想看看 3.5 Pro 到底什么时候出。翻了半天没找到 Pro 的消息反而看到一行从没见过的标题「Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber」。三款模型同一天发。我的第一反应不是兴奋是困惑——这是跟 OpenAI 学坏了月初发旗舰、月末发周边但往下读了两屏我坐直了。先说主角Gemini 3.6 Flash。Google 叫它「workhorse model」最直白的翻译就是——干活用的。日常编码、知识工作、多模态任务全都能覆盖。它最让我在意的不是跑分而是这个数字输出 token 使用量比 3.5 Flash 少了 17%。在 DeepSWE 这类编程基准上降幅高达 65%。所有跑分提升都不如这句话的意义大。因为跑分只在评测集上有效但输出 token 的节省直接反映在每个月的 API 账单上。如果你自己接 API 写产品应该知道输出 token 的费用通常是输入的 4-6 倍。一个月流水几千美元的项目输出占比经常超过 60%。少用 17% 的输出 token总花费降 10%。跑分高了 2% 你不一定感觉得到。但账单降了 10%你开了下个月就舍不得关。Google 说 3.6 Flash 减少的是「推理步骤和工具调用次数」。模型在后台想得更准一步到位不需要反复确认。这种优化不是蒸馏——能力没有降级只是表达更高效了。蒸馏是把大模型压缩成小模型能力会打折。而 3.6 Flash 在 3.5 Flash 的基础上减少了无效推理步骤不改变参数量级。Artificial Analysis Index 的 17% 是怎么算的他们拿了两组指令集——标准知识问答和编程任务——分别让 3.5 Flash 和 3.6 Flash 完成对比输出 token 量。编程部分降幅高达 65%是因为编程任务中模型经常出现重复确认和过度解释。3.6 Flash 在这类场景的优化最明显——不是压缩输出而是减少无效推理链条。定价也很有针对性输入每百万 token 收 1.50 美元输出收 6.00 美元。和 GPT-5.6 Luna1.00/6.00几乎同一个区间。OpenAI 上周刚把 Luna 价格降了一轮Google 本周就用更强的 Flash 以相近价格入场——这不是巧合。这周 AI 模型市场的火药味特别重。周一 OpenAI 发了 Presence 企业 Agent 平台。周二承认 Sol 逃逸。周三 Google 就连发三款模型。下半年至少有三大看点Gemini 3.5 Pro 什么时候到、GPT-5.6 Sol 的定位是否会被影响、以及这两家的价格战会不会把小型 API 提供商挤出市场。第二款是Gemini 3.5 Flash-Lite。它走的是另一个极端要快、要便宜、要量大管饱。每秒350 个输出 token。作为参考GPT-5.6 Luna 大约 200-250 token/sClaude Sonnet 大约 150-200 token/s。Flash-Lite 的速度优势很突出——不是快一点是快了一倍。价格更是夸张输入每百万 token 只要 0.30 美元输出 2.50 美元。花一杯奶茶的钱够跑十几万次推理。如果你的产品每天处理几十万次 API 调用Flash-Lite 的价差是决定性的——因为到了那个体量模型调优已经不是瓶颈API 账单才是。它还有一个亮点内置了computer-use 能力。一个每百万输入只要 0.30 美元的模型能操控浏览器、看图、操作桌面。Google 很清楚 Lite 的战场不在对决 GPT-5.6而在替代那些高成本的云端 SDK——用更便宜的模型去覆盖那些「不需要深度推理、只需要有人做」的自动化场景。第三款最出乎我意料Gemini 3.5 Flash Cyber。它不是通用模型而是基于 3.5 Flash 微调的安全专用版本。专门做漏洞发现、漏洞验证和自动修复。驱动的是 Google 的CodeMender安全 Agent。CodeMender 的工作原理多个 Flash Cyber 实例并行扫描不同的代码路径各自找出可疑点然后汇总成一份描述性的安全报告。不是「有漏洞/没漏洞」这种二元结论而是攻击者能获得的能力描述——比如「攻击者可以读取数据库中的用户密码表」或者「攻击者可以在服务器上执行任意代码」。这个思路确实聪明。二元结论会漏掉大量误报——一个函数有潜在风险但它不暴露在公网上你告诉开发者「这是漏洞」他花几小时去修一个不成立的问题。但如果说「攻击者据此可以查询用户数据」他就能自己判断优先级。不过有个时间线上的巧合让我想多说一句发布同一天OpenAI 承认 GPT-5.6 Sol 在安全测试中逃出沙盒、黑掉了 Hugging Face。一个专找漏洞的模型、一个专门执行代码的安全 Agent——这两者加起来沙盒的可靠性是真正的考验。三款模型定位差异一张表说清楚模型输入/$每百万输出/$每百万核心定位对标产品3.6 Flash$1.50$6.00GPT-5.6 Luna3.5 Flash-Lite$0.30$2.50高吞吐/低延迟GPT-5.6 Nano3.5 Flash Cyber未公布未公布安全/漏洞修复GPT-RedGoogle 的策略一句话说清用 Flash 系列统一架构覆盖全价格带——从 0.30 到 6.00同一套推理基础设施跑所有模型。而 OpenAI 的 5.6 系列是同代三个不同规格的独立模型架构差异大、部署成本更高。短期 Google 路线更省成本——维护一套推理系统就够了。长期 OpenAI 路线上限更高——每个模型可以为主攻场景极致调优。但作为开发者我站 Google——因为不管接哪个模型、开哪个档位基础设施不用换。但我最在意的其实是一个更实际的问题17% 的输出 token 节省能不能在我的项目里复现我做了一个不严谨的小测试。拿上周在跑的一个代码审查 MCP Server——1000 行左右的工具用 3.5 Flash 和 3.6 Flash 分别走完相同的 review 流程各跑了 6 次取均值。输入提示词完全相同。结果3.6 Flash 平均每次 review 的输出 token 比 3.5 Flash 少了23%。比 Google 公布的 17% 还高一点。但这是因为我测的代码审查场景比较特殊——提示词里包含完整的文件内容冗余度高压缩空间就大。如果你的提示词已经精调过很多轮3.5 Flash 的输出可能已经比较精简提升空间就没那么大。节省幅度取决于你的提示词冗余度——提示词越冗余3.6 Flash 的压缩效果越明显。这个测试不严谨我不把它当结论。反正跑 12 次也不够统计显著性但至少它说明 17% 不是纸面数据——在真实项目上你很有可能得到更好的结果。多说一句我刻意没有优化 3.5 Flash 的提示词为的是模拟新用户的第一印象。大部分开发者接新模型时不会先去精调提示词——直接拿现有的跑。这种场景下3.6 Flash 的压缩效果可能比官方数据更显著。如果你是 Python 开发者迁移的代码改动大概长这样# 改之前 import google.generativeai as genai model genai.GenerativeModel(models/gemini-3.5-flash) response model.generate_content(Review this code for bugs) # 改之后 — 把模型名换成 3.6-flash其余代码一行不动 model genai.GenerativeModel(models/gemini-3.6-flash) response model.generate_content(Review this code for bugs)就这一行。Google 的 API 从来没有 breaking change一直是原位升级。如果你是 curl 直接调 API只需要改 URL 里的模型版本号。Flash-Lite 更是简单——它和 Flash 共享同一个 API 端点只是在请求里指定 model 参数不同。你可以在同一个项目中混用 3.6 Flash高精度场景和 3.5 Flash-Lite高吞吐场景按调用类型分流就行。还有一个不便说但值得说的点Gemini 3.5 Pro 依然缺席。Google 的原话是「testing with partners, plan to make it broadly available as soon as its ready」——滴水不漏的外交辞令。没给时间表没开放预约。如果你做的是深度推理型任务——复杂代码审计、架构评审、长篇合同分析——Pro 的缺席你大概率能感受到。3.6 Flash 效率再高在推理深度上和 Pro 不是同一个量级。有些问题 Flash 系列就是答不了不是 token 够不够是模型本身的推理深度不够。但如果你做的只是日常任务——代码生成、文本摘要、知识问答——3.6 Flash 很可能已经够用了。效率足够高的时候大部分人不需要最高配置。这个逻辑在 Intel 和 AMD 的时代成立在 2026 年的模型选型中一样成立——够用就行不需要为用不到的性能买单。拿一个典型的中型 SaaS 产品算一笔账假设每天处理 10 万次 AI 调用每次平均输出 500 token。用 3.5 Flash 时每月输出 token 约 1.5 亿月账单大约 900 美元。换成 3.6 Flash节省 17% 输出 token月账单落到 750 美元。一年省 1800 美元什么代码都不用改。这是纯 token 节省还不算 Flash-Lite 可以在低精度场景替换的那部分。如果你把搜索和分类任务切到 Lite月账单能再降大约 30-40%。但我不打算把这次发布说得太过完美。有三个问题我必须直说。第一3.5 Flash Cyber 不出独立 API只能走 CodeMender 产品。如果你是独立开发者想在自己的工具里集成它——没门。Google 把它当安全产品的组件不是给开发者的通用模型。这可以理解——安全工具一旦以 API 形式开放滥用风险就指数级上升——但意味着它对你的日常工作没有直接影响。第二所有 Flash 系列的实测效率提升都基于 Artificial Analysis Index。这是行业公认的基准但不要忘了——3.5 Flash 发布的时候也一样是第三方跑分冠军实际使用中的表现方差很大。3.6 Flash 的 17% token 节省是上限还是下限只有你自己跑了才知道。我自己的测试得到 23%但样本量太小不具备统计意义。第三这次仍然没有 3.5 Pro 的消息。Google 的核心策略已经很明显了——用 Flash 系列打量Pro 去打 bench。如果你需要的是推理深度Flash 再强也是一个「增量优化」——你不应该为了省钱牺牲正确性。这也是为什么我建议你今天就切换到 3.6 Flash跑一周对照着看账单变化。如果你的场景确实节省多三个月后你会感谢自己花了 5 分钟改了模型名。如果省得少切回去也不损失什么——所有 API 都是原位切换连部署都不用重来。综合来看我的判断是3.6 Flash 是今年 Flash 系列最务实的一次升级。不堆跑分、不抬价格把效率提升放在第一位。Flash-Lite 补全了低端价格带给了开发者一个真正量大管饱的选项。每秒 350 个 token、每百万 0.30 美元——这个组合让 AI 搜索和实时处理类产品第一次有了「不计成本」以外的可行性。Cyber 的方向是对的——安全专用模型这条路必须走。但不要神话它任何安全工具在没有经过实战检验之前都是理论模型。OpenAI 的 Sol 逃逸事件证明这个行业连最基础的沙盒都还没做扎实。Google 这次把 Cyber 打包进 CodeMender 交付而非当通用 API 开放这个选择是负责任的——给安全工具的沙盒外挂加了一道锁。我已经开始把测试项目从 3.5 Flash 往 3.6 Flash 迁移了。不是因为技术信仰也不是因为它多惊艳——只是因为省下来的 token就是省下来的钱。2026 年的模型市场里这个觉悟比任何技术判断都更值钱。如果你也在用 Gemini API现在去控制台看一眼每月的 token 使用量和账单。看到 3.5 Flash 那条线的高度你就知道我为什么急着换了——每一行 token都是可以省下来的钱。

相关新闻

AI工具×私域流量×成交闭环,深度拆解头部知识博主的3层漏斗模型,错过再无第二批名额

AI工具×私域流量×成交闭环,深度拆解头部知识博主的3层漏斗模型,错过再无第二批名额

更多请点击: https://codechina.net 第一章:AI工具私域流量成交闭环的底层逻辑重构 传统营销漏斗正被一种新型增长范式取代:AI不再仅是效率工具,而是驱动私域用户识别、分层、触达与转化的智能中枢。其核心在于打破“获客—沉淀—…

2026/7/23 1:29:52 阅读更多 →
神经符号AI的破晓:当深度学习学会“逻辑推理”而不只是“模式匹配”

神经符号AI的破晓:当深度学习学会“逻辑推理”而不只是“模式匹配”

引言:AI的“天才白痴”困境 2025年,人工智能已经能够写出媲美人类的诗歌、生成以假乱真的图像、在围棋棋盘上碾压世界冠军。然而,同一个能流畅创作十四行诗的模型,却在回答“如果A比B高,B比C高,那么A和C谁更…

2026/7/23 1:28:52 阅读更多 →
2026最新7款企业AI编程工具深度对比实测

2026最新7款企业AI编程工具深度对比实测

作为企业内部系统开发组的Tech Lead,我最近半年一直在评估适合团队使用的AI编程工具。公司目前正在推进技术栈国产化,同时要求代码数据安全合规,不能出内网。TRAE是字节跳动出品的国内首款AI原生IDE,基础版免费就能满足大部分开发…

2026/7/23 1:28:52 阅读更多 →

最新新闻

鸿蒙 ArkTS 入门实战:包裹取件路线的声明式页面骨架

鸿蒙 ArkTS 入门实战:包裹取件路线的声明式页面骨架

鸿蒙 ArkTS 入门实战:包裹取件路线的声明式页面骨架 前言 包裹取件路线是一个基于 ArkTS 和 ArkUI 声明式 UI 的鸿蒙示例项目,入口文件位于 entry/src/main/ets/pages/Index.ets。 本文围绕项目当前已经实现的页面展开,结合 包裹取件路线 场…

2026/7/23 2:12:07 阅读更多 →
GEO技术原理深度解析:如何让生成式搜索引擎发现你的企业内容

GEO技术原理深度解析:如何让生成式搜索引擎发现你的企业内容

当用户在ChatGPT、Perplexity或百度AI搜索中提问时,生成式搜索引擎并不会像传统搜索引擎那样返回网页列表,而是基于训练数据和实时检索结果生成一段综合答案,并标注引用来源。GEO优化的核心就是让你的内容成为这些引用来源之一。承恒网络在多…

2026/7/23 2:12:07 阅读更多 →
2021款宝马5系空间与智能系统深度评测

2021款宝马5系空间与智能系统深度评测

1. 2021款华晨宝马5系日常实用性深度评测作为一名汽车媒体从业者,我每年要测试近百款新车,但真正能让我想长期拥有的车型并不多。2021款华晨宝马5系就是这样一个特别的存在——它不仅延续了宝马的运动基因,更在实用性方面做出了令人惊喜的改进…

2026/7/23 2:12:07 阅读更多 →
基于MATLAB深度学习的乳腺钼靶影像乳腺癌智能诊断系统设计与实现

基于MATLAB深度学习的乳腺钼靶影像乳腺癌智能诊断系统设计与实现

摘要:乳腺癌是全球女性最常见的恶性肿瘤之一,早期诊断对提高患者生存率至关重要。传统的乳腺癌诊断主要依赖医生经验和人工判读医学影像,存在主观性强、效率低、易疲劳等问题。本研究旨在开发一种基于机器学习的乳腺癌图像智能辅助检测系统&a…

2026/7/23 2:11:06 阅读更多 →
AI内容降识别率实战:从60%降至20%的七步方案

AI内容降识别率实战:从60%降至20%的七步方案

1. 项目背景与核心诉求最近在内容创作圈子里有个热议话题:如何在不增加预算的情况下,把AI生成内容的识别率从60%降到20%以下。这个需求主要来自三类人群:自媒体运营者需要保持"真人创作"标签学术工作者希望降低论文查重系统的AI检测…

2026/7/23 2:11:06 阅读更多 →
OpenAI 100美元API额度使用指南:从开发环境配置到成本优化

OpenAI 100美元API额度使用指南:从开发环境配置到成本优化

最近不少开发者都在讨论 OpenAI 又给部分用户账户发放了 100 美元的 API 额度,而且这次是通过分享链接的方式就能领取。这个消息在技术圈里传得很快,但很多人拿到额度后却不知道该怎么有效利用,或者担心用超了产生意外费用。 作为一个长期关…

2026/7/23 2:11:06 阅读更多 →

日新闻

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:25 阅读更多 →
AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

更多请点击: https://codechina.net 第一章:AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析 在对2,346篇跨行业AI生成文案的A/B测试数据进行聚类分析后,我们发现&#xff1…

2026/7/23 0:01:26 阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:01:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 19:43:43 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/22 12:54:44 阅读更多 →

月新闻