30 秒结论
2026 年 9 月 2 日,Google 正式发布了 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两款模型。两者共享基础智能,但面向完全不同的使用场景和用户群体,并非同一产品的两个可选模式。
- Gemini 3.8 Flash 是通用模型,Google 表示其在软件工程、Agent 任务和多步推理能力上相比 3.7 Flash 有显著提升。开发者 API 的 introductory price( introductory price,即早期优惠价)与 3.7 Flash 保持一致:每百万输入 token 定价 0.75 美元,每百万输出 token 定价 3.75 美元。
- 需要特别注意:"同价"指的是 API 的按量计费价格,并不代表 Google AI Pro 或 Ultra 订阅费用下调,也不意味着所有国家、账号类型或应用界面会同步出现相同模型。Gemini 应用的可用性仍然受订阅方案、地区、语言、账号权限和用量额度等多重因素影响。
- Gemini 3.8 Flash Cyber 专门面向防守方的高风险网络安全工作,优先通过 Fairwind Program 向政府机构、关键基础设施运营者、核心技术平台等经过审查的合作伙伴提供。普通用户无法将其作为公开可选的"更强版 Flash"来使用。
- 宣传中的"更快"和"更安全"都是带有条件的产品描述。3.8 Flash 在处理复杂任务时可能会进行更多推理步骤、消耗更多 token;Google 公布的 benchmark 数据反映的是特定测试条件下的表现,并非对每一次回答、每一种代码场景或每一个真实企业环境中的性能保证。
先把两个"Flash"区分清楚
| 名称 | 面向用户 | 官方入口/状态 | 定位说明 |
|---|---|---|---|
| Gemini 3.8 Flash | 普通用户、开发者、企业 | Gemini App、Google Search 的 AI Mode、Google Sheets;API、AI Studio、Gemini Enterprise | 通用工作模型,兼顾速度、成本和推理能力;具体可用入口取决于账号类型与所在地区 |
| Gemini 3.8 Flash Cyber | 受信任的防守团队 | Fairwind Program;可与 CodeMender 配合使用 | 为漏洞发现、验证和修复设计的受限网络安全能力,并非公开可用的攻击工具 |
根据 Google 开发者文档,3.8 Flash 的稳定模型 ID 为 gemini-3.8-flash,支持文本、图片、视频、音频和 PDF 等多种输入格式,同时支持工具调用、搜索 grounding、代码执行和思考能力(thinking)。需要说明的是,这些是 API 层面的能力清单,并不代表 Gemini App 的每个订阅套餐都会开放所有功能按钮。
"新模型"对普通用户的实际意义
不是手机自动换上了一个更聪明的大脑
Google 在公告中将 3.8 Flash 描述为"最具智能的 Flash 工作模型",并强调其在长链路编程、Agent 工作流和复杂知识任务上的提升。对普通用户来说,实际可感知的变化更可能表现为:处理长任务时模型更愿意进行拆解、调用工具和复核结果,在处理复杂代码或资料整理时成功率有望提升。
不过,模型名称、版本和可用性随时可能发生变化。应用中的"Flash"标签可能由 Google 统一管理和灰度发布,用户未必能手动锁定 gemini-3.8-flash 版本。真正需要关注的是:当前回答是否明确标注了模型版本、是否能正常使用相应工具功能,以及自己的订阅套餐是否还有可用额度。
"更快"不等于每一次回答都更快
Flash 产品线的核心定位是低延迟和成本效率,但 Google 同时也说明:3.8 Flash 在处理复杂任务时会执行额外的推理步骤、反复调用工具,尤其在提高 effort level 时,可能消耗更多 token。这意味着同一个模型可能带来两种截然不同的体验——简单问答响应很快,而复杂任务为了更认真地推理反而需要更长的等待时间。
将这次升级理解为"在可控成本下模型愿意多想一会儿",比把"更快"简单理解成固定的毫秒级响应时间要准确得多。实际延迟还会受到网络状况、工具响应速度、上下文长度和服务负载等因素的影响。
Benchmark 数据是参考证据,不是生产承诺
Google 公告中列出了 DeepSWE v1.1、Vals Finance Agent V2、Harvey's Legal Agent Benchmark 和 HLE-Verified 等评测结果,以及 CyberGym、CWE-Bench 等网络安全相关基准。这些数据回答的是"在特定数据集、特定提示、特定评测方法和特定计算预算下模型表现如何",但并不保证:
- 你的代码仓库一定能被自动修复;
- 中文长文档、财务判断或法律问题的回答一定准确;
- 生产环境中一定更便宜、更快或零误报;
- 某一项 benchmark 的领先优势能够迁移到所有任务类型上。
模型卡中还明确指出,3.8 Flash 仍然可能出现幻觉、偶发变慢或超时,知识截止日期和不同领域的信息新鲜度也存在局限。对于高风险场景下的结论,仍需回归原始资料、测试环境和人工审核流程。
"同价/更便宜"究竟指的是哪种价格?
API:当前为 introductory price,2027 年 1 月 1 日起调整
根据 Google AI for Developers 价格页显示,3.8 Flash 标准付费层按 token 计价的具体安排如下:
| API 用法 | 2026-12-31 前 | 2027-01-01 起 |
|---|---|---|
| 标准输入/每百万 token | 0.75 美元 | 1.50 美元 |
| 标准输出(含 thinking token)/每百万 token | 3.75 美元 | 7.50 美元 |
| Context caching 输入/每百万 token | 0.075 美元 | 0.15 美元 |
Batch 和 Flex 模式的价格更低,但对应的是不同的处理模式;Priority 模式价格更高,也不适合与标准层直接比较。Search 或 Maps grounding 功能还可能按请求另行计费。价格页同时区分了数据用途:免费层标注为"可能用于改进 Google 产品",付费层则标注为"不用于改进产品"。免费层虽然显示为 free of charge,但仍有配额、功能限制和数据使用边界,不能将其理解为可无限量使用的生产级服务。
因此,新闻中"与 3.7 Flash 同样便宜"的说法至少需要补充三个限定条件:这是 API 的按量计费价格、属于 introductory price 优惠阶段、并且仅持续到 2026 年 12 月 31 日。Google 并未在这则模型公告中宣布 Google AI Pro 或 Ultra 订阅费用下调;订阅价格需以用户所在国家/地区的 Google One 或 Google AI 页面实际显示为准。
普通消费者:看套餐和入口,而非 API 单价
Google 公告中提到,3.8 Flash 面向 Google AI Pro 和 Ultra 订阅者开放,可在 Gemini App、Search 的 AI Mode 和 Gemini in Sheets 中使用;企业用户可通过 Gemini Enterprise 访问。同时,Google 帮助页也说明,Gemini 的用量额度按任务复杂度、模型选择、功能使用和对话长度综合计算,并可能因测试安排和可用性调整而发生变化。
普通用户在判断时可以参考以下自查清单:
- 我是在 Gemini App 中使用订阅套餐,还是在 AI Studio/API 中按 token 付费?
- 我的国家/地区、语言设置、账号类型和设备是否支持对应的入口?
- 页面显示的是 "3.8 Flash" 具体模型名,还是统一的 "Flash" 选择器或其他模型标识?
- 当前可用额度、上下文窗口大小和工具权限具体是多少,而非只看宣传语?
- 如果要将模型接入生产系统,是否已记录 token 消耗、grounding 请求和重试成本?
对于希望在不改变核心调用逻辑的前提下接入多个模型、或需在国内网络环境下完成 API 调用的开发者而言,除了直接申请 Google 官方 API 之外,也可以通过 4SAPI 中转站等统一接入平台调用 Gemini 3.8 Flash 及其他主流模型。这类方式可以减少多平台间的密钥管理、协议适配和模型切换方面的重复工作,将更多精力放在业务逻辑本身。
Cyber 版本为何受限?
不是因为"它只会攻击",而是能力具有明显的双重用途
漏洞发现、逆向分析、恶意软件分析和自动修复能力既可以用于保护系统,也可能被滥用于攻击行为。Google 明确表示,3.8 Flash Cyber 的重点放在漏洞发现、验证和修复环节,可独立使用,也可与 CodeMender 配合部署。CodeMender 托管在 Gemini Enterprise Agent Platform 上,通过本地 CLI 交互;核心推理和编排在云端完成,而编译、测试与漏洞利用模拟则在客户管理的本地沙箱或隔离 VM 中执行。Fairwind 允许的双重用途任务必须是经过授权的威胁模拟、逆向工程或防守/学术研究,恶意软件制作等恶意任务不在允许范围内。具体模型选择、托管区域、数据保留策略和合同边界仍需以当前 CodeMender 与 Gemini Enterprise 的官方文档为准。
Fairwind Program 设置了明确的准入门槛
目前优先对象包括政府和国家级网络机构、医疗/电信/能源/金融等关键基础设施运营者,以及维护广泛软件基础的核心技术平台。申请方需经过尽职调查;参与组织还需部署用户级认证、抗钓鱼 MFA 和访问控制机制,仅允许内部网络安全、事件响应或渗透测试团队使用,并对员工访问行为进行跟踪记录。访问权限不得由合作伙伴分享、转售或重新分发。
所以"Cyber 为什么受限"的答案在于:Google 为了让防守方优先获得能力、同时降低被滥用的风险,采用了受审查合作伙伴、限定任务范围、强认证、限定团队和不可转售等多重门槛的组合策略。这并非普通账号看不到某个隐藏开关,也不是开通 Google AI Pro 就能自动获得的附加功能。
"更安全"也有明确边界
Google 的模型公告指出,3.8 Flash 针对 CBRN 和网络攻击滥用场景配置了 safeguards;3.8 Flash Cyber 在网络安全领域采用更宽松的 mitigations,因此仅向 trusted defenders 提供。Google DeepMind 的 Frontier Safety Framework 是一套用于评估和缓解严重能力风险的流程,而非"模型不会犯错"的认证。
普通用户应将"更安全"理解为:产品方增加了滥用防护、安全评测和访问治理等多层措施;不应将其理解为模型输出天然正确、代码自动修复结果无需审查,或拥有 Cyber 访问权限即获得合法渗透测试授权。
普通人可执行的操作清单
-
先确认自己的使用场景。 日常写作、学习和资料整理可以尝试 3.8 Flash;涉及支付、医疗、法律、生产代码和账号权限等高风险场景时,先降低自动化执行权限,保留人工审核环节。
-
记录模型名称和套餐信息。 截图或记录当前使用的入口、订阅方案、日期、地区和实际模型 ID,避免将 API 按量价格误认为订阅价格。
-
开发者进行小样本回放测试。 使用自己的匿名任务集比较 3.7 与 3.8 在正确率、延迟、token 消耗、工具调用次数和人工返工成本上的差异,不要仅凭新闻中的 benchmark 数据直接决定迁移。
在实际测试中,若需要同时对比 Gemini 3.8 Flash 与 Claude、GPT 等其他模型的输出质量与成本,可以通过 4SAPI 等聚合接口完成统一调用,无需为每个模型分别维护一套接入代码和计费体系。这种方式更适合需要快速完成多模型评估的场景。
-
为复杂任务设置消耗上限。 限定最大 token 数、重试次数、工具调用权限和预算范围;3.8 的更深推理能力可能带来额外的用量消耗,需要提前做好成本控制。
-
高风险输出保留原始证据。 代码场景跑通测试用例、财务问题查对原始报表、法律问题核对法规原文、医学问题咨询专业人员;不要只保存 AI 生成的一句结论作为最终依据。
-
不要寻找来路不明的 Cyber 入口。 仅通过 Google 官方 Fairwind 申请流程和受控企业渠道使用安全能力;普通用户进行安全学习应在授权靶场和隔离环境中进行。
五个常见误区
-
"同价"就是 Google AI 订阅降价了。 不是。公告和价格页所说的"同价"针对的是 Gemini API 的 token 计费价格;订阅费用、地区货币和套餐权益需要另行核对。
-
"0.75 美元/百万 token"会一直保持这个价格。 不是。这是 2026 年 12 月 31 日前的 introductory price;2027 年 1 月 1 日起标准输入调整为 1.50 美元、标准输出调整为 7.50 美元。
-
"3.8 Flash 更强,所以一定比 3.7 快"。 不一定。简单任务可能响应更敏捷,但复杂任务可能会进行更多推理步骤、调用更多工具并消耗更多 token。
-
"Cyber 是普通 Flash 的一个安全模式,人人都能打开"。 不是。Cyber 通过 Fairwind Program 向经过审查的 trusted defenders 提供,在团队范围、允许任务类型、认证方式和共享规则上都有严格限制。
-
"benchmark 第一名等于我的项目可以零风险上线"。 不对。benchmark 是特定条件下的实验结果;模型仍可能产生幻觉、超时和生成错误代码,生产环境上线必须经过充分测试、人工审阅、权限隔离和回滚预案。
未来 72 小时关注什么
- Google AI Pro/Ultra 帮助页是否补充 3.8 Flash 在各地区、语言、平台和套餐中的具体可用性说明;
- Gemini App 是否出现可见的模型版本选择、额度提示或 thinking level 调整选项,而不仅仅是 API 文档更新;
- Google 是否公布 Flash Cyber 的更多 Fairwind 申请条件、地区范围覆盖、审计要求与数据保留说明;
- 3.8 Flash API 的免费层配额、grounding 计费规则和 2027 年价格切换是否在控制台中清晰展示;
- 开发者社区的真实回放测试中,质量提升是否足以抵消额外推理 token、工具调用和延迟成本的增加。
结论:看清"入口、价格、权限",再谈升级
Gemini 3.8 Flash 带来的真实变化,是将更强的长任务推理能力整合进 Flash 系列原有的速度与成本定位中;而 Gemini 3.8 Flash Cyber 则是将高风险网络安全能力嵌入 Fairwind 的受控防守流程中。对普通用户而言,最实用的判断维度不是"它是不是最强模型",而是自己当前使用的是哪条产品线、是否具备访问资格、价格何时发生变化,以及输出结果是否经过了充分核验。
总体来看,直接调用 Google 官方 API 和通过统一中转平台接入并不是相互排斥的两种方式。对原生功能完整性、数据链路可控性和官方技术支持要求较高的项目,可以优先评估官方接口;需要同时测试多个模型、减少重复适配工作、或希望在国内网络环境下简化调用流程的团队,也可以将 4SAPI 中转站作为备选接入路径进行考察。正式投入生产前,仍应根据实际模型选择、并发量需求、响应速度要求、费用预算和数据安全规范进行充分测试。
如果你还在比较复杂任务的额度和成本管理,可以接着阅读《Gemini Notebook 五小时算力额度:普通人如何管理复杂任务》;涉及 Gemini 连接邮箱、日历等外部数据时,可参考《Gemini Live 语音操作邮箱与日历的安全上手》。
官方信息来源
- Introducing Gemini 3.8 Flash and 3.8 Flash Cyber,Google,2026-09-02:模型定位、消费者/开发者/企业入口、introductory price、benchmark 和安全边界说明。
- Gemini Developer API pricing,Google AI for Developers,2026-09-03 复核:标准、Batch、Flex、Priority 的输入/输出价格和 2027-01-01 调价节点。
- Gemini 3.8 Flash model card,Google DeepMind,2026-09-02:已知限制、知识截止日期、幻觉/超时提醒与 Frontier Safety 评估。
- Fairwind Program,Google DeepMind,2026-09-02:受信任合作伙伴资格、允许任务类型、MFA 要求、团队访问控制、尽调与不可转售规则。
- Gemini Apps limits & upgrades for Google AI subscribers,Google Gemini Apps Help:套餐、额度、地区和模型可用性边界。
- CodeMender,Google Cloud:Gemini Enterprise 托管、本地 CLI、云端推理/编排与客户管理的本地沙箱边界说明。