跳到主内容
选型对比10 分钟阅读发布于:2026-08-10更新于:2026-08-10

Google Gemini API 模型与价格(2026 官方数据指南)

对比 Gemini 3.6 Flash、3.5 Flash 与 3.5 Flash-Lite 的官方价格、上下文限制、能力、免费层级、Batch、Flex、Priority 和 grounding 费用。

作者 Heizi· 创始人 & 编辑· 发布于: 2026-08-10实测验证

Google Gemini 稳定模型

覆盖不同负载的智能光谱

最新综合能力选择 3.6 Flash,持续前沿任务选择 3.5 Flash,高吞吐低成本场景选择 3.5 Flash-Lite。

美元 / 百万 tokens · 付费层级 · Standard

Gemini 3.6 Flash

Google 最新稳定模型,在速度与智能之间取得平衡,适合智能体和多模态任务。

模型 ID
gemini-3.6-flash
状态
稳定版
输入
$1.50
缓存输入
$0.15
输出
$7.50
Batch / Flex
$0.75 / $3.75
Priority
$2.70 / $13.50
输入上限
1,048,576
输出上限
65,536
最近更新
Jul 2026
能力
Thinking、函数调用、代码执行、文件搜索、Search/Maps grounding、URL Context、结构化输出、Computer Use(预览)

Gemini 3.5 Flash

面向智能体工作流与编程任务,提供稳定持续的前沿性能。

模型 ID
gemini-3.5-flash
状态
稳定版
输入
$1.50
缓存输入
$0.15
输出
$9.00
Batch / Flex
$0.75 / $4.50
Priority
$2.70 / $16.20
输入上限
1,048,576
输出上限
65,536
最近更新
May 2026
能力
Thinking、函数调用、代码执行、文件搜索、Search/Maps grounding、URL Context、结构化输出、Computer Use(预览)

Gemini 3.5 Flash-Lite

Gemini 3.5 系列中速度最快、成本最低的稳定模型,适合高吞吐执行。

模型 ID
gemini-3.5-flash-lite
状态
稳定版
输入
$0.30
缓存输入
$0.03
输出
$2.50
Batch / Flex
$0.15 / $1.25
Priority
$0.54 / $4.50
输入上限
1,048,576
输出上限
65,536
最近更新
Jul 2026
能力
Thinking、函数调用、代码执行、文件搜索、Search/Maps grounding、URL Context、结构化输出、Computer Use(预览)
Gemini Developer API 官方价格快照核验于 2026 年 8 月 10 日,价格可能变化。

当前稳定版 Gemini 模型

Google 当前稳定的通用模型主线包括 Gemini 3.6 Flash、Gemini 3.5 Flash 和 Gemini 3.5 Flash-Lite。3.6 Flash 是速度与智能的最新平衡,3.5 Flash 面向持续的前沿智能体和编程任务,3.5 Flash-Lite 则优先考虑吞吐量与成本。

三个模型都接受文本、图像、视频、音频和 PDF 输入,并输出文本;输入上限均为 1,048,576 tokens,输出上限均为 65,536 tokens。上方对比使用 2026 年 8 月 10 日核验的 Gemini Developer API 官方模型和价格页面。

  • Gemini 3.6 Flash:Standard 输入 $1.50、缓存输入 $0.15、输出 $7.50 / 百万 tokens
  • Gemini 3.5 Flash:Standard 输入 $1.50、缓存输入 $0.15、输出 $9.00 / 百万 tokens
  • Gemini 3.5 Flash-Lite:Standard 输入 $0.30、缓存输入 $0.03、输出 $2.50 / 百万 tokens

应该选择哪个 Gemini 模型?

需要 Google 最新稳定通用模型,以及较强的多模态、grounding 和智能体能力时,优先选择 3.6 Flash。在当前价格快照中,它的 Standard 输出价格也低于 3.5 Flash。

已经在 3.5 Flash 上完成验证,或重视持续前沿编程表现时,可以继续使用 3.5 Flash。分类、抽取、翻译、路由等高调用量任务更适合 3.5 Flash-Lite。

Standard、Batch、Flex 与 Priority 价格

Standard 是普通付费层级价格;Batch 和 Flex 为可以接受异步或弹性处理的工作负载降低 token 单价;Priority inference 价格更高,用于需要优先容量的负载。

Batch 和 Flex 不是临时促销,而是交付特性不同的处理选项。生产流量切换前,应通过官方文档确认可用性和运行限制。

  • 3.6 Flash 输入/输出:Standard $1.50/$7.50 · Batch 或 Flex $0.75/$3.75 · Priority $2.70/$13.50
  • 3.5 Flash 输入/输出:Standard $1.50/$9.00 · Batch 或 Flex $0.75/$4.50 · Priority $2.70/$16.20
  • 3.5 Flash-Lite 输入/输出:Standard $0.30/$2.50 · Batch 或 Flex $0.15/$1.25 · Priority $0.54/$4.50

模型共有能力

三个稳定模型具备广泛的共同能力:Thinking、结构化输出、函数调用、代码执行、文件搜索、URL Context、Search grounding、Google Maps grounding、缓存,以及预览版 Computer Use。

它们不直接生成音频或图像,也不使用 Live API。原生图像、语音、实时对话、音乐或视频生成应选择 Nano Banana、TTS、Live、Lyria、Imagen 或 Veo 等专用模型,并单独核对计量单位和价格。

免费层级、付费层级与数据使用

官方价格表显示,这些稳定模型在免费层级可免费使用 token,但受速率限制和可用性约束。付费层级按上述价格收费,并标记为不用于改进 Google 产品;免费层级则标记为会用于改进产品。

免费层级限制属于账户和服务约束,并非永久无限额度。估算生产容量前,应在 Google AI Studio 中确认速率限制和账单状态。

Google Search 与 Maps Grounding 费用

Grounding 费用与模型 token 价格分开计算。当前 Gemini 3.x 价格表包含每月共享的 5,000 次免费 Google Search 请求,超出后每 1,000 次 $14;Google Maps grounding 也提供共享月度额度,之后每 1,000 个搜索查询 $14。

一次客户请求可能触发多个搜索查询,Google 会按实际执行的每个查询收费。因此应监控真实 grounding 活动,而不能只按 API 请求次数估算。

估算成本并核验价格

Token 成本可按以下公式估算:输入 tokens × 输入单价,加上输出 tokens(包括 Thinking tokens)× 输出单价,再除以一百万。Grounding、缓存存储或专用媒体费用需要另行加入。

本页是带日期的编辑快照,并非实时账单。Google 可能新增模型、调整预览状态或更新价格。部署前请在 Gemini Developer API 官方页面核对模型 ID、价格层级、速率限制和最终账单条款。

常见问题

哪个稳定版 Gemini 模型最便宜?

在本文重点展示的三个稳定模型中,Gemini 3.5 Flash-Lite 的 Standard 付费价格最低:输入 $0.30、输出 $2.50 / 百万 tokens。

Gemini 3.6 Flash 有免费层级吗?

官方价格页列出了免费的 Standard token 使用,但受速率限制和可用性约束。请在 AI Studio 中确认你账户的实际限制。

Batch 和 Flex 始终是 Standard 的半价吗?

在 2026 年 8 月 10 日的价格快照中,这三个模型的 Batch 和 Flex 输入、输出价格是 Standard 的一半,但不能假设所有 Gemini 模型或未来价格都保持相同比例。

Google Search grounding 包含在 token 价格内吗?

不包含。Grounding 有独立的月度免费额度,超出后按查询收费,而且一次请求可能产生多个计费搜索查询。

相关供应商

参考来源