2026 年 AI API Token 价格对比:GPT-5.6、Claude Fable 5.1、Gemini 3.6、DeepSeek 等主流模型
2026 年主流 AI 供应商每百万 Token 输入/输出价格全面对比,帮助你根据预算和场景选择合适模型。

1)2026 年 Token 价格对比表
下表为 2026 年 9 月 3 日核验的标准 API 每百万 Token 价格。国际供应商以美元计价,国内供应商以人民币计价。价格均指非批量、非缓存的标准调用;Batch 与 Prompt 缓存可以降低部分费用,DeepSeek 还会按高峰和空闲时段分档计价。
注意:价格随时可能变动,决策前请以各供应商官网定价页面为准。如果你想降低成本,我们的免费 AI API 指南 介绍了哪些供应商提供免费额度,可以补充你的付费使用。
- Claude Fable 5.1(Anthropic):输入 $10.00 / 输出 $50.00 每百万 Token — Claude 公开旗舰档
- GPT-5.6 Sol(OpenAI):输入 $5.00 / 输出 $30.00 每百万 Token — 旗舰推理
- GPT-5.6 Terra(OpenAI):输入 $2.00 / 输出 $12.00 每百万 Token — 均衡性能
- Gemini 3.6 Flash(Google):输入 $1.50 / 输出 $7.50 每百万 Token — 最新稳定均衡模型
- GPT-5.6 Luna(OpenAI):输入 $0.20 / 输出 $1.20 每百万 Token — 性价比 OpenAI
- Gemini 3.5 Flash-Lite(Google):输入 $0.30 / 输出 $2.50 每百万 Token — 稳定高吞吐性价比
- DeepSeek V4 Flash:缓存未命中输入 空闲 ¥1.5 / 高峰 ¥3.0 · 输出 空闲 ¥4.5 / 高峰 ¥9.0 每百万 Token — 缓存命中 ¥0.05 / ¥0.10
- DeepSeek V4 Pro:缓存未命中输入 空闲 ¥4.5 / 高峰 ¥9.0 · 输出 空闲 ¥13.5 / 高峰 ¥27.0 每百万 Token — 缓存命中 ¥0.15 / ¥0.30
- Kimi K3(月之暗面):输入 ¥20.00 / 输出 ¥100.00 每百万 Token
- GLM-5.2(智谱 AI):输入 ¥8.00 / 输出 ¥28.00 每百万 Token
2)为什么各家 Token 价格差异这么大?
模型能力是定价因素之一,高难度推理和 Agent 工作负载通常需要更多计算。按当前公开单价,Claude Fable 5.1 的输出 token 单价是 Gemini 3.5 Flash-Lite 的 20 倍。
算力基础设施同样重要。谷歌拥有自研 TPU 和大规模数据中心,降低了边际 Token 成本;OpenAI 和 Anthropic 更多依赖第三方 GPU 集群,影响了定价下限。
市场定位是主动选择。Anthropic 主攻注重安全性、准确性和长上下文的企业客户;OpenAI 覆盖从消费者到企业的全市场;DeepSeek 等国内供应商以低价竞争,积极建立国内开发者生态。
架构差异(如 MoE 稀疏激活 vs 密集 Transformer)也影响成本。MoE 模型每个 Token 只激活部分参数,降低了算力消耗,DeepSeek 采用 MoE 架构是其低价的原因之一。
3)注意:输出 Token 比输入贵得多
对比表中每款模型,输出 Token 的单价都是输入的 3–6 倍。这在实际中影响很大:生成 2,000 个输出 Token 的任务,成本远高于读取 2,000 个输入 Token。
摘要、分类、信息抽取等任务以输入为主,成本较低;长文生成、代码合成、多步推理等任务以输出为主,成本较高。估算费用时,务必对预期输出长度建模,而不仅仅是 Prompt 长度。
思考/推理模式(如 Claude 的 extended thinking 或 OpenAI 的 o 系列)会通过内部思维链生成大量输出 Token,这类模式效果强大但会成倍放大输出成本——只在精度提升值得付出的场景下开启。
4)应该选哪个模型?
没有万能答案——最佳模型取决于你的任务、质量要求、调用量和预算。如需更全面的 AI 模型基础知识,AI 新手指南 是一个很好的起点。以下是按使用场景的实用分析。
高难度长任务 Agent 和大型代码库工作可以测试 Claude Fable 5.1 或 GPT-5.6 Sol。法律、医疗等高风险输出仍需由合格人员复核,模型价格更高不代表结果自动可靠。
通用应用后端——客服、文档处理、RAG 管道——GPT-5.6 Terra、Gemini 3.6 Flash 或 GPT-5.6 Luna 具有较好的能力成本比,能以低于旗舰模型的成本处理大多数真实任务。
高并发、低延迟场景——内容审核、分类、轻量摘要——Gemini 3.5 Flash-Lite($0.30/$2.50)是 Google 当前稳定的低成本选择。中文负载可选择 DeepSeek V4 Flash:高峰缓存未命中输入/输出为 ¥3.0 / ¥9.0,空闲价减半,缓存命中输入为空闲 ¥0.05 / 高峰 ¥0.10。
需要国内基础设施的中文应用——人民币计费、中国低延迟、本地合规——DeepSeek、Kimi K3 和 GLM-5.2 是实用选择。DeepSeek 价格最优;Kimi K3 在推理和长上下文上表现突出。无论选择哪个供应商,你都需要 一个 API Key 才能开始调用。
5)降低 API 成本的实用方法
批量推理可降低 50% 成本。如果任务不要求实时响应——离线文档处理、夜间数据增强、大批量分类——请务必使用 Batch API。代价是延迟(结果在数小时内返回,而非秒级)。使用 OpenRouter 等聚合平台还可以简化跨供应商的计费。
Prompt 缓存可降低重复输入成本。如果 Prompt 包含较长的系统提示或大型上下文文档,Anthropic、OpenAI 等供应商会缓存前缀,缓存命中时仅收取极低费用——对 RAG 和 Agent 系统尤为有效。
模型路由可在规模上节省成本。简单子任务使用廉价模型(Gemini Flash-Lite、GPT-5.6 Luna),复杂任务才调用高价模型。许多生产系统将 80% 请求路由至廉价模型,平均成本可降低 60–70%。
精简 Prompt。冗长的系统提示、多余示例和重复上下文都会增加输入 Token。平均 Prompt 长度缩减 30%,输入成本就降低 30%。使用结构化输出(JSON 模式)还能减少输出冗余。
对 DeepSeek 而言,把批处理和评测流量排到空闲时段(北京时间 9:00–12:00、14:00–18:00 之外)可按高峰价一半计费;保持可复用前缀稳定,缓存命中输入可维持在 ¥0.05–¥0.30 / 百万 tokens。
- 非实时任务使用 Batch API(多数供应商打五折)
- 为长且重复的系统提示开启 Prompt 缓存
- 简单任务路由至廉价模型,复杂任务才调用高价模型
- 精简系统提示,避免重复传入已在上下文窗口中的内容
- 使用 JSON 输出模式,减少响应中的自然语言包装冗余
- DeepSeek 批处理尽量排到空闲时段(北京时间 9:00–12:00、14:00–18:00 之外),可按高峰价一半计费
6)国内与国际定价横向对比
美元与人民币模型的直接价格比较需要使用当前汇率。2026 年 8 月调价后,DeepSeek V4 Flash 高峰缓存未命中输入/输出为 ¥3.0/¥9.0,V4 Pro 为 ¥9.0/¥27.0;空闲价为高峰价一半。与国际提供商比较时,还应加入支付、网络和部署成本。
然而,国际模型通常无法从中国大陆直接访问。对于在国内运营的团队,实际比较对象是国内选项之间:DeepSeek(价格最低)、GLM-5.2(中端)和 Kimi K3(高端推理)。这些供应商均提供人民币计费、中文支持和国内数据合规保障。
对于面向全球用户的团队,国际模型是默认选择。核心问题是使用单一高价模型,还是按查询复杂度混合使用不同价格档位。
常见问题
这些价格是输入还是输出 Token 的价格?
两者都有。输入和输出 Token 分开计价,输出通常比输入贵 3–6 倍。第一节的价格表分别列出了每款模型的两种价格。
使用更便宜的模型一定省钱吗?
不一定。廉价模型可能输出质量较低,需要重试、人工修正或更长的 Prompt 来补偿。应计算包含错误率、所需 Prompt 长度和下游修正成本的总成本,而不仅仅是 Token 单价。
AI API 价格多久变动一次?
频繁变动。随着基础设施成本下降,大多数供应商在 2025–2026 年多次降价。制定预算前务必查看供应商官网的最新定价页面。
大批量任务最便宜的模型是哪个?
在 Google 模型中,Gemini 3.5 Flash-Lite($0.30/$2.50 每百万 Token)是本文重点模型里成本最低的稳定版本。国内中文任务中,DeepSeek V4 Flash 高峰缓存未命中输入/输出为 ¥3.0/¥9.0,空闲价减半,缓存命中输入为 ¥0.05/¥0.10。制定预算前请核验官方价格页。
上下文窗口大小和推理模式会影响价格吗?
是的。更长的上下文意味着每次请求更多的输入 Token。推理/思考模式会为思维链生成大量隐藏的输出 Token,按标准输出价格计费。两者相比短提示、无推理的场景都会显著提高单次请求成本。
参考来源
- Anthropic Fable 5.1 and API PricingAnthropic · 核验日期 2026-09-03
- OpenAI API PricingOpenAI · 核验日期 2026-07-25
- Google Gemini API PricingGoogle AI · 核验日期 2026-08-10
- DeepSeek API PricingDeepSeek · 核验日期 2026-08-21
- Moonshot (Kimi) PricingMoonshot · 核验日期 2026-07-25
- ZhipuAI GLM PricingZhipuAI · 核验日期 2026-07-25