OpenAI API 定价详解(2026 指南)
全面理解当前 OpenAI API 定价:GPT-6 Astra、GPT-5.6 Sol、Terra 与 Luna,Standard、Batch、Flex、Fast 处理模式、图片模型、工具费用及成本估算。
OpenAI 前沿模型
Astra 领航前沿模型
最复杂的端到端任务选择 Astra,较低价格的旗舰能力选择 Sol,平衡场景选择 Terra,高并发低成本场景选择 Luna。
美元 / 百万 tokens · Standard · 短上下文
GPT-6 Astra
面向高难度端到端任务与智能体工作流的最强模型。
- 模型 ID
gpt-6-astra- 推理强度
- lowmediumhighxhighmax
- 输入
- $10.00
- 缓存输入
- $1.00
- 缓存写入
- $12.50
- 输出
- $50.00
- 最大输出
- 128K tokens
- 上下文窗口
- 1.05M
- 知识截止日期
- Apr 30, 2026
- 工具能力
- 函数调用、网页搜索、文件搜索、计算机操作
GPT-5.6 Sol
面向复杂专业任务的前沿推理与编程模型。
- 模型 ID
gpt-5.6-sol- 别名
gpt-5.6- 推理强度
- nonelowmediumhighxhighmax
- 输入
- $4.00
- 缓存输入
- $0.40
- 缓存写入
- $5.00
- 输出
- $20.00
- 最大输出
- 128K tokens
- 上下文窗口
- 1.05M
- 知识截止日期
- Feb 16, 2026
- 工具能力
- 函数调用、网页搜索、文件搜索、计算机操作
GPT-5.6 Terra
在智能水平与成本之间取得平衡,适合日常生产负载。
- 模型 ID
gpt-5.6-terra- 推理强度
- nonelowmediumhighxhighmax
- 输入
- $2.00
- 缓存输入
- $0.20
- 缓存写入
- $2.50
- 输出
- $12.00
- 最大输出
- 128K tokens
- 上下文窗口
- 1.05M
- 知识截止日期
- Feb 16, 2026
- 工具能力
- 函数调用、网页搜索、文件搜索、计算机操作
GPT-5.6 Luna
适合成本敏感、高调用量场景,并保留前沿系列的控制能力。
- 模型 ID
gpt-5.6-luna- 推理强度
- nonelowmediumhighxhighmax
- 输入
- $0.20
- 缓存输入
- $0.02
- 缓存写入
- $0.25
- 输出
- $1.20
- 最大输出
- 128K tokens
- 上下文窗口
- 1.05M
- 知识截止日期
- Feb 16, 2026
- 工具能力
- 函数调用、网页搜索、文件搜索、计算机操作
OpenAI 前沿模型:GPT-6 Astra 与 GPT-5.6
GPT-6 Astra 现已成为 OpenAI 前沿阵容中面向最复杂端到端任务与智能体工作的旗舰模型。GPT-5.6 家族仍提供三个能力与成本档位:Sol 面向旗舰专业任务,Terra 平衡能力与成本,Luna 针对高调用量低成本负载。
按 Standard 短上下文价格,Astra 每百万 token 输入 $10.00、输出 $50.00;Sol 输入 $4.00、输出 $20.00;Terra 输入 $2.00、输出 $12.00;Luna 输入 $0.20、输出 $1.20。
Astra 的推理强度从 low 到 max,GPT-5.6 模型还支持 none。上方可视化为 2026 年 9 月 9 日核验的价格快照,并非实时账单数据。长上下文计价与迁移细节参见GPT-6 Astra API 指南。
- Astra:输入 $10.00 · 缓存输入 $1.00 · 缓存写入 $12.50 · 输出 $50.00
- Sol:输入 $4.00 · 缓存输入 $0.40 · 缓存写入 $5.00 · 输出 $20.00
- Terra:输入 $2.00 · 缓存输入 $0.20 · 缓存写入 $2.50 · 输出 $12.00
- Luna:输入 $0.20 · 缓存输入 $0.02 · 缓存写入 $0.25 · 输出 $1.20
- 四个模型均支持:128K 最大输出 · 1.05M 上下文窗口
- 工具能力:函数调用 · 网页搜索 · 文件搜索 · 计算机操作
OpenAI API 定价机制
OpenAI 按 token 计费,不是按请求次数。一个 token 大约相当于 4 个英文字符,或 3/4 个单词。一篇 1,000 词的英文文章大约是 1,300 个 token。完整的 OpenAI 指南 提供了定价在整体 API 工作流中如何定位的更广泛背景。
每次 API 调用有两个 token 计数:输入 token(你发送的提示词)和输出 token(模型的回复)。它们按不同价格计费——输出 token 通常比输入 token 贵 3-4 倍。
中文每个字符消耗的 token 比英文多,因为分词器是为拉丁语系优化的。一个中文字符通常消耗 1-2 个 token,在估算中文应用成本时需要考虑这一点。
GPT-4o 和 GPT-4o-mini 定价
GPT-4o 是 OpenAI 的旗舰多模态模型,支持文本、图像和音频输入。GPT-4o-mini 是成本优化版本,推荐用于大多数通用任务。
- GPT-4o:$2.50 / 百万输入 token,$10.00 / 百万输出 token
- GPT-4o:$1.25 / 百万缓存输入 token(50% 折扣)
- GPT-4o-mini:$0.15 / 百万输入 token,$0.60 / 百万输出 token
- GPT-4o-mini:$0.075 / 百万缓存输入 token(50% 折扣)
o 系列推理模型定价
o 系列模型(o1、o3、o4-mini)专为数学、编程和科学分析等复杂推理任务设计。它们使用内部「思考」token,按输出 token 价格计费,因此每次调用的成本明显高于 GPT-4o 系列模型。
由于推理模型在生成最终答案之前会产生大量内部思维链,实际输出 token 数量可能远超可见回复的长度。务必用真实工作负载测试以了解实际成本。
- o3:$2.00 / 百万输入 token,$8.00 / 百万输出 token
- o3-mini:$1.10 / 百万输入 token,$4.40 / 百万输出 token
- o4-mini:$1.10 / 百万输入 token,$4.40 / 百万输出 token
- o 系列缓存输入:75% 折扣(如 o3-mini 为 $0.275 / 百万)
缓存输入 token 折扣
OpenAI 为重复前缀提供提示缓存。如果你的 API 请求共享相同的前缀提示(如系统指令、few-shot 示例),缓存部分按 GPT-4o 模型 50% 折扣、o 系列模型 75% 折扣计费。
缓存是自动的——无需任何配置。缓存在 5-10 分钟不活动后通常失效,最小可缓存前缀为 1,024 token。对于有长系统提示的应用,缓存可以显著降低成本。
Batch API(50% 折扣)
如果你的场景不需要实时响应,Batch API 在所有模型上提供 50% 折扣。你提交一批请求(每个文件最多 50,000 条),OpenAI 在 24 小时内处理完成(通常更快)。
Batch API 非常适合批量处理任务,如内容分类、文档摘要、数据富化和评估运行。请求格式与标准 API 完全相同——只需将请求包装在 JSONL 文件中,通过 batch 端点提交即可。如果批量请求遇到 429 错误,排查限流错误 可以帮你判断是并发问题还是额度问题。
Standard、Batch、Flex 与 Fast 模式
处理层级会同时改变价格和交付特性。Standard 是普通同步请求的基础价格;Batch 与 Flex 为能够接受延迟或弹性处理的负载提供折扣;Fast 模式则以更高价格换取优先处理。
对于 GPT-5.6 Sol、Terra 与 Luna,Batch 和 Flex 的短上下文价格均为 Standard 的 50%,Fast 模式则为 Standard 的 2 倍。应根据延迟需求选择层级,而不是把折扣层级当作限时促销。
- Sol 输入/输出:Standard $5/$30 · Batch 或 Flex $2.50/$15 · Fast $10/$60
- Terra 输入/输出:Standard $2/$12 · Batch 或 Flex $1/$6 · Fast $4/$24
- Luna 输入/输出:Standard $0.20/$1.20 · Batch 或 Flex $0.10/$0.60 · Fast $0.40/$2.40
- 当请求超过官方规定的上下文阈值时,应按更高的长上下文价格单独计算。
多模态模型与工具费用
并非所有 OpenAI 服务都按文本 token 计费。Realtime 音频分别计算音频、文本和图像 token;转录通常按分钟估算;图像生成使用图像与文本 token 价格;Sora 视频生成则按分辨率和秒数计费。
内置工具可能在模型 token 费用之外产生额外费用。Web Search 按调用次数及适用的搜索内容 token 计费,File Search 同时包含存储费与工具调用费,托管容器则按内存规格和会话时长计费。生产预算需要同时考虑模型与工具使用。
- Web Search:每 1,000 次调用 $10,适用时另计搜索内容 token
- File Search:免费额度后存储费 $0.10/GB/天,工具调用费每 1,000 次 $2.50
- Sora 2:Standard 720p 每秒 $0.10 起,Batch 每秒 $0.05 起
- 转录按模型与是否实时处理不同,估算价格约为每分钟 $0.003 至 $0.017
如何估算成本
要估算月度 API 成本,将每次请求的预期输入 token 数乘以输入价格,加上预期输出 token 数乘以输出价格,再乘以每月请求次数。
例如,使用 GPT-4o-mini,平均每次调用 500 输入 token 和 200 输出 token,每月 10,000 次调用:(500 × $0.15 + 200 × $0.60) / 1,000,000 × 10,000 = $1.95/月。这使得 GPT-4o-mini 对大多数应用来说非常实惠。
对于推理模型,估算时要格外小心。o3 上一个复杂的编程问题可能生成 5,000+ 隐藏推理 token,使单次调用成本达到 $0.20+,而不是你仅从可见输出预期的 $0.01。
# Cost estimation example for GPT-4o-mini
input_tokens_per_call = 500
output_tokens_per_call = 200
calls_per_month = 10_000
input_price = 0.15 # per 1M tokens
output_price = 0.60 # per 1M tokens
monthly_cost = (
input_tokens_per_call * input_price
+ output_tokens_per_call * output_price
) / 1_000_000 * calls_per_month
print(f"Estimated monthly cost: ${monthly_cost:.2f}")
# Output: Estimated monthly cost: $1.95估算 OpenAI API 月度成本的 Python 脚本
账单控制与价格核验
赠送额度、付款要求与账户资格可能不同,应在 Platform 账单页面查看自己账户对应的条款,不要假设存在固定的公开试用金额。如果你还没有创建 OpenAI API Key,我们的逐步指南涵盖注册与账单设置。
建议设置项目预算和提醒、限制生产 Key 权限,并按模型和服务层级监控用量。部署前请阅读安全配置密钥。本页价格是带日期的编辑快照,最终费用以官方定价和账单页面为准。
常见问题
哪个 OpenAI 模型最便宜?
在 2026 年 8 月 10 日核验的 Standard 价格快照中,GPT-5-nano 的文本 token 标价最低,为输入 $0.05/百万、输出 $0.40/百万。在 GPT-5.6 前沿家族中,Luna 成本最低,为输入 $0.20/百万、输出 $1.20/百万。选择时仍需同时考虑模型可用性和任务适配度。
推理模型(o 系列)为什么这么贵?
推理模型在生成可见答案之前会产生内部思维链 token。这些隐藏 token 按输出 token 价格计费,长度可能是最终回复的 5-20 倍。这是更深推理的代价——o 系列模型专为准确度比成本更重要的任务设计。
如何降低 OpenAI API 成本?
可以使用以下策略:(1) 不需要 GPT-4o 级别智能的任务切换到 GPT-4o-mini。(2) 保持系统提示一致以启用提示缓存。(3) 非实时任务使用 Batch API 获得 50% 折扣。(4) 设置 max_tokens 限制防止回复失控。(5) 对相同查询在应用侧缓存 API 响应。
OpenAI API 全球定价一样吗?
不一定。部分较新模型在符合条件的区域处理端点上可能有 10% 的数据驻留加价;通过 Amazon Bedrock 使用的模型由 AWS 计费,也可能不同于 OpenAI 直连价格。此外还可能产生汇率转换或银行费用。
OpenAI 会为失败的 API 请求收费吗?
服务器错误(5xx)导致的失败请求不收费。但客户端错误(4xx,如参数无效)导致的失败,如果模型已处理了输入 token,则会收费。限流请求(429)不收费。
本系列相关
相关供应商
参考来源
- OpenAI API PricingOpenAI · 核验日期 2026-08-10
- OpenAI TokenizerOpenAI · 核验日期 2026-08-10
- OpenAI Batch API DocumentationOpenAI · 核验日期 2026-08-10