跳到主内容
选型对比11 分钟阅读发布于:2026-06-14更新于:2026-09-09

OpenAI API 定价详解(2026 指南)

全面理解当前 OpenAI API 定价:GPT-6 Astra、GPT-5.6 Sol、Terra 与 Luna,Standard、Batch、Flex、Fast 处理模式、图片模型、工具费用及成本估算。

作者 Heizi· 创始人 & 编辑· 发布于: 2026-06-14· 更新于: 2026-09-09

OpenAI 前沿模型

Astra 领航前沿模型

最复杂的端到端任务选择 Astra,较低价格的旗舰能力选择 Sol,平衡场景选择 Terra,高并发低成本场景选择 Luna。

美元 / 百万 tokens · Standard · 短上下文

GPT-6 Astra

面向高难度端到端任务与智能体工作流的最强模型。

模型 ID
gpt-6-astra
推理强度
lowmediumhighxhighmax
输入
$10.00
缓存输入
$1.00
缓存写入
$12.50
输出
$50.00
最大输出
128K tokens
上下文窗口
1.05M
知识截止日期
Apr 30, 2026
工具能力
函数调用、网页搜索、文件搜索、计算机操作

GPT-5.6 Sol

面向复杂专业任务的前沿推理与编程模型。

模型 ID
gpt-5.6-sol
别名
gpt-5.6
推理强度
nonelowmediumhighxhighmax
输入
$4.00
缓存输入
$0.40
缓存写入
$5.00
输出
$20.00
最大输出
128K tokens
上下文窗口
1.05M
知识截止日期
Feb 16, 2026
工具能力
函数调用、网页搜索、文件搜索、计算机操作

GPT-5.6 Terra

在智能水平与成本之间取得平衡,适合日常生产负载。

模型 ID
gpt-5.6-terra
推理强度
nonelowmediumhighxhighmax
输入
$2.00
缓存输入
$0.20
缓存写入
$2.50
输出
$12.00
最大输出
128K tokens
上下文窗口
1.05M
知识截止日期
Feb 16, 2026
工具能力
函数调用、网页搜索、文件搜索、计算机操作

GPT-5.6 Luna

适合成本敏感、高调用量场景,并保留前沿系列的控制能力。

模型 ID
gpt-5.6-luna
推理强度
nonelowmediumhighxhighmax
输入
$0.20
缓存输入
$0.02
缓存写入
$0.25
输出
$1.20
最大输出
128K tokens
上下文窗口
1.05M
知识截止日期
Feb 16, 2026
工具能力
函数调用、网页搜索、文件搜索、计算机操作
价格快照核验于 2026 年 9 月 9 日,最终费用请以 OpenAI 为准。

OpenAI 前沿模型:GPT-6 Astra 与 GPT-5.6

GPT-6 Astra 现已成为 OpenAI 前沿阵容中面向最复杂端到端任务与智能体工作的旗舰模型。GPT-5.6 家族仍提供三个能力与成本档位:Sol 面向旗舰专业任务,Terra 平衡能力与成本,Luna 针对高调用量低成本负载。

按 Standard 短上下文价格,Astra 每百万 token 输入 $10.00、输出 $50.00;Sol 输入 $4.00、输出 $20.00;Terra 输入 $2.00、输出 $12.00;Luna 输入 $0.20、输出 $1.20。

Astra 的推理强度从 low 到 max,GPT-5.6 模型还支持 none。上方可视化为 2026 年 9 月 9 日核验的价格快照,并非实时账单数据。长上下文计价与迁移细节参见GPT-6 Astra API 指南

  • Astra:输入 $10.00 · 缓存输入 $1.00 · 缓存写入 $12.50 · 输出 $50.00
  • Sol:输入 $4.00 · 缓存输入 $0.40 · 缓存写入 $5.00 · 输出 $20.00
  • Terra:输入 $2.00 · 缓存输入 $0.20 · 缓存写入 $2.50 · 输出 $12.00
  • Luna:输入 $0.20 · 缓存输入 $0.02 · 缓存写入 $0.25 · 输出 $1.20
  • 四个模型均支持:128K 最大输出 · 1.05M 上下文窗口
  • 工具能力:函数调用 · 网页搜索 · 文件搜索 · 计算机操作

OpenAI API 定价机制

OpenAI 按 token 计费,不是按请求次数。一个 token 大约相当于 4 个英文字符,或 3/4 个单词。一篇 1,000 词的英文文章大约是 1,300 个 token。完整的 OpenAI 指南 提供了定价在整体 API 工作流中如何定位的更广泛背景。

每次 API 调用有两个 token 计数:输入 token(你发送的提示词)和输出 token(模型的回复)。它们按不同价格计费——输出 token 通常比输入 token 贵 3-4 倍。

中文每个字符消耗的 token 比英文多,因为分词器是为拉丁语系优化的。一个中文字符通常消耗 1-2 个 token,在估算中文应用成本时需要考虑这一点。

GPT-4o 和 GPT-4o-mini 定价

GPT-4o 是 OpenAI 的旗舰多模态模型,支持文本、图像和音频输入。GPT-4o-mini 是成本优化版本,推荐用于大多数通用任务。

  • GPT-4o:$2.50 / 百万输入 token,$10.00 / 百万输出 token
  • GPT-4o:$1.25 / 百万缓存输入 token(50% 折扣)
  • GPT-4o-mini:$0.15 / 百万输入 token,$0.60 / 百万输出 token
  • GPT-4o-mini:$0.075 / 百万缓存输入 token(50% 折扣)

o 系列推理模型定价

o 系列模型(o1、o3、o4-mini)专为数学、编程和科学分析等复杂推理任务设计。它们使用内部「思考」token,按输出 token 价格计费,因此每次调用的成本明显高于 GPT-4o 系列模型。

由于推理模型在生成最终答案之前会产生大量内部思维链,实际输出 token 数量可能远超可见回复的长度。务必用真实工作负载测试以了解实际成本。

  • o3:$2.00 / 百万输入 token,$8.00 / 百万输出 token
  • o3-mini:$1.10 / 百万输入 token,$4.40 / 百万输出 token
  • o4-mini:$1.10 / 百万输入 token,$4.40 / 百万输出 token
  • o 系列缓存输入:75% 折扣(如 o3-mini 为 $0.275 / 百万)

缓存输入 token 折扣

OpenAI 为重复前缀提供提示缓存。如果你的 API 请求共享相同的前缀提示(如系统指令、few-shot 示例),缓存部分按 GPT-4o 模型 50% 折扣、o 系列模型 75% 折扣计费。

缓存是自动的——无需任何配置。缓存在 5-10 分钟不活动后通常失效,最小可缓存前缀为 1,024 token。对于有长系统提示的应用,缓存可以显著降低成本。

Batch API(50% 折扣)

如果你的场景不需要实时响应,Batch API 在所有模型上提供 50% 折扣。你提交一批请求(每个文件最多 50,000 条),OpenAI 在 24 小时内处理完成(通常更快)。

Batch API 非常适合批量处理任务,如内容分类、文档摘要、数据富化和评估运行。请求格式与标准 API 完全相同——只需将请求包装在 JSONL 文件中,通过 batch 端点提交即可。如果批量请求遇到 429 错误,排查限流错误 可以帮你判断是并发问题还是额度问题。

Standard、Batch、Flex 与 Fast 模式

处理层级会同时改变价格和交付特性。Standard 是普通同步请求的基础价格;Batch 与 Flex 为能够接受延迟或弹性处理的负载提供折扣;Fast 模式则以更高价格换取优先处理。

对于 GPT-5.6 Sol、Terra 与 Luna,Batch 和 Flex 的短上下文价格均为 Standard 的 50%,Fast 模式则为 Standard 的 2 倍。应根据延迟需求选择层级,而不是把折扣层级当作限时促销。

  • Sol 输入/输出:Standard $5/$30 · Batch 或 Flex $2.50/$15 · Fast $10/$60
  • Terra 输入/输出:Standard $2/$12 · Batch 或 Flex $1/$6 · Fast $4/$24
  • Luna 输入/输出:Standard $0.20/$1.20 · Batch 或 Flex $0.10/$0.60 · Fast $0.40/$2.40
  • 当请求超过官方规定的上下文阈值时,应按更高的长上下文价格单独计算。

多模态模型与工具费用

并非所有 OpenAI 服务都按文本 token 计费。Realtime 音频分别计算音频、文本和图像 token;转录通常按分钟估算;图像生成使用图像与文本 token 价格;Sora 视频生成则按分辨率和秒数计费。

内置工具可能在模型 token 费用之外产生额外费用。Web Search 按调用次数及适用的搜索内容 token 计费,File Search 同时包含存储费与工具调用费,托管容器则按内存规格和会话时长计费。生产预算需要同时考虑模型与工具使用。

  • Web Search:每 1,000 次调用 $10,适用时另计搜索内容 token
  • File Search:免费额度后存储费 $0.10/GB/天,工具调用费每 1,000 次 $2.50
  • Sora 2:Standard 720p 每秒 $0.10 起,Batch 每秒 $0.05 起
  • 转录按模型与是否实时处理不同,估算价格约为每分钟 $0.003 至 $0.017

如何估算成本

要估算月度 API 成本,将每次请求的预期输入 token 数乘以输入价格,加上预期输出 token 数乘以输出价格,再乘以每月请求次数。

例如,使用 GPT-4o-mini,平均每次调用 500 输入 token 和 200 输出 token,每月 10,000 次调用:(500 × $0.15 + 200 × $0.60) / 1,000,000 × 10,000 = $1.95/月。这使得 GPT-4o-mini 对大多数应用来说非常实惠。

对于推理模型,估算时要格外小心。o3 上一个复杂的编程问题可能生成 5,000+ 隐藏推理 token,使单次调用成本达到 $0.20+,而不是你仅从可见输出预期的 $0.01。

python
# Cost estimation example for GPT-4o-mini
input_tokens_per_call = 500
output_tokens_per_call = 200
calls_per_month = 10_000

input_price = 0.15  # per 1M tokens
output_price = 0.60  # per 1M tokens

monthly_cost = (
    input_tokens_per_call * input_price
    + output_tokens_per_call * output_price
) / 1_000_000 * calls_per_month

print(f"Estimated monthly cost: ${monthly_cost:.2f}")
# Output: Estimated monthly cost: $1.95

估算 OpenAI API 月度成本的 Python 脚本

账单控制与价格核验

赠送额度、付款要求与账户资格可能不同,应在 Platform 账单页面查看自己账户对应的条款,不要假设存在固定的公开试用金额。如果你还没有创建 OpenAI API Key,我们的逐步指南涵盖注册与账单设置。

建议设置项目预算和提醒、限制生产 Key 权限,并按模型和服务层级监控用量。部署前请阅读安全配置密钥。本页价格是带日期的编辑快照,最终费用以官方定价和账单页面为准。

常见问题

哪个 OpenAI 模型最便宜?

在 2026 年 8 月 10 日核验的 Standard 价格快照中,GPT-5-nano 的文本 token 标价最低,为输入 $0.05/百万、输出 $0.40/百万。在 GPT-5.6 前沿家族中,Luna 成本最低,为输入 $0.20/百万、输出 $1.20/百万。选择时仍需同时考虑模型可用性和任务适配度。

推理模型(o 系列)为什么这么贵?

推理模型在生成可见答案之前会产生内部思维链 token。这些隐藏 token 按输出 token 价格计费,长度可能是最终回复的 5-20 倍。这是更深推理的代价——o 系列模型专为准确度比成本更重要的任务设计。

如何降低 OpenAI API 成本?

可以使用以下策略:(1) 不需要 GPT-4o 级别智能的任务切换到 GPT-4o-mini。(2) 保持系统提示一致以启用提示缓存。(3) 非实时任务使用 Batch API 获得 50% 折扣。(4) 设置 max_tokens 限制防止回复失控。(5) 对相同查询在应用侧缓存 API 响应。

OpenAI API 全球定价一样吗?

不一定。部分较新模型在符合条件的区域处理端点上可能有 10% 的数据驻留加价;通过 Amazon Bedrock 使用的模型由 AWS 计费,也可能不同于 OpenAI 直连价格。此外还可能产生汇率转换或银行费用。

OpenAI 会为失败的 API 请求收费吗?

服务器错误(5xx)导致的失败请求不收费。但客户端错误(4xx,如参数无效)导致的失败,如果模型已处理了输入 token,则会收费。限流请求(429)不收费。

相关供应商

参考来源