跳到主内容
选型对比9 分钟阅读发布于:2026-08-10更新于:2026-09-13

DeepSeek V4 Flash 与 V4 Pro:2026 年 8 月价格存档

DeepSeek V4 Flash 与 V4 Pro 的 2026 年 8 月价格存档。两条路由正被 V4.1 Flash 取代,新的 API 决策请查看 V4.1 指南。

作者 Heizi· 创始人 & 编辑· 发布于: 2026-08-10· 更新于: 2026-09-13

DeepSeek V4 模型

V4 智能的两种深度

高吞吐与 API 灵活性选择 Flash,更高阶的 V4 生产负载选择 Pro。空闲时段价格为高峰时段的一半。

人民币 / 百万 tokens

DeepSeek V4 Flash

面向高吞吐场景,并提供更完整 API 格式支持的 V4 模型。

模型 ID
deepseek-v4-flash
模型版本
DeepSeek-V4-Flash-0731
思考模式
非思考 + 思考(默认)
缓存命中输入
空闲¥0.05
高峰¥0.10
缓存未命中输入
空闲¥1.5
高峰¥3.0
输出
空闲¥4.5
高峰¥9.0
上下文
1M
最大输出
384K
并发限制
2500
Responses API
支持
API 格式
兼容 OpenAI + Anthropic
功能
JSON Output、Tool Calls、Anthropic API、前缀续写、FIM(仅非思考)

DeepSeek V4 Pro

面向高要求推理与生产负载的 V4 高阶模型。

模型 ID
deepseek-v4-pro
模型版本
DeepSeek-V4-Pro-0813
思考模式
非思考 + 思考(默认)
缓存命中输入
空闲¥0.15
高峰¥0.30
缓存未命中输入
空闲¥4.5
高峰¥9.0
输出
空闲¥13.5
高峰¥27.0
上下文
1M
最大输出
384K
并发限制
500
Responses API
支持
API 格式
兼容 OpenAI + Anthropic
功能
JSON Output、Tool Calls、Anthropic API、前缀续写、FIM(仅非思考)
高峰时段为北京时间 9:00–12:00、14:00–18:00,其余为空闲时段,空闲价为高峰价的一半。
DeepSeek 官方价格快照核验于 2026 年 8 月 21 日,价格可能变化。

存档说明:这些路由正被 V4.1 Flash 取代

本页保留 2026 年 8 月 21 日的 V4 Flash 与 V4 Pro 价格快照,不再作为当前选型指南。DeepSeek 已于 9 月 10 日发布 V4.1 Flash,官方模型 ID 为 deepseek-flash;旧 Flash 名称现已路由到新模型。

DeepSeek 表示,deepseek-v4-pro 将从 9 月 14 日 04:00 UTC 起路由到 V4.1 Flash,并按 Flash 价格计费,直到 V4.1 Pro 发布。当前价格、跑分和迁移步骤请查看DeepSeek V4.1 Flash API 指南。

DeepSeek V4 Flash 与 V4 Pro 概览

DeepSeek 当前提供两个 V4 API 模型 ID:deepseek-v4-flash 和 deepseek-v4-pro。Flash 对应 DeepSeek-V4-Flash-0731,Pro 对应 DeepSeek-V4-Pro-0813。两者均支持非思考模式和思考模式,并默认启用思考。

两个模型都提供 1M 上下文窗口和最大 384K 输出。OpenAI 兼容格式的 BASE URL 为 https://api.deepseek.com,Anthropic 兼容格式为 https://api.deepseek.com/anthropic。上方对比采用 2026 年 8 月 21 日核验的官方价格页数据。

2026 年 8 月调价后的 V4 Token 价格

DeepSeek 根据输入与输出 token 总量计费。输入价格分为缓存命中与缓存未命中两档,每档再按高峰时段和空闲时段计价。空闲时段价格为高峰时段价格的一半。

当赠送余额和充值余额同时存在时,优先扣减赠送余额。DeepSeek 声明产品价格可能变化,并建议用户依据实际用量按需充值。

  • V4 Flash:缓存命中输入 空闲 ¥0.05 / 高峰 ¥0.10 · 缓存未命中输入 空闲 ¥1.5 / 高峰 ¥3.0 · 输出 空闲 ¥4.5 / 高峰 ¥9.0 / 百万 tokens
  • V4 Pro:缓存命中输入 空闲 ¥0.15 / 高峰 ¥0.30 · 缓存未命中输入 空闲 ¥4.5 / 高峰 ¥9.0 · 输出 空闲 ¥13.5 / 高峰 ¥27.0 / 百万 tokens
  • 高峰时段为北京时间 9:00–12:00、14:00–18:00,其余为空闲时段
  • 扣费公式:token 消耗量 × 对应模型单价

高峰时段与空闲时段

2026 年 8 月调价后,DeepSeek 不再公布全天统一单价。高峰时段为北京时间 9:00–12:00、14:00–18:00;这两个窗口之外的时间(含夜间及高峰窗外的周末时段)按空闲价计费。

批处理、评测和非交互回填任务应尽量排到空闲时段。高峰时段的交互式生产流量要按更高费率做预算,尤其是缓存未命中输入和思考模式下的长输出。

功能与 API 兼容性

两个 V4 模型都支持 JSON Output、Tool Calls、Responses API、Anthropic API 格式、Beta 对话前缀续写,以及仅限非思考模式的 Beta FIM 补全;也都能通过 OpenAI 兼容和 Anthropic 兼容的 SDK 配置调用。

FIM 补全仍仅限非思考模式。如果需要中间补全,请对该请求关闭思考,不要默认走思考路径。

1M 上下文与 384K 输出

1M 上下文窗口允许两个模型在单次请求中接收大型文档、代码库或长对话历史。384K 最大输出非常可观,适合超长生成,但不应作为默认目标。

长上下文和大输出会迅速增加延迟与成本,高峰时段缓存未命中时尤其明显。建议明确设置输出上限、保持可复用前缀稳定以提高缓存命中率,并在扩容前测量真实 token 用量。

并发限制与 user_id 隔离

官方表格列出的并发限制为 V4 Flash 2500、V4 Pro 500。DeepSeek 限速文档说明,提升过并发配额的 API 用户还可能同时受到账号总并发和每个 user_id 的限制。

超过单个 user_id 限制的请求会收到 HTTP 429。建议通过合理的 user_id 隔离负载,并在遇到 429 时使用退避策略,不要立即密集重试。

选择 Flash 还是 Pro

重视成本、并发或高调用量处理时,建议先用 V4 Flash。它的缓存未命中输入和输出价格更低,官方并发限制是 Pro 的 5 倍。两个模型现在都支持 Responses API。

当更高阶推理质量足以覆盖 3 倍缓存未命中输入价格和 3 倍输出价格时,再评估 V4 Pro。应使用真实提示词测试两个模型,并把思考 token 输出纳入成本比较。

常见问题

哪个 DeepSeek V4 模型更便宜?

V4 Flash 更便宜。高峰时段缓存未命中输入/输出为 ¥3.0 / ¥9.0 / 百万 tokens,V4 Pro 为 ¥9.0 / ¥27.0。空闲价为高峰价的一半。缓存命中输入 Flash 为空闲 ¥0.05 / 高峰 ¥0.10,Pro 为空闲 ¥0.15 / 高峰 ¥0.30。

V4 Pro 支持 Responses API 吗?

支持。截至 2026 年 8 月 21 日核验的官方价格快照,deepseek-v4-flash 和 deepseek-v4-pro 均标记为支持 Responses API。

DeepSeek 的高峰时段是什么时候?

高峰时段为北京时间 9:00–12:00、14:00–18:00。空闲时段按高峰价的一半计费。DeepSeek 仍保留调整价格的权利。

可以使用 Anthropic SDK 格式吗?

可以。两个模型都支持 https://api.deepseek.com/anthropic 这一 Anthropic 兼容端点,同时也支持 OpenAI 兼容 BASE URL。

相关供应商

参考来源