DeepSeek V4 Flash 与 V4 Pro:2026 年 8 月价格存档
DeepSeek V4 Flash 与 V4 Pro 的 2026 年 8 月价格存档。两条路由正被 V4.1 Flash 取代,新的 API 决策请查看 V4.1 指南。
DeepSeek V4 模型
V4 智能的两种深度
高吞吐与 API 灵活性选择 Flash,更高阶的 V4 生产负载选择 Pro。空闲时段价格为高峰时段的一半。
人民币 / 百万 tokens
DeepSeek V4 Flash
面向高吞吐场景,并提供更完整 API 格式支持的 V4 模型。
- 模型 ID
deepseek-v4-flash- 模型版本
DeepSeek-V4-Flash-0731- 思考模式
非思考 + 思考(默认)
- 缓存命中输入
- 空闲¥0.05高峰¥0.10
- 缓存未命中输入
- 空闲¥1.5高峰¥3.0
- 输出
- 空闲¥4.5高峰¥9.0
- 上下文
- 1M
- 最大输出
- 384K
- 并发限制
- 2500
- Responses API
- 支持
- API 格式
- 兼容 OpenAI + Anthropic
- 功能
- JSON Output、Tool Calls、Anthropic API、前缀续写、FIM(仅非思考)
DeepSeek V4 Pro
面向高要求推理与生产负载的 V4 高阶模型。
- 模型 ID
deepseek-v4-pro- 模型版本
DeepSeek-V4-Pro-0813- 思考模式
非思考 + 思考(默认)
- 缓存命中输入
- 空闲¥0.15高峰¥0.30
- 缓存未命中输入
- 空闲¥4.5高峰¥9.0
- 输出
- 空闲¥13.5高峰¥27.0
- 上下文
- 1M
- 最大输出
- 384K
- 并发限制
- 500
- Responses API
- 支持
- API 格式
- 兼容 OpenAI + Anthropic
- 功能
- JSON Output、Tool Calls、Anthropic API、前缀续写、FIM(仅非思考)
存档说明:这些路由正被 V4.1 Flash 取代
本页保留 2026 年 8 月 21 日的 V4 Flash 与 V4 Pro 价格快照,不再作为当前选型指南。DeepSeek 已于 9 月 10 日发布 V4.1 Flash,官方模型 ID 为 deepseek-flash;旧 Flash 名称现已路由到新模型。
DeepSeek 表示,deepseek-v4-pro 将从 9 月 14 日 04:00 UTC 起路由到 V4.1 Flash,并按 Flash 价格计费,直到 V4.1 Pro 发布。当前价格、跑分和迁移步骤请查看DeepSeek V4.1 Flash API 指南。
DeepSeek V4 Flash 与 V4 Pro 概览
DeepSeek 当前提供两个 V4 API 模型 ID:deepseek-v4-flash 和 deepseek-v4-pro。Flash 对应 DeepSeek-V4-Flash-0731,Pro 对应 DeepSeek-V4-Pro-0813。两者均支持非思考模式和思考模式,并默认启用思考。
两个模型都提供 1M 上下文窗口和最大 384K 输出。OpenAI 兼容格式的 BASE URL 为 https://api.deepseek.com,Anthropic 兼容格式为 https://api.deepseek.com/anthropic。上方对比采用 2026 年 8 月 21 日核验的官方价格页数据。
2026 年 8 月调价后的 V4 Token 价格
DeepSeek 根据输入与输出 token 总量计费。输入价格分为缓存命中与缓存未命中两档,每档再按高峰时段和空闲时段计价。空闲时段价格为高峰时段价格的一半。
当赠送余额和充值余额同时存在时,优先扣减赠送余额。DeepSeek 声明产品价格可能变化,并建议用户依据实际用量按需充值。
- V4 Flash:缓存命中输入 空闲 ¥0.05 / 高峰 ¥0.10 · 缓存未命中输入 空闲 ¥1.5 / 高峰 ¥3.0 · 输出 空闲 ¥4.5 / 高峰 ¥9.0 / 百万 tokens
- V4 Pro:缓存命中输入 空闲 ¥0.15 / 高峰 ¥0.30 · 缓存未命中输入 空闲 ¥4.5 / 高峰 ¥9.0 · 输出 空闲 ¥13.5 / 高峰 ¥27.0 / 百万 tokens
- 高峰时段为北京时间 9:00–12:00、14:00–18:00,其余为空闲时段
- 扣费公式:token 消耗量 × 对应模型单价
高峰时段与空闲时段
2026 年 8 月调价后,DeepSeek 不再公布全天统一单价。高峰时段为北京时间 9:00–12:00、14:00–18:00;这两个窗口之外的时间(含夜间及高峰窗外的周末时段)按空闲价计费。
批处理、评测和非交互回填任务应尽量排到空闲时段。高峰时段的交互式生产流量要按更高费率做预算,尤其是缓存未命中输入和思考模式下的长输出。
功能与 API 兼容性
两个 V4 模型都支持 JSON Output、Tool Calls、Responses API、Anthropic API 格式、Beta 对话前缀续写,以及仅限非思考模式的 Beta FIM 补全;也都能通过 OpenAI 兼容和 Anthropic 兼容的 SDK 配置调用。
FIM 补全仍仅限非思考模式。如果需要中间补全,请对该请求关闭思考,不要默认走思考路径。
1M 上下文与 384K 输出
1M 上下文窗口允许两个模型在单次请求中接收大型文档、代码库或长对话历史。384K 最大输出非常可观,适合超长生成,但不应作为默认目标。
长上下文和大输出会迅速增加延迟与成本,高峰时段缓存未命中时尤其明显。建议明确设置输出上限、保持可复用前缀稳定以提高缓存命中率,并在扩容前测量真实 token 用量。
并发限制与 user_id 隔离
官方表格列出的并发限制为 V4 Flash 2500、V4 Pro 500。DeepSeek 限速文档说明,提升过并发配额的 API 用户还可能同时受到账号总并发和每个 user_id 的限制。
超过单个 user_id 限制的请求会收到 HTTP 429。建议通过合理的 user_id 隔离负载,并在遇到 429 时使用退避策略,不要立即密集重试。
选择 Flash 还是 Pro
重视成本、并发或高调用量处理时,建议先用 V4 Flash。它的缓存未命中输入和输出价格更低,官方并发限制是 Pro 的 5 倍。两个模型现在都支持 Responses API。
当更高阶推理质量足以覆盖 3 倍缓存未命中输入价格和 3 倍输出价格时,再评估 V4 Pro。应使用真实提示词测试两个模型,并把思考 token 输出纳入成本比较。
常见问题
哪个 DeepSeek V4 模型更便宜?
V4 Flash 更便宜。高峰时段缓存未命中输入/输出为 ¥3.0 / ¥9.0 / 百万 tokens,V4 Pro 为 ¥9.0 / ¥27.0。空闲价为高峰价的一半。缓存命中输入 Flash 为空闲 ¥0.05 / 高峰 ¥0.10,Pro 为空闲 ¥0.15 / 高峰 ¥0.30。
V4 Pro 支持 Responses API 吗?
支持。截至 2026 年 8 月 21 日核验的官方价格快照,deepseek-v4-flash 和 deepseek-v4-pro 均标记为支持 Responses API。
DeepSeek 的高峰时段是什么时候?
高峰时段为北京时间 9:00–12:00、14:00–18:00。空闲时段按高峰价的一半计费。DeepSeek 仍保留调整价格的权利。
可以使用 Anthropic SDK 格式吗?
可以。两个模型都支持 https://api.deepseek.com/anthropic 这一 Anthropic 兼容端点,同时也支持 OpenAI 兼容 BASE URL。
相关供应商
参考来源
- DeepSeek Models & PricingDeepSeek API Docs · 核验日期 2026-08-21
- Thinking ModeDeepSeek API Docs · 核验日期 2026-08-21
- Rate Limits and IsolationDeepSeek API Docs · 核验日期 2026-08-21
- DeepSeek API IntroductionDeepSeek API Docs · 核验日期 2026-08-21