DeepSeek V4 Flash 与 V4 Pro:模型能力和 API 价格
对比 DeepSeek V4 Flash 与 V4 Pro 的官方价格、缓存费率、1M 上下文、384K 输出、API 兼容性、功能、并发限制及涨价提示。
DeepSeek V4 模型
V4 智能的两种深度
高吞吐与 API 灵活性选择 Flash,更高阶的 V4 生产负载选择 Pro。
人民币 / 百万 tokens
DeepSeek V4 Flash
面向高吞吐场景,并提供更完整 API 格式支持的 V4 模型。
- 模型 ID
deepseek-v4-flash- 模型版本
DeepSeek-V4-Flash-0731- 思考模式
非思考 + 思考(默认)
- 缓存命中输入
- ¥0.02
- 缓存未命中输入
- ¥1.00
- 输出
- ¥2.00
- 上下文
- 1M
- 最大输出
- 384K
- 并发限制
- 2500
- Responses API
- 支持
- API 格式
- 兼容 OpenAI + Anthropic
- 功能
- JSON Output、Tool Calls、Anthropic API、前缀续写、FIM(仅非思考)
DeepSeek V4 Pro
面向高要求推理与生产负载的 V4 高阶模型。
- 模型 ID
deepseek-v4-pro- 模型版本
DeepSeek-V4-Pro- 思考模式
非思考 + 思考(默认)
- 缓存命中输入
- ¥0.025
- 缓存未命中输入
- ¥3.00
- 输出
- ¥6.00
- 上下文
- 1M
- 最大输出
- 384K
- 并发限制
- 500
- Responses API
- 暂不支持
- API 格式
- 兼容 OpenAI + Anthropic
- 功能
- JSON Output、Tool Calls、Anthropic API、前缀续写、FIM(仅非思考)
DeepSeek V4 Flash 与 V4 Pro 概览
DeepSeek 当前提供两个 V4 API 模型 ID:deepseek-v4-flash 和 deepseek-v4-pro。Flash 对应 DeepSeek-V4-Flash-0731,Pro 对应 DeepSeek-V4-Pro。两者均支持非思考模式和思考模式,并默认启用思考。
两个模型都提供 1M 上下文窗口和最大 384K 输出。OpenAI 兼容格式的 BASE URL 为 https://api.deepseek.com,Anthropic 兼容格式为 https://api.deepseek.com/anthropic。上方对比采用 2026 年 8 月 10 日核验的官方价格页数据。
V4 Token 价格
DeepSeek 根据输入与输出 token 总量计费。输入价格分为缓存命中与缓存未命中两档,因此重复使用稳定提示前缀的应用可能获得明显的成本差异。
当赠送余额和充值余额同时存在时,优先扣减赠送余额。DeepSeek 声明产品价格可能变化,并建议用户依据实际用量按需充值。
- V4 Flash:缓存命中输入 ¥0.02 · 缓存未命中输入 ¥1.00 · 输出 ¥2.00 / 百万 tokens
- V4 Pro:缓存命中输入 ¥0.025 · 缓存未命中输入 ¥3.00 · 输出 ¥6.00 / 百万 tokens
- 扣费公式:token 消耗量 × 对应模型单价
官方涨价提示
DeepSeek 官方价格页当前提示,近期计划整体上调 API 服务价格,预计涨幅较大,但页面尚未公布最终替代费率。
因此本文所有数字都应视为带日期的价格快照,而不是未来价格保证。大额充值、制定长期预算或上线高调用量负载前,请重新核对官方价格页。
功能与 API 兼容性
两个 V4 模型都支持 JSON Output、Tool Calls、Anthropic API 格式、Beta 对话前缀续写,以及仅限非思考模式的 Beta FIM 补全;也都能通过 OpenAI 兼容和 Anthropic 兼容的 SDK 配置调用。
官方表格目前仍把 Responses API 标记为仅支持 deepseek-v4-flash,deepseek-v4-pro 暂不支持。尽管页面写明原计划于 2026 年 8 月初增加 Pro 支持,但当前状态字段尚未更新,因此本文保留官方现状,不推测部署已经完成。
1M 上下文与 384K 输出
1M 上下文窗口允许两个模型在单次请求中接收大型文档、代码库或长对话历史。384K 最大输出非常可观,适合超长生成,但不应作为默认目标。
长上下文和大输出会迅速增加延迟与成本,缓存未命中时尤其明显。建议明确设置输出上限、保持可复用前缀稳定以提高缓存命中率,并在扩容前测量真实 token 用量。
并发限制与 user_id 隔离
官方表格列出的并发限制为 V4 Flash 2500、V4 Pro 500。DeepSeek 限速文档说明,提升过并发配额的 API 用户还可能同时受到账号总并发和每个 user_id 的限制。
超过单个 user_id 限制的请求会收到 HTTP 429。建议通过合理的 user_id 隔离负载,并在遇到 429 时使用退避策略,不要立即密集重试。
选择 Flash 还是 Pro
重视成本、并发、Responses API 或高调用量处理时,建议先用 V4 Flash。它的缓存未命中输入和输出价格更低,官方并发限制是 Pro 的 5 倍。
当更高阶推理质量足以覆盖 3 倍缓存未命中输入价格和 3 倍输出价格时,再评估 V4 Pro。应使用真实提示词测试两个模型,并把思考 token 输出纳入成本比较。
常见问题
哪个 DeepSeek V4 模型更便宜?
V4 Flash 更便宜:缓存未命中输入 ¥1、输出 ¥2 / 百万 tokens;V4 Pro 分别为 ¥3 和 ¥6。缓存命中输入则为 Flash ¥0.02、Pro ¥0.025。
V4 Pro 支持 Responses API 吗?
截至 2026 年 8 月 10 日核验的官方价格快照,表格仍标记 Pro 暂不支持,Flash 已支持。
DeepSeek API 会涨价吗?
DeepSeek 当前表示计划整体上调 API 服务价格,预计涨幅较大,但价格页尚未公布最终费率。
可以使用 Anthropic SDK 格式吗?
可以。两个模型都支持 https://api.deepseek.com/anthropic 这一 Anthropic 兼容端点,同时也支持 OpenAI 兼容 BASE URL。
相关供应商
参考来源
- DeepSeek Models & PricingDeepSeek API Docs · 核验日期 2026-08-10
- Thinking ModeDeepSeek API Docs · 核验日期 2026-08-10
- Rate Limits and IsolationDeepSeek API Docs · 核验日期 2026-08-10
- DeepSeek API IntroductionDeepSeek API Docs · 核验日期 2026-08-10