跳到主内容
选型对比9 分钟阅读发布于:2026-08-10更新于:2026-08-10

DeepSeek V4 Flash 与 V4 Pro:模型能力和 API 价格

对比 DeepSeek V4 Flash 与 V4 Pro 的官方价格、缓存费率、1M 上下文、384K 输出、API 兼容性、功能、并发限制及涨价提示。

作者 Heizi· 创始人 & 编辑· 发布于: 2026-08-10实测验证

DeepSeek V4 模型

V4 智能的两种深度

高吞吐与 API 灵活性选择 Flash,更高阶的 V4 生产负载选择 Pro。

人民币 / 百万 tokens

DeepSeek V4 Flash

面向高吞吐场景,并提供更完整 API 格式支持的 V4 模型。

模型 ID
deepseek-v4-flash
模型版本
DeepSeek-V4-Flash-0731
思考模式
非思考 + 思考(默认)
缓存命中输入
¥0.02
缓存未命中输入
¥1.00
输出
¥2.00
上下文
1M
最大输出
384K
并发限制
2500
Responses API
支持
API 格式
兼容 OpenAI + Anthropic
功能
JSON Output、Tool Calls、Anthropic API、前缀续写、FIM(仅非思考)

DeepSeek V4 Pro

面向高要求推理与生产负载的 V4 高阶模型。

模型 ID
deepseek-v4-pro
模型版本
DeepSeek-V4-Pro
思考模式
非思考 + 思考(默认)
缓存命中输入
¥0.025
缓存未命中输入
¥3.00
输出
¥6.00
上下文
1M
最大输出
384K
并发限制
500
Responses API
暂不支持
API 格式
兼容 OpenAI + Anthropic
功能
JSON Output、Tool Calls、Anthropic API、前缀续写、FIM(仅非思考)
DeepSeek 当前提示 API 价格预计将有较大幅度上调,购买或部署前请重新核验。
DeepSeek 官方价格快照核验于 2026 年 8 月 10 日。

DeepSeek V4 Flash 与 V4 Pro 概览

DeepSeek 当前提供两个 V4 API 模型 ID:deepseek-v4-flash 和 deepseek-v4-pro。Flash 对应 DeepSeek-V4-Flash-0731,Pro 对应 DeepSeek-V4-Pro。两者均支持非思考模式和思考模式,并默认启用思考。

两个模型都提供 1M 上下文窗口和最大 384K 输出。OpenAI 兼容格式的 BASE URL 为 https://api.deepseek.com,Anthropic 兼容格式为 https://api.deepseek.com/anthropic。上方对比采用 2026 年 8 月 10 日核验的官方价格页数据。

V4 Token 价格

DeepSeek 根据输入与输出 token 总量计费。输入价格分为缓存命中与缓存未命中两档,因此重复使用稳定提示前缀的应用可能获得明显的成本差异。

当赠送余额和充值余额同时存在时,优先扣减赠送余额。DeepSeek 声明产品价格可能变化,并建议用户依据实际用量按需充值。

  • V4 Flash:缓存命中输入 ¥0.02 · 缓存未命中输入 ¥1.00 · 输出 ¥2.00 / 百万 tokens
  • V4 Pro:缓存命中输入 ¥0.025 · 缓存未命中输入 ¥3.00 · 输出 ¥6.00 / 百万 tokens
  • 扣费公式:token 消耗量 × 对应模型单价

官方涨价提示

DeepSeek 官方价格页当前提示,近期计划整体上调 API 服务价格,预计涨幅较大,但页面尚未公布最终替代费率。

因此本文所有数字都应视为带日期的价格快照,而不是未来价格保证。大额充值、制定长期预算或上线高调用量负载前,请重新核对官方价格页。

功能与 API 兼容性

两个 V4 模型都支持 JSON Output、Tool Calls、Anthropic API 格式、Beta 对话前缀续写,以及仅限非思考模式的 Beta FIM 补全;也都能通过 OpenAI 兼容和 Anthropic 兼容的 SDK 配置调用。

官方表格目前仍把 Responses API 标记为仅支持 deepseek-v4-flash,deepseek-v4-pro 暂不支持。尽管页面写明原计划于 2026 年 8 月初增加 Pro 支持,但当前状态字段尚未更新,因此本文保留官方现状,不推测部署已经完成。

1M 上下文与 384K 输出

1M 上下文窗口允许两个模型在单次请求中接收大型文档、代码库或长对话历史。384K 最大输出非常可观,适合超长生成,但不应作为默认目标。

长上下文和大输出会迅速增加延迟与成本,缓存未命中时尤其明显。建议明确设置输出上限、保持可复用前缀稳定以提高缓存命中率,并在扩容前测量真实 token 用量。

并发限制与 user_id 隔离

官方表格列出的并发限制为 V4 Flash 2500、V4 Pro 500。DeepSeek 限速文档说明,提升过并发配额的 API 用户还可能同时受到账号总并发和每个 user_id 的限制。

超过单个 user_id 限制的请求会收到 HTTP 429。建议通过合理的 user_id 隔离负载,并在遇到 429 时使用退避策略,不要立即密集重试。

选择 Flash 还是 Pro

重视成本、并发、Responses API 或高调用量处理时,建议先用 V4 Flash。它的缓存未命中输入和输出价格更低,官方并发限制是 Pro 的 5 倍。

当更高阶推理质量足以覆盖 3 倍缓存未命中输入价格和 3 倍输出价格时,再评估 V4 Pro。应使用真实提示词测试两个模型,并把思考 token 输出纳入成本比较。

常见问题

哪个 DeepSeek V4 模型更便宜?

V4 Flash 更便宜:缓存未命中输入 ¥1、输出 ¥2 / 百万 tokens;V4 Pro 分别为 ¥3 和 ¥6。缓存命中输入则为 Flash ¥0.02、Pro ¥0.025。

V4 Pro 支持 Responses API 吗?

截至 2026 年 8 月 10 日核验的官方价格快照,表格仍标记 Pro 暂不支持,Flash 已支持。

DeepSeek API 会涨价吗?

DeepSeek 当前表示计划整体上调 API 服务价格,预计涨幅较大,但价格页尚未公布最终费率。

可以使用 Anthropic SDK 格式吗?

可以。两个模型都支持 https://api.deepseek.com/anthropic 这一 Anthropic 兼容端点,同时也支持 OpenAI 兼容 BASE URL。

相关供应商

参考来源