跳到主内容
选型对比11 分钟阅读发布于:2026-09-13更新于:2026-09-13

DeepSeek V4.1 Flash 发布:API 价格、跑分与迁移指南

DeepSeek V4.1 Flash 带来原生视觉、100 万 token 上下文、更低 API 价格和更省缓存的新架构。本文说明 V4 Flash 与 V4 Pro 用户在 9 月 14 日路由切换前需要处理什么。

作者 Heizi· 创始人 & 编辑· 发布于: 2026-09-13已核验官方资料 · 2026-09-13

核验说明: 发布日期、模型 ID、架构、价格、迁移时间和评测设置均已对照 DeepSeek 官方公告、API 文档、技术报告与模型卡核验。文中跑分来自厂商测试,Get Model Key 尚未独立复测。

创建 DeepSeek API Key

新接入建议使用官方模型 ID deepseek-flash;迁移生产流量前请再次核对实时价格。

9 月 10 日发布了什么

DeepSeek 于 2026 年 9 月 10 日发布 V4.1 Flash。它不是给 V4 Flash 再做一次后训练,而是一款采用新架构的多模态混合专家模型。模型可接收文本和图片,支持最长 100 万 token 上下文,官方 API 模型 ID 为 deepseek-flash。

这次发布也会改变旧接口的实际返回模型。已经退役的 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 暂时都会路由到 V4.1 Flash。2026 年 9 月 14 日 04:00 UTC(北京时间 12:00)起,deepseek-v4-pro 也会切到 V4.1 Flash,并按 Flash 价格计费,直到 V4.1 Pro 上线。DeepSeek 尚未公布 V4.1 Pro 的发布日期。

  • 发布日期:2026 年 9 月 10 日
  • 官方 API 模型 ID:deepseek-flash
  • 输入:文本与图片;输出:文本
  • 上下文最长 100 万 token;最大输出 38.4 万 token
  • 开放权重:Hugging Face 提供,MIT 许可证

新架构解决的不是参数数量,而是缓存账单

V4.1 Flash 的骨干参数为 552B,但新的 Causal Encoder-Decoder 架构在输入预填充时每个 token 只激活 8B 参数,生成阶段激活 16B。它的目标很直接:长上下文 Agent 吃进去的内容很多,先把输入侧的计算和显存压力压下来。

更值得看的是 KV Cache:每个 token 约 890 字节,只有 V4 Flash 的四分之一。模型还会通过 bounded replay 重建部分滑动窗口状态,减少持久化存储。缓存更小不等于答案一定更好,但对代码仓库会话、连续工具调用和大文档任务,部署成本会更容易控制。

DeepSeek 公布的架构数据
规格DeepSeek V4.1 Flash
骨干参数552B MoE
激活参数输入预填充 8B / 生成 16B
全局 KV Cache890 字节 / token
训练45T 多模态 token;上下文扩展至 1M
推理强度1–100 连续可调

跑分很强,但不是全面领先

DeepSeek 公布的成绩包括 DeepSWE v1.1 74.2、Terminal-Bench 2.1 90.6、AutomationBench 54.8,以及 Agent's Last Exam 31.8。在同一份厂商测试表中,这几项都高于 V4 Pro,足以让它进入代码 Agent 和长链路工具任务的候选名单。

但这不是一张全胜成绩单。V4 Pro 在 GPQA Diamond 和可比的 HLE 纯文本子集上仍然更高;到了更难的终端、安全与编程测试,Opus 5 和 GPT-5.6 Sol 也有多项领先。代码任务还使用了不同的 Agent 框架,并把推理强度开到最高。比较时应把这些成绩当作筛选线索,而不是生产结论。

最大推理强度下的部分厂商自测结果
评测V4.1 FlashV4 ProV4 Flash
DeepSWE v1.174.262.754.4
Terminal-Bench 2.190.687.982.7
AutomationBench54.843.237.7
Agent's Last Exam31.825.725.2
GPQA Diamond90.992.489.9

DeepSeek V4.1 Flash API 价格

DeepSeek 分别计算缓存命中输入、缓存未命中输入和输出费用。工作日高峰价是空闲价的两倍。下表为官方直连 API 价格,自 2026 年 9 月 10 日 12:00(北京时间)起生效。

高峰时段为周一至周五的北京时间 09:00–12:00、14:00–18:00,其余时间按空闲价计费。第三方网关或云平台可能采用不同单价,不能直接套用这张表。

官方直连 API 每百万 token 单价
计费项空闲时段高峰时段
缓存命中输入¥0.02¥0.04
缓存未命中输入¥1¥2
输出¥4¥8

V4 Pro 切换前要做的事

如果应用已经使用 deepseek-v4-flash,它很可能已通过兼容路由调用 V4.1 Flash。新配置建议改成 deepseek-flash,让模型选择保持明确。官方没有公布旧名称的停止时间,不能把临时兼容当成长期保证。

V4 Pro 用户更需要回归测试:9 月 14 日以后,deepseek-v4-pro 这个字符串不变,背后的模型却会改变。现在保存一组已经验收的 Pro 输出,再用 deepseek-flash 重放真实提示词。重点比较任务成功率、工具参数、延迟、总输出 token 和图片处理,不要只看一次回答的文风。

  • 新部署使用 deepseek-flash
  • 在 9 月 14 日 04:00 UTC 前保存 V4 Pro 基线
  • 用真实提示词测试推理强度与输出长度
  • 重新验证工具 Schema 和结构化输出
  • 按新缓存、未缓存和输出单价更新成本告警
  • 切换当天再次检查实际 API 返回和官方文档

用 OpenAI Python SDK 调用 V4.1 Flash

DeepSeek 继续提供 OpenAI 兼容接口。把 base URL 指向 DeepSeek,使用 DeepSeek 平台密钥,并将模型设为 deepseek-flash。密钥应放在环境变量中,不要写进源码。

python
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[
        {"role": "user", "content": "Review this API migration plan and list the two highest risks."}
    ],
)

print(response.choices[0].message.content)

使用 V4.1 Flash 官方模型 ID 的最小文本请求。

哪些团队值得先测

长上下文代码 Agent、仓库分析、文档抽取、看图排错,以及会在多轮步骤中重复提示词的高调用量任务,最适合先测 V4.1 Flash。它最确定的优势是 API 单价和缓存占用。

不要因为“Flash 超过 Pro”这句标题就直接全量迁移。高难度研究、安全任务,以及一次失败代价远高于 token 费用的流程,仍应保留更强模型兜底。真正要比较的是每个验收通过任务的总成本,重试和人工复核都算在内。

开放权重不等于容易自托管

DeepSeek 以 MIT 许可证开放了 V4.1 Flash 权重,也给出了 vLLM 和 SGLang 的参考路径。需要掌控部署环境的基础设施团队会受益,但完整模型依然很大。官方公告甚至直接提到约 2000 张 GPU 加存储集群的大规模部署方案。

多数团队更适合先用托管 API,记录真实 token、延迟和成功率,等负载稳定后再评估量化或自托管。开放权重增加了选择,不会自动消除硬件、存储和运维成本。

常见问题

DeepSeek V4.1 Flash 的 API 模型 ID 是什么?

新接入使用 deepseek-flash。已退役的 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 暂时会兼容路由到 V4.1 Flash。

DeepSeek V4.1 Flash API 多少钱?

官方直连 API 的空闲价为每百万 token:缓存命中输入 ¥0.02、缓存未命中输入 ¥1、输出 ¥4。工作日高峰价分别为 ¥0.04、¥2、¥8。

DeepSeek V4.1 Flash 支持图片吗?

支持。V4.1 Flash 原生接收文本和图片并输出文本,也取代了单独的 V4 Flash Vision 实验接口。

9 月 14 日后 deepseek-v4-pro 会怎样?

2026 年 9 月 14 日 04:00 UTC 起,deepseek-v4-pro 请求将路由到 V4.1 Flash,并按 Flash 价格计费,直到 V4.1 Pro 发布。模型字符串可能继续可用,但实际模型行为会改变。

DeepSeek V4.1 Flash 比 V4 Pro 更好吗?

它在多项 DeepSeek 自测的编程与 Agent 评测中更高,但 V4 Pro 在部分推理测试上仍然领先。应先用自己的业务任务做回归,不要把它当成所有场景的无条件升级。

相关供应商

参考来源