DeepSeek V4.1 Flash 发布:API 价格、跑分与迁移指南
DeepSeek V4.1 Flash 带来原生视觉、100 万 token 上下文、更低 API 价格和更省缓存的新架构。本文说明 V4 Flash 与 V4 Pro 用户在 9 月 14 日路由切换前需要处理什么。
核验说明: 发布日期、模型 ID、架构、价格、迁移时间和评测设置均已对照 DeepSeek 官方公告、API 文档、技术报告与模型卡核验。文中跑分来自厂商测试,Get Model Key 尚未独立复测。
新接入建议使用官方模型 ID deepseek-flash;迁移生产流量前请再次核对实时价格。
9 月 10 日发布了什么
DeepSeek 于 2026 年 9 月 10 日发布 V4.1 Flash。它不是给 V4 Flash 再做一次后训练,而是一款采用新架构的多模态混合专家模型。模型可接收文本和图片,支持最长 100 万 token 上下文,官方 API 模型 ID 为 deepseek-flash。
这次发布也会改变旧接口的实际返回模型。已经退役的 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 暂时都会路由到 V4.1 Flash。2026 年 9 月 14 日 04:00 UTC(北京时间 12:00)起,deepseek-v4-pro 也会切到 V4.1 Flash,并按 Flash 价格计费,直到 V4.1 Pro 上线。DeepSeek 尚未公布 V4.1 Pro 的发布日期。
- 发布日期:2026 年 9 月 10 日
- 官方 API 模型 ID:deepseek-flash
- 输入:文本与图片;输出:文本
- 上下文最长 100 万 token;最大输出 38.4 万 token
- 开放权重:Hugging Face 提供,MIT 许可证
新架构解决的不是参数数量,而是缓存账单
V4.1 Flash 的骨干参数为 552B,但新的 Causal Encoder-Decoder 架构在输入预填充时每个 token 只激活 8B 参数,生成阶段激活 16B。它的目标很直接:长上下文 Agent 吃进去的内容很多,先把输入侧的计算和显存压力压下来。
更值得看的是 KV Cache:每个 token 约 890 字节,只有 V4 Flash 的四分之一。模型还会通过 bounded replay 重建部分滑动窗口状态,减少持久化存储。缓存更小不等于答案一定更好,但对代码仓库会话、连续工具调用和大文档任务,部署成本会更容易控制。
| 规格 | DeepSeek V4.1 Flash |
|---|---|
| 骨干参数 | 552B MoE |
| 激活参数 | 输入预填充 8B / 生成 16B |
| 全局 KV Cache | 890 字节 / token |
| 训练 | 45T 多模态 token;上下文扩展至 1M |
| 推理强度 | 1–100 连续可调 |
跑分很强,但不是全面领先
DeepSeek 公布的成绩包括 DeepSWE v1.1 74.2、Terminal-Bench 2.1 90.6、AutomationBench 54.8,以及 Agent's Last Exam 31.8。在同一份厂商测试表中,这几项都高于 V4 Pro,足以让它进入代码 Agent 和长链路工具任务的候选名单。
但这不是一张全胜成绩单。V4 Pro 在 GPQA Diamond 和可比的 HLE 纯文本子集上仍然更高;到了更难的终端、安全与编程测试,Opus 5 和 GPT-5.6 Sol 也有多项领先。代码任务还使用了不同的 Agent 框架,并把推理强度开到最高。比较时应把这些成绩当作筛选线索,而不是生产结论。
| 评测 | V4.1 Flash | V4 Pro | V4 Flash |
|---|---|---|---|
| DeepSWE v1.1 | 74.2 | 62.7 | 54.4 |
| Terminal-Bench 2.1 | 90.6 | 87.9 | 82.7 |
| AutomationBench | 54.8 | 43.2 | 37.7 |
| Agent's Last Exam | 31.8 | 25.7 | 25.2 |
| GPQA Diamond | 90.9 | 92.4 | 89.9 |
DeepSeek V4.1 Flash API 价格
DeepSeek 分别计算缓存命中输入、缓存未命中输入和输出费用。工作日高峰价是空闲价的两倍。下表为官方直连 API 价格,自 2026 年 9 月 10 日 12:00(北京时间)起生效。
高峰时段为周一至周五的北京时间 09:00–12:00、14:00–18:00,其余时间按空闲价计费。第三方网关或云平台可能采用不同单价,不能直接套用这张表。
| 计费项 | 空闲时段 | 高峰时段 |
|---|---|---|
| 缓存命中输入 | ¥0.02 | ¥0.04 |
| 缓存未命中输入 | ¥1 | ¥2 |
| 输出 | ¥4 | ¥8 |
V4 Pro 切换前要做的事
如果应用已经使用 deepseek-v4-flash,它很可能已通过兼容路由调用 V4.1 Flash。新配置建议改成 deepseek-flash,让模型选择保持明确。官方没有公布旧名称的停止时间,不能把临时兼容当成长期保证。
V4 Pro 用户更需要回归测试:9 月 14 日以后,deepseek-v4-pro 这个字符串不变,背后的模型却会改变。现在保存一组已经验收的 Pro 输出,再用 deepseek-flash 重放真实提示词。重点比较任务成功率、工具参数、延迟、总输出 token 和图片处理,不要只看一次回答的文风。
- 新部署使用 deepseek-flash
- 在 9 月 14 日 04:00 UTC 前保存 V4 Pro 基线
- 用真实提示词测试推理强度与输出长度
- 重新验证工具 Schema 和结构化输出
- 按新缓存、未缓存和输出单价更新成本告警
- 切换当天再次检查实际 API 返回和官方文档
用 OpenAI Python SDK 调用 V4.1 Flash
DeepSeek 继续提供 OpenAI 兼容接口。把 base URL 指向 DeepSeek,使用 DeepSeek 平台密钥,并将模型设为 deepseek-flash。密钥应放在环境变量中,不要写进源码。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-flash",
messages=[
{"role": "user", "content": "Review this API migration plan and list the two highest risks."}
],
)
print(response.choices[0].message.content)使用 V4.1 Flash 官方模型 ID 的最小文本请求。
哪些团队值得先测
长上下文代码 Agent、仓库分析、文档抽取、看图排错,以及会在多轮步骤中重复提示词的高调用量任务,最适合先测 V4.1 Flash。它最确定的优势是 API 单价和缓存占用。
不要因为“Flash 超过 Pro”这句标题就直接全量迁移。高难度研究、安全任务,以及一次失败代价远高于 token 费用的流程,仍应保留更强模型兜底。真正要比较的是每个验收通过任务的总成本,重试和人工复核都算在内。
开放权重不等于容易自托管
DeepSeek 以 MIT 许可证开放了 V4.1 Flash 权重,也给出了 vLLM 和 SGLang 的参考路径。需要掌控部署环境的基础设施团队会受益,但完整模型依然很大。官方公告甚至直接提到约 2000 张 GPU 加存储集群的大规模部署方案。
多数团队更适合先用托管 API,记录真实 token、延迟和成功率,等负载稳定后再评估量化或自托管。开放权重增加了选择,不会自动消除硬件、存储和运维成本。
常见问题
DeepSeek V4.1 Flash 的 API 模型 ID 是什么?
新接入使用 deepseek-flash。已退役的 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 暂时会兼容路由到 V4.1 Flash。
DeepSeek V4.1 Flash API 多少钱?
官方直连 API 的空闲价为每百万 token:缓存命中输入 ¥0.02、缓存未命中输入 ¥1、输出 ¥4。工作日高峰价分别为 ¥0.04、¥2、¥8。
DeepSeek V4.1 Flash 支持图片吗?
支持。V4.1 Flash 原生接收文本和图片并输出文本,也取代了单独的 V4 Flash Vision 实验接口。
9 月 14 日后 deepseek-v4-pro 会怎样?
2026 年 9 月 14 日 04:00 UTC 起,deepseek-v4-pro 请求将路由到 V4.1 Flash,并按 Flash 价格计费,直到 V4.1 Pro 发布。模型字符串可能继续可用,但实际模型行为会改变。
DeepSeek V4.1 Flash 比 V4 Pro 更好吗?
它在多项 DeepSeek 自测的编程与 Agent 评测中更高,但 V4 Pro 在部分推理测试上仍然领先。应先用自己的业务任务做回归,不要把它当成所有场景的无条件升级。
相关供应商
参考来源
- Introducing DeepSeek-V4.1-FlashDeepSeek · 核验日期 2026-09-13
- DeepSeek-V4.1-Flash model card and evaluation resultsDeepSeek on Hugging Face · 核验日期 2026-09-13
- DeepSeek-V4.1-Flash technical reportDeepSeek on Hugging Face · 核验日期 2026-09-13
- DeepSeek API models and pricingDeepSeek API Docs · 核验日期 2026-09-13
- DeepSeek formally launches V4.1 FlashTechNode · 核验日期 2026-09-13
- DeepSeek V4.1 Flash open-weights analysisTraictory · 核验日期 2026-09-13