DeepSeek V4.1 Flash是 DeepSeek 于 2026 年 9 月 10 日正式发布的全新模型结构系列中尺寸最小的模型,采用 552B 参数 MoE 架构(输入激活 8B / 输出激活 16B,Causal-Encoder-Decoder),原生多模态视觉理解,主打低成本主力档,适用于 Agent 编程与多模态应用场景。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | 原生多模态低成本主力大模型 |
| 出品方 | DeepSeek |
| 发布时间 | 2026 年 9 月 10 日(正式版) |
| 参数规模 | 552B MoE(输入激活 8B / 输出激活 16B,Causal-Encoder-Decoder) |
| 上下文 | 1M token 上下文,最大输出 384K |
| 核心能力 | 原生多模态、工具调用、代码生成、低成本推理 |
| 定价策略 | 峰谷定价(每百万 token):闲时 缓存命中 ¥0.02 / 未命中 ¥1.0 / 输出 ¥4.0;高峰 ×2;9/10 12:00 生效 |
| 过渡安排 | API 名改为 deepseek-flash;V4-Flash 与 V4-Flash-Vision-Exp 已下线并路由至本模型;V4-Pro 于 9/14 12:00 后路由至本模型并按本模型计费 |
| 开源 | MIT 许可,权重已上线 HuggingFace,技术报告同步发布 |

DeepSeek V4.1 Flash 的核心能力
原生多模态输入与一图一文
V4.1 Flash 把多模态作为一等公民输入,模型直接接受图像与文本交错输入而无需外部多模态适配器。对开发者而言,这意味着同样的 API 调用既能处理纯文本任务,也能处理”截图 + 指令”的工作场景,省去为不同模态维护多套客户端的工作量。这与 AI Agent 流水线里常见的”先 OCR 再 LLM”做法形成对比。
性能与费用全面超越 V4-Pro
官方在 V4.1 Flash 公告中指出,该模型在性能、费用、速度、总用时上全面超越 V4-Pro,同时作为主力档,其单次 token 价格显著低于 V4-Pro。这意味着开发者在不损失能力的前提下获得更低的推理成本,是”主力档”定位的核心支撑。
正式发布与 API 迁移安排
V4.1 Flash 于 2026-09-10 正式发布,API 名称统一为 deepseek-flash。原 V4-Flash 与 V4-Flash-Vision-Exp 已下线,API 名暂时路由至 V4.1 Flash;V4-Pro 将于 2026-09-14 12:00 后路由至 V4.1 Flash 并按其计费。开发者应在 9/14 前完成 V4-Pro 调用向 deepseek-flash 的迁移检查,并确认缓存层与监控切换预案。
面向中小开发者的定价策略
官方对 V4.1 Flash 采用峰谷定价(每百万 token,单位人民币):闲时缓存命中 ¥0.02、未命中 ¥1.0、输出 ¥4.0;高峰时段统一 ×2。该定价自 2026-09-10 12:00 生效,闲时价格约为高峰的一半,对中小开发者的 Agent 与多模态批量调用尤为友好。
DeepSeek V4.1 Flash 与同类主力模型的对比
下面把 V4.1 Flash 与同档位(低成本主力)两款代表性模型做横向比较,覆盖通义与国际谷歌两个方向。
| 对比维度 | DeepSeek V4.1 Flash | Qwen3.8-Flash | Gemini 3.7 Flash |
|---|---|---|---|
| 开发方 | DeepSeek | 阿里通义千问 | 谷歌 |
| 参数规模 | 552B MoE(8B/16B 激活) | MoE 架构 | 未公开(推测稀疏) |
| 核心定位 | 低成本主力 + 原生多模态 | 多模态 MoE 大模型 | 编程与智能体低成本主力 |
| 关键基准 | 官方称性能/费用/速度全面超越 V4-Pro | 1M 长上下文 + 多模态 | LiveCodeBench 编程领先 |
| 上下文能力 | 1M | 1M | 128K |
| 定价策略 | 向中小开发者倾斜(低单价) | 分级 API 计费 | 分级 API 计费 |
| 开源程度 | MIT 开源(HF 权重) | 通义千问开源版本 | 闭源 API |
| 生态集成 | DeepSeek API + Harness | DashScope + ModelScope | Google AI Studio + Vertex AI |
整体来看,V4.1 Flash 在”低成本 + 主力能力”档位上与 Qwen3.8-Flash、Gemini 3.7 Flash 形成正面竞争;其差异化在于原生多模态的内建支持与 MIT 开源权重。
如果想看 V4 系列在视觉模态上的另一款代表,可以参考下面这篇 DeepSeek-V4-Flash-Vision-Exp(V4-Flash 系列的视觉多模态体验版,已于 2026-09-10 下线,API 路由至 V4.1 Flash)。
DeepSeek V4.1 Flash 的应用场景与适用人群
- Agent 编程主力:作为 LangGraph / AutoGen 等 Agent 框架的主力 LLM,单价低适合高并发调用
- 多模态应用集成:图像+文本混合输入的客服、设计辅助、内容审核
- 成本敏感型 SaaS:中小团队做 toC 产品时的核心推理引擎,月成本可控在数千元级别
适用人群:中小开发者、Agent 工程师、多模态应用集成商、需要可预测成本结构的 SaaS 团队。正式版已发布、生产环境可直接使用;大型企业可将 V4.1 Flash 作为成本敏感型主力档,与有序下线中的 V4-Pro 形成双层模型栈。
DeepSeek V4.1 Flash 的使用方法
接入 V4.1 Flash 只需在 DeepSeek 开放平台申请 API Key 并按官方 SDK 调用,下面给出四步流程。
- 申请 API Key:登录 DeepSeek 开放平台,完成实名认证后创建 API Key(并发与配额以 DeepSeek 开放平台控制台为准)
- 安装 SDK:Python 用户通过 `pip install openai`(DeepSeek 兼容 OpenAI 接口协议),Node.js 用户用 `npm i openai`
- 调用 API:将 base_url 设为 https://api.deepseek.com,model 设为 “deepseek-flash”,按 OpenAI 兼容格式调用
- 迁移与核对:若此前使用 V4-Flash / V4-Flash-Vision-Exp / V4-Pro,确认调用已切换至
deepseek-flash;V4-Pro 将于 9/14 12:00 后自动路由至 V4.1 Flash 并按其计费,建议提前核对账单与监控
DeepSeek V4.1 Flash 的价格与开源情况
定价方面,V4.1 Flash 采用峰谷定价(每百万 token,单位人民币):闲时缓存命中 ¥0.02、未命中 ¥1.0、输出 ¥4.0;高峰时段统一 ×2。该定价自 2026-09-10 12:00 生效,闲时价格约为高峰一半;按中等规模调用估算,成本显著低于 V4-Pro 旗舰档。
开源方面,V4.1 Flash 已以 MIT 许可在 HuggingFace 开源权重,技术报告同步发布,开发者可直接本地部署或微调;这也是它与 V4-Pro(闭源旗舰)的关键差异之一。
DeepSeek V4.1 Flash 的常见问题
DeepSeek V4.1 Flash 现在可以直接用于生产吗?
可以。V4.1 Flash 已于 2026-09-10 正式发布,API 名为 deepseek-flash,生产环境可直接调用;原 V4-Flash 与 V4-Flash-Vision-Exp 已下线并路由至本模型。
V4.1 Flash 与 V4-Pro 的主要差异是什么?
官方称 V4.1 Flash 在性能、费用、速度、总用时上全面超越 V4-Pro;V4-Pro 将有序下线,2026-09-14 12:00 后请求路由至 V4.1 Flash 并按其计费。
V4.1 Flash 支持多模态吗?
支持。V4.1 Flash 原生接受图像+文本混合输入,视觉理解内建于主模型,无需额外的多模态适配器。
并发与配额如何确定?
并发与配额以 DeepSeek 开放平台控制台为准;企业用户可在控制台申请提升配额,满足高并发 Agent 与多模态批量场景。
V4.1 Flash 适合做生产环境主力吗?
适合。正式版已发布,可作为成本敏感型主力档;与有序下线中的 V4-Pro 形成”主力 + 旗舰”双层模型栈,兼顾成本与极致能力。
浙公网安备33010202004812号