DeepSeek-V4-Flash-Vision-Exp是一款由DeepSeek随工具链DeepSeek Harness 0.1.1-rc.1推出的视觉多模态体验模型,表现接近 Claude Opus 4.8,主要用于为命令行智能体补齐图像理解能力,支持原生图片请求与图文混合指令输入,适用于开发者自动化与Agent构建场景。
DeepSeek-V4-Flash-Vision-Exp参数速览
| 基础信息 | 内容 |
|---|---|
| 产品定位 | DeepSeek视觉多模态体验版模型 |
| 开发商 | DeepSeek |
| 发布时间 | 2026年8月21日 |
| 发布载体 | DeepSeek Harness 0.1.1-rc.1版本 |
| 基础模型 | DeepSeek-V4-Flash / V4-Pro系列 |
| 核心能力 | 图像理解、图文混合输入、看图干活 |
| 调用方式 | npm升级DeepSeek Harness |
| 授权方式 | 开源工具链,免费体验 |
| 适用人群 | 开发者、Agent构建者、自动化运维人员 |

DeepSeek-V4-Flash-Vision-Exp核心能力与技术特点
视觉理解能力补全多模态闭环
在此之前,DeepSeek虽然已在网页端提供识图模式,但命令行工具链始终缺少原生的视觉输入通道。DeepSeek-V4-Flash-Vision-Exp的登场标志着DeepSeek将识图能力深度整合并落地到开发工具链中,Agent第一次可以在终端环境里直接”看到”图像内容,多模态处理的最后一块拼图就此补全。
原生图片请求与图文混合指令
配合前一日发布的v0.1.0-rc.8版本,DeepSeek Harness已支持配置原生图片请求,/goal、/plan等关键指令正式实现图文混合输入。用户可以将工作截图和具体需求同时发送给智能体,由模型同时解析文字指令与画面信息,再输出执行方案,大幅简化了开发与操作流程。
基于V4Flash的速度底座
DeepSeek-V4-Flash-Vision-Exp构建在DeepSeek-V4-Flash及V4-Pro模型基础之上。V4Flash系列主打轻量高速,这使得视觉能力在体验版阶段就能保持较快的响应节奏,兼具速度与准确度,适合高频调用的自动化场景。
与DeepSeek Harness深度协同
该模型并非独立API,而是与开源命令行智能体框架DeepSeek Harness深度绑定。开发者通过指定的npm命令升级工具链即可抢先体验,无需额外申请或切换平台,降低了多模态Agent的搭建门槛。
Agent直接看图干活
传统工作流中,让AI处理界面截图往往需要手动转述内容。有了视觉输入后,Agent可以自主读取报错截图、设计稿、数据图表,直接理解画面中的问题并执行修复或分析动作,”看图干活”从概念变为可落地的日常操作。
DeepSeek-V4-Flash-Vision-Exp与同类多模态模型对比
DeepSeek官方在发布时直接将DeepSeek-V4-Flash-Vision-Exp与Anthropic Opus-4.8对标,以下基于官方公布的基准测试数据与API定价信息进行对比,同时列入DeepSeek-V4-Flash文本版以展示视觉能力的增量提升:
| 对比维度 | DeepSeek-V4-Flash-Vision-Exp | DeepSeek-V4-Flash | Opus-4.8 |
|---|---|---|---|
| 开发方 | DeepSeek | DeepSeek | Anthropic |
| 模型定位 | 实验性多模态视觉Agent模型 | 文本Agent模型 | 旗舰级多模态大模型 |
| Terminal Bench 2.1 | 83.9 | 82.7 | 85.0 |
| ApexBench(Pass@1) | 36.5 | 26.2* | 39.4 |
| Agents’ Last Exam | 27.3 | 25.2* | 25.7 |
| DeepSWE | 59.3 | 54.4 | 58.0 |
| ZeroBench(Pass@5) | 35.0 | — | 34.0 |
| 上下文长度 | 1M tokens | 1M tokens | 1M tokens |
| 输入价格(高峰/百万tokens) | 3.0元 | 3.0元 | 约35元($5) |
| 输出价格(高峰/百万tokens) | 9.0元 | 9.0元 | 约175元($25) |
| 图片计费方式 | 按尺寸转token,单张上限384 | 不支持图片输入 | 按token计费 |
| 并发限制 | 2500 | 2500 | 较低(数百级) |
注:以上数据来自DeepSeek官方Change Log(2026-08-21)及API定价页,Opus-4.8价格依据Anthropic官方定价($5/$25每百万tokens,按约7汇率折算人民币)。带*号的分数表示V4-Flash文本版在该基准中会忽略多模态元素,仅作参考基线。
从官方数据可以看出,DeepSeek-V4-Flash-Vision-Exp在Agents’ Last Exam和ZeroBench两项多模态基准上反超Opus-4.8,在ApexBench和Chartography上落后不超过4分,整体多模态Agent能力已接近Opus-4.8水平。与自家V4-Flash文本版相比,视觉能力的加入未拖累任何文本基准成绩。而在定价方面,DeepSeek输入价格仅为Opus-4.8的约1/12,输出价格约为1/19,配合2500的高并发限制,成本优势极为显著。
DeepSeek-V4-Flash-Vision-Exp应用场景与适用人群
- 截图报错自动修复:开发者把报错截图连同修复目标一起发给Agent,模型识别截图中的堆栈信息与代码上下文,直接定位问题并给出修改方案,省去手动复制错误信息的步骤
- 设计稿转页面结构:将UI设计稿图片与需求描述混合输入,Agent读取视觉布局后生成对应的页面骨架或组件代码,适合前端快速起稿与原型验证
- 数据图表解读分析:面对报表、曲线图等图片素材,模型可提取关键数值与趋势,结合文字指令输出分析结论,辅助运营与数据人员快速成稿
- 运维监控图巡查:把监控面板截图交给终端Agent,由它判断指标异常并触发相应处理流程,实现”看一眼图就能处置”的巡检自动化
适用人群:主要是使用DeepSeek生态的开发者、需要构建多模态Agent的技术团队,以及希望把截图类工作流自动化的效率型用户。
如何使用DeepSeek-V4-Flash-Vision-Exp
- 一键启动:执行
npx @deepseek-ai/dsh web自动下载并启动 Web UI(版本 0.1.1-rc.2),默认地址 http://127.0.0.1:3080 - 配置模型:Settings → Models 中输入 DeepSeek API Key(从 platform.deepseek.com 获取),选择工作区后开始对话
- 视觉交互:在对话中发送图片,模型通过 Files API 上传后理解内容,支持”分析截图并给建议”等多模态指令
- Plan 模式:/plan 进入规划模式;支持 Agent Teams 多智能体协作与 MCP 外部工具接入
DeepSeek Harness 的 Web UI 是主要入门路径,启动后自动在浏览器中打开。开发者也可通过 Python SDK 进行编程式调用,实现批量任务自动化。建议关注官方 Discord 社区与 GitHub Discussions 获取最新更新与社区支持。
DeepSeek-V4-Flash-Vision-Exp开源情况与价格说明
DeepSeek Harness本身为开源工具链,视觉模型体验版随版本更新免费开放,开发者无需为启用视觉输入支付额外费用。模型推理仍依托DeepSeek平台侧能力,具体配额与计费以官方当时公布的政策为准,工具链层面不设付费门槛。
DeepSeek-V4-Flash-Vision-Exp常见问题
DeepSeek-V4-Flash-Vision-Exp是独立发布的模型吗?
不是。它是随DeepSeek Harness 0.1.1-rc.1版本一同推出的视觉模型体验版,需通过升级工具链来使用。
升级前需要做什么准备?
确保本地Node.js与npm环境正常,已有DeepSeek Harness使用基础即可,升级过程与其他npm包一致。
它与网页端的识图功能有什么区别?
网页端识图面向普通对话场景,而该体验版把视觉能力整合进命令行工具链,供Agent在自动化流程中直接调用图像输入。
旧版本Harness能用图片输入吗?
v0.1.0-rc.8起已支持原生图片请求与图文混合指令,建议直接升级到0.1.1-rc.1以获得完整视觉模型体验。
适合非开发者使用吗?
当前版本主要面向开发者与Agent构建者,普通用户可先在DeepSeek网页端体验识图能力。
浙公网安备33010202004812号