大家好,我是程序员天天困。
8 月 21 号晚上五点多,我刷到 DeepSeek 官方公众号的推送——新模型 V4-Flash-Vision-Exp 上线,模型 ID 是 deepseek-v4-flash-vision-exp,多模态 API 服务直接开了。
说真的,V4-Flash 和 V4-Pro 的纯文本能力已经很猛了,但之前 Agent 一碰到截图、设计稿、图表就抓瞎,尤其是让它对着设计稿写前端 UI 这件事——它看不见图,还原度全靠你把样式手动描述一遍,效果怎么都差口气,只能再接个第三方识图模型曲线救国。这次官方算是直接把眼睛给装上了。
这篇文章不讲废话,我把官方文档扒了一遍,整理出 Harness 的接入步骤和三组可以直接照跑的图片测试任务,从接入方式、跑分解读到一张图烧多少钱,给你算明白。收藏一下,等你真要接的时候照着跑就行。
一、刚上线的 V4-Flash-Vision-Exp 到底是什么
V4-Flash-Vision-Exp:DeepSeek 于 2026 年 8 月 21 日上线的实验性多模态视觉理解模型,模型 ID 为 deepseek-v4-flash-vision-exp,支持图文混合输入,定位是在 V4-Flash 基础上解锁视觉能力的实验版本。你可以把它理解成"V4-Flash 长出了眼睛",大脑还是那个大脑,只是现在能看图了。

先说三个关键事实,省得被二手文章带偏:
- 它是实验模型。名字里的 "Exp" 就是 Experimental 的意思,API 文档明确标注实验性质,后续能力和定价都可能调整。
- 纯文本能力没有缩水。官方在更新日志里写明——在 Agent、推理、世界知识等纯文本任务上,Vision-Exp 与 V4-Flash 正式版持平。这点很重要,多模态不是拿文本能力换来的。
- 上下文还是 1M,输出最大 384K。并发限制 2500,和 V4-Flash 同档位。换句话说,除了能吃图片,其他规格基本一致。
| 对比项 | V4-Flash | V4-Flash-Vision-Exp |
|---|---|---|
| 文本能力 | 正式版基线 | 与正式版持平 |
| 图片输入 | 不支持 | 支持(单图最多 384 token) |
| 上下文长度 | 1M | 1M |
| 最大输出 | 384K | 384K |
| FIM 补全 | 仅非思考模式 | 不支持 |
| 模型性质 | 正式版 | 实验版(Exp) |
可能有人会问:为什么不直接叫 V4-Vision,非要带个 Flash 和 Exp?
Flash 说明它走的是 V4-Flash 这条快速高性价比路线,不是 V4-Pro 那条顶配线;Exp 说明这是第一版实验 release,接口和能力可能还会变。DeepSeek 的命名习惯一直这样——带 Exp 的就是让你先试,稳定了再转正。

二、跑分解读:接近 Opus-4.8 到底是怎么个接近法
官方在更新日志里列了 9 项分数(来源:DeepSeek API 更新日志,2026-08-21)。其中 Code Agent 文本任务统一用 DeepSeek Harness 极简模式、max 档位、temperature=1.0、topp=0.95 跑;官方脚注同时说明 ApexBench、Agents' Last Exam 含多模态元素,纯文本的 V4-Flash 跑这两个榜单时会忽略图片。
具体分数如下:
| Benchmark | V4-Flash-Vision-Exp 分数 |
|---|---|
| Terminal Bench 2.1 | 83.9 |
| NL2Repo | 57.7 |
| DeepSWE | 59.3 |
| DSBench-Hard | 63.6 |
| ApexBench (Pass@1) | 36.5 |
| Agents' Last Exam | 27.3 |
| Chartography (p0.95) | 64.3 |
| ZeroBench (Pass@5) | 35.0 |
| AutomationBench (Public) | 25.7 |
所以官方说的"大幅跃升",主要就体现在 ApexBench、Agents' Last Exam 这类需要看图的 Agent 任务上——纯文本版只能忽略图片硬答,Vision-Exp 是真的看图再作答。
我的判断是:"接近 Opus-4.8" 是官方在多模态 Agent 这个特定维度上的措辞,不等于整体能力追平。纯文本、长链路推理这些维度,官方没给对比数据,咱们也别自己加戏。跑分是参考,真要选型还是得拿自己的业务 prompt 跑一遍。

三、三种 API 接入方式,三分钟跑通第一张图
视觉模型支持三种 API 格式:OpenAI 的 Chat Completions 和 Responses,以及 Anthropic 的 Messages(走 /anthropic 端点)。图片传入也有三种方式:base64 内联、外部 URL、Files API。下面我挑最常用的 Chat Completions 给你演示。
1)base64 内联(适合小图、快速测试)
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-flash-vision-exp",
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "这张截图里报了什么错?怎么修?"},
{"type": "image_url", "image_url": {"url": "data:image/png;base64,<BASE64_DATA>"}}
]
}
]
}'
base64 的好处是不依赖外部图床,但请求体体积会膨胀约 33%,大图不建议这么传。
2)外部 URL(生产环境推荐)
from openai import OpenAI
client = OpenAI(api_key="<你的Key>", base_url="https://api.deepseek.com")
resp = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "描述这张图片的内容"},
{"type": "image_url",
"image_url": {"url": "https://example.com/screenshot.png"}}
]
}]
)
print(resp.choices[0].message.content)
URL 方式最省事,但要保证 DeepSeek 的服务器能访问到你的图片地址,内网图片记得先转公网或用第三种方式。
3)Files API 引用(同一张图多次请求时最省带宽)
Files API:DeepSeek 同步开放的文件上传接口,免费使用。上传图片后拿到 file_id,后续请求直接引用即可,同一张图在多个请求里不用重复传 base64,省请求带宽;配合硬盘缓存命中,重复请求的输入 token 也能打折。
file = client.files.create(file=open("screenshot.png","rb"), purpose="user_data")
resp = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "这张图里有什么?"},
{"type": "file", "file_id": file.id}
]
}]
)
返回的 JSON 里 choices[0].message.content 字段就是模型对图片的描述。

四、用 DeepSeek Harness 实测多模态 Agent
光调 API 不过瘾,真正有意思的是把它接进 DeepSeek Harness(命令名 dsh)当 Agent 用。
DeepSeek Harness:DeepSeek 官方开源的 Agent 运行时(目前处于 developer preview 阶段),把模型、工具、工作区、权限、会话记忆和任务循环打包在一起。模型负责思考,Harness 负责把思考接到文件系统、终端、浏览器上——模型是大脑,Harness 是身体。之前我写过一篇《DeepSeek Harness 终于来了:开源,一切皆插件》,从安装到插件机制都拆过一遍,还没上手的同学可以先看那篇,这里只讲怎么把视觉模型接进去。
之前在 Harness 里用纯文本版 V4-Flash 跑代码任务,碰到图片就抓瞎,社区还出了 dsh-vision-toolkit 这类第三方插件,靠外挂识图模型把图片转成文字再喂回去。现在 Vision-Exp 原生支持图片输入,这层弯路可以省了。
安装、启动、选模型
Node.js 环境下一行命令拉起(首次会自动下载依赖):
npx @deepseek-ai/dsh web
浏览器打开 http://127.0.0.1:3080,先在 设置 → 模型 里填好 DeepSeek API Key。模型刚上线,如果下拉列表里还没刷出 deepseek-v4-flash-vision-exp,手动在自定义模型里填一下这个 model ID 即可——dsh 是 BYO Model(自带模型端点),不会锁死内置列表。
选好模型和思考档位(建议先用 high,复杂任务再上 max),就能直接贴图对话:

三组值得照跑的图片任务
与其我替它吹牛,不如给你三条 prompt,你自己贴一张图进去试,结果一目了然:
1)报错截图诊断。贴一张终端或浏览器控制台的报错图,配文:
这张截图里的报错是什么原因?给出修复步骤,如果需要改配置或代码,直接在工作区里生成对应文件。
重点观察:它能不能准确读出报错关键字(而不是泛泛地猜),以及会不会真的动手改文件——后者是 Harness 作为 Agent 和普通识图聊天的区别。
2)设计稿/页面截图转前端。这也呼应开头说的痛点——贴一张 UI 设计稿或竞品页面截图:
照这张图还原一个单页 HTML,用内联 CSS,像素和配色尽量贴近,写完在浏览器里能直接打开。
这是纯文本模型之前最难受的活,正好测它的视觉还原度。
3)图表/数据截图解读。贴一张带柱状图、折线或表格的截图,让它提取数据并给结论:
把这张图里的数据整理成表格,并用三句话总结趋势。
密集文字和坐标轴是视觉模型容易翻车的地方,专门测一下细节识别。
踩个坑:传图报"仅支持 PNG、JPG、WebP、GIF 格式"
我自己实测时传了两张图,一张 4MB 多、一张 2MB 多,都直接被拒,报错写的是"仅支持 PNG、JPG、WebP、GIF 格式的图片"。但这两张图的扩展名明明在支持列表里。翻了官方文档才注意到一句关键的话:图片格式由文件实际内容判断,不是看文件名或声明的 MIME 类型。也就是说,iPhone 拍的 HEIC 照片哪怕改成 .jpg 后缀照样被拒,从某些工具导出的图实际编码不对也一样。先用看图软件另存为真正的 JPG/PNG 再传就行。另外体积不是问题——外部图片单图上限 32 MiB,走 Files API 还能到 64 MiB,4MB 远没到。


需要说明的是,上面三组 prompt 是给你的测试设计,模型实际识别效果还得你亲手跑一遍。官方既然挂了 Exp 后缀,就意味着它还在调——建议重点留意复杂设计稿的细节还原和多轮长任务的稳定性,跑完欢迎回评论区告诉我结果。


五、算笔账:一张图片到底烧多少钱
视觉模型最让人关心的就是"看图贵不贵"。直接上官方价格:
| 计费项 | 高峰时段 | 空闲时段 |
|---|---|---|
| 输入(缓存未命中) | 3.0 元/百万 token | 1.5 元/百万 token |
| 输入(缓存命中) | 0.10 元/百万 token | 0.05 元/百万 token |
| 输出 | 9.0 元/百万 token | 4.5 元/百万 token |
图片按尺寸换算成 token,单张最多 384 token。按最极端的情况算——一张大图吃满 384 token、缓存未命中、高峰时段:
384 ÷ 1,000,000 × 3.0 ≈ 0.00115 元/张。
也就是一千张图一块出头。空闲时段还能再打对折。这还是没算缓存命中的情况,如果你用 Files API 传同一张图反复问,缓存命中后单图输入成本直接降到 0.000038 元这个量级。
对个人开发者来说,这个定价基本等于白送;做批量图片审核、图表分析这类 ToB 场景,成本也完全打得住。
光算理论数没什么体感,我把这次实测识图的真实账单晒出来,四轮对话下来花了多少大家自己看:

图片转成 token 后是和文本一起算在输入费用里的,对比之前调海外多模态模型"看一张图心在滴血"的价格,这个账单基本可以随便用。
不过有个坑要提醒:输出 token 比输入贵三倍,所以别让它看图写小作文,prompt 尽量限定输出格式和长度,不然钱都花在它"长篇大论"上。
六、谁现在就该用,谁再等等
我的建议很直接:
现在就可以上手的人:
- 用 DeepSeek Harness 做 Coding Agent,经常需要贴截图、看设计稿、分析报错图的
- 做内部工具原型,需要图文理解但预算敏感的
- 想低成本试水多模态 Agent,对比各家视觉模型效果的
先观望的人:
- 要上生产环境、对稳定性要求高的——Exp 后缀就是明牌,接口和能力可能变
- 依赖 FIM 补全场景的——Vision-Exp 目前不支持 FIM
- 需要处理超高分辨率图片或密集文档 OCR 的——单图 384 token 的上限对超大图可能不够,建议自己先拿真实样本测
说白了,V4-Flash-Vision-Exp 补上的是 DeepSeek 多模态版图里最急的那块短板,而且价格给得很有诚意。但"实验版"三个字不是白写的——拿来玩、做原型、跑内部工具完全没问题,真要扛线上流量,等正式版标记去掉再说。
我是程序员天天困,持续分享编程干货。觉得有用的话记得点赞收藏和关注~也欢迎在评论区聊聊:你用 V4-Flash-Vision-Exp 跑了什么图片任务,体验怎么样?