V4-Flash-Vision-Exp 上线,Harness 多模态接入实测

1 阅读11分钟

大家好,我是程序员天天困。

8 月 21 号晚上五点多,我刷到 DeepSeek 官方公众号的推送——新模型 V4-Flash-Vision-Exp 上线,模型 ID 是 deepseek-v4-flash-vision-exp,多模态 API 服务直接开了。

说真的,V4-Flash 和 V4-Pro 的纯文本能力已经很猛了,但之前 Agent 一碰到截图、设计稿、图表就抓瞎,尤其是让它对着设计稿写前端 UI 这件事——它看不见图,还原度全靠你把样式手动描述一遍,效果怎么都差口气,只能再接个第三方识图模型曲线救国。这次官方算是直接把眼睛给装上了。

这篇文章不讲废话,我把官方文档扒了一遍,整理出 Harness 的接入步骤和三组可以直接照跑的图片测试任务,从接入方式、跑分解读到一张图烧多少钱,给你算明白。收藏一下,等你真要接的时候照着跑就行。

一、刚上线的 V4-Flash-Vision-Exp 到底是什么

V4-Flash-Vision-Exp:DeepSeek 于 2026 年 8 月 21 日上线的实验性多模态视觉理解模型,模型 ID 为 deepseek-v4-flash-vision-exp,支持图文混合输入,定位是在 V4-Flash 基础上解锁视觉能力的实验版本。你可以把它理解成"V4-Flash 长出了眼睛",大脑还是那个大脑,只是现在能看图了。

先说三个关键事实,省得被二手文章带偏:

  1. 它是实验模型。名字里的 "Exp" 就是 Experimental 的意思,API 文档明确标注实验性质,后续能力和定价都可能调整。
  2. 纯文本能力没有缩水。官方在更新日志里写明——在 Agent、推理、世界知识等纯文本任务上,Vision-Exp 与 V4-Flash 正式版持平。这点很重要,多模态不是拿文本能力换来的。
  3. 上下文还是 1M,输出最大 384K。并发限制 2500,和 V4-Flash 同档位。换句话说,除了能吃图片,其他规格基本一致。
对比项V4-FlashV4-Flash-Vision-Exp
文本能力正式版基线与正式版持平
图片输入不支持支持(单图最多 384 token)
上下文长度1M1M
最大输出384K384K
FIM 补全仅非思考模式不支持
模型性质正式版实验版(Exp)

可能有人会问:为什么不直接叫 V4-Vision,非要带个 Flash 和 Exp?

Flash 说明它走的是 V4-Flash 这条快速高性价比路线,不是 V4-Pro 那条顶配线;Exp 说明这是第一版实验 release,接口和能力可能还会变。DeepSeek 的命名习惯一直这样——带 Exp 的就是让你先试,稳定了再转正。

二、跑分解读:接近 Opus-4.8 到底是怎么个接近法

官方在更新日志里列了 9 项分数(来源:DeepSeek API 更新日志,2026-08-21)。其中 Code Agent 文本任务统一用 DeepSeek Harness 极简模式、max 档位、temperature=1.0、topp=0.95 跑;官方脚注同时说明 ApexBench、Agents' Last Exam 含多模态元素,纯文本的 V4-Flash 跑这两个榜单时会忽略图片。

具体分数如下:

BenchmarkV4-Flash-Vision-Exp 分数
Terminal Bench 2.183.9
NL2Repo57.7
DeepSWE59.3
DSBench-Hard63.6
ApexBench (Pass@1)36.5
Agents' Last Exam27.3
Chartography (p0.95)64.3
ZeroBench (Pass@5)35.0
AutomationBench (Public)25.7

所以官方说的"大幅跃升",主要就体现在 ApexBench、Agents' Last Exam 这类需要看图的 Agent 任务上——纯文本版只能忽略图片硬答,Vision-Exp 是真的看图再作答。

我的判断是:"接近 Opus-4.8" 是官方在多模态 Agent 这个特定维度上的措辞,不等于整体能力追平。纯文本、长链路推理这些维度,官方没给对比数据,咱们也别自己加戏。跑分是参考,真要选型还是得拿自己的业务 prompt 跑一遍。

三、三种 API 接入方式,三分钟跑通第一张图

视觉模型支持三种 API 格式:OpenAI 的 Chat Completions 和 Responses,以及 Anthropic 的 Messages(走 /anthropic 端点)。图片传入也有三种方式:base64 内联、外部 URL、Files API。下面我挑最常用的 Chat Completions 给你演示。

1)base64 内联(适合小图、快速测试)

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -d '{
    "model": "deepseek-v4-flash-vision-exp",
    "messages": [
      {
        "role": "user",
        "content": [
          {"type": "text", "text": "这张截图里报了什么错?怎么修?"},
          {"type": "image_url", "image_url": {"url": "data:image/png;base64,<BASE64_DATA>"}}
        ]
      }
    ]
  }'

base64 的好处是不依赖外部图床,但请求体体积会膨胀约 33%,大图不建议这么传。

2)外部 URL(生产环境推荐)

from openai import OpenAI
client = OpenAI(api_key="<你的Key>", base_url="https://api.deepseek.com")

resp = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "描述这张图片的内容"},
            {"type": "image_url",
             "image_url": {"url": "https://example.com/screenshot.png"}}
        ]
    }]
)
print(resp.choices[0].message.content)

URL 方式最省事,但要保证 DeepSeek 的服务器能访问到你的图片地址,内网图片记得先转公网或用第三种方式。

3)Files API 引用(同一张图多次请求时最省带宽)

Files API:DeepSeek 同步开放的文件上传接口,免费使用。上传图片后拿到 file_id,后续请求直接引用即可,同一张图在多个请求里不用重复传 base64,省请求带宽;配合硬盘缓存命中,重复请求的输入 token 也能打折。

file = client.files.create(file=open("screenshot.png","rb"), purpose="user_data")
resp = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "这张图里有什么?"},
            {"type": "file", "file_id": file.id}
        ]
    }]
)

返回的 JSON 里 choices[0].message.content 字段就是模型对图片的描述。

四、用 DeepSeek Harness 实测多模态 Agent

光调 API 不过瘾,真正有意思的是把它接进 DeepSeek Harness(命令名 dsh)当 Agent 用。

DeepSeek Harness:DeepSeek 官方开源的 Agent 运行时(目前处于 developer preview 阶段),把模型、工具、工作区、权限、会话记忆和任务循环打包在一起。模型负责思考,Harness 负责把思考接到文件系统、终端、浏览器上——模型是大脑,Harness 是身体。之前我写过一篇《DeepSeek Harness 终于来了:开源,一切皆插件》,从安装到插件机制都拆过一遍,还没上手的同学可以先看那篇,这里只讲怎么把视觉模型接进去。

之前在 Harness 里用纯文本版 V4-Flash 跑代码任务,碰到图片就抓瞎,社区还出了 dsh-vision-toolkit 这类第三方插件,靠外挂识图模型把图片转成文字再喂回去。现在 Vision-Exp 原生支持图片输入,这层弯路可以省了。

安装、启动、选模型

Node.js 环境下一行命令拉起(首次会自动下载依赖):

npx @deepseek-ai/dsh web

浏览器打开 http://127.0.0.1:3080,先在 设置 → 模型 里填好 DeepSeek API Key。模型刚上线,如果下拉列表里还没刷出 deepseek-v4-flash-vision-exp,手动在自定义模型里填一下这个 model ID 即可——dsh 是 BYO Model(自带模型端点),不会锁死内置列表。

选好模型和思考档位(建议先用 high,复杂任务再上 max),就能直接贴图对话:

三组值得照跑的图片任务

与其我替它吹牛,不如给你三条 prompt,你自己贴一张图进去试,结果一目了然:

1)报错截图诊断。贴一张终端或浏览器控制台的报错图,配文:

这张截图里的报错是什么原因?给出修复步骤,如果需要改配置或代码,直接在工作区里生成对应文件。

重点观察:它能不能准确读出报错关键字(而不是泛泛地猜),以及会不会真的动手改文件——后者是 Harness 作为 Agent 和普通识图聊天的区别。

2)设计稿/页面截图转前端。这也呼应开头说的痛点——贴一张 UI 设计稿或竞品页面截图:

照这张图还原一个单页 HTML,用内联 CSS,像素和配色尽量贴近,写完在浏览器里能直接打开。

这是纯文本模型之前最难受的活,正好测它的视觉还原度。

3)图表/数据截图解读。贴一张带柱状图、折线或表格的截图,让它提取数据并给结论:

把这张图里的数据整理成表格,并用三句话总结趋势。

密集文字和坐标轴是视觉模型容易翻车的地方,专门测一下细节识别。

踩个坑:传图报"仅支持 PNG、JPG、WebP、GIF 格式"

我自己实测时传了两张图,一张 4MB 多、一张 2MB 多,都直接被拒,报错写的是"仅支持 PNG、JPG、WebP、GIF 格式的图片"。但这两张图的扩展名明明在支持列表里。翻了官方文档才注意到一句关键的话:图片格式由文件实际内容判断,不是看文件名或声明的 MIME 类型。也就是说,iPhone 拍的 HEIC 照片哪怕改成 .jpg 后缀照样被拒,从某些工具导出的图实际编码不对也一样。先用看图软件另存为真正的 JPG/PNG 再传就行。另外体积不是问题——外部图片单图上限 32 MiB,走 Files API 还能到 64 MiB,4MB 远没到。

需要说明的是,上面三组 prompt 是给你的测试设计,模型实际识别效果还得你亲手跑一遍。官方既然挂了 Exp 后缀,就意味着它还在调——建议重点留意复杂设计稿的细节还原和多轮长任务的稳定性,跑完欢迎回评论区告诉我结果。

五、算笔账:一张图片到底烧多少钱

视觉模型最让人关心的就是"看图贵不贵"。直接上官方价格:

计费项高峰时段空闲时段
输入(缓存未命中)3.0 元/百万 token1.5 元/百万 token
输入(缓存命中)0.10 元/百万 token0.05 元/百万 token
输出9.0 元/百万 token4.5 元/百万 token

图片按尺寸换算成 token,单张最多 384 token。按最极端的情况算——一张大图吃满 384 token、缓存未命中、高峰时段:

384 ÷ 1,000,000 × 3.0 ≈ 0.00115 元/张

也就是一千张图一块出头。空闲时段还能再打对折。这还是没算缓存命中的情况,如果你用 Files API 传同一张图反复问,缓存命中后单图输入成本直接降到 0.000038 元这个量级。

对个人开发者来说,这个定价基本等于白送;做批量图片审核、图表分析这类 ToB 场景,成本也完全打得住。

光算理论数没什么体感,我把这次实测识图的真实账单晒出来,四轮对话下来花了多少大家自己看:

图片转成 token 后是和文本一起算在输入费用里的,对比之前调海外多模态模型"看一张图心在滴血"的价格,这个账单基本可以随便用。

不过有个坑要提醒:输出 token 比输入贵三倍,所以别让它看图写小作文,prompt 尽量限定输出格式和长度,不然钱都花在它"长篇大论"上。

六、谁现在就该用,谁再等等

我的建议很直接:

现在就可以上手的人

  • 用 DeepSeek Harness 做 Coding Agent,经常需要贴截图、看设计稿、分析报错图的
  • 做内部工具原型,需要图文理解但预算敏感的
  • 想低成本试水多模态 Agent,对比各家视觉模型效果的

先观望的人

  • 要上生产环境、对稳定性要求高的——Exp 后缀就是明牌,接口和能力可能变
  • 依赖 FIM 补全场景的——Vision-Exp 目前不支持 FIM
  • 需要处理超高分辨率图片或密集文档 OCR 的——单图 384 token 的上限对超大图可能不够,建议自己先拿真实样本测

说白了,V4-Flash-Vision-Exp 补上的是 DeepSeek 多模态版图里最急的那块短板,而且价格给得很有诚意。但"实验版"三个字不是白写的——拿来玩、做原型、跑内部工具完全没问题,真要扛线上流量,等正式版标记去掉再说。


我是程序员天天困,持续分享编程干货。觉得有用的话记得点赞收藏和关注~也欢迎在评论区聊聊:你用 V4-Flash-Vision-Exp 跑了什么图片任务,体验怎么样?