DeepSeek V4-Flash Vision 视觉版指南 2026:官方首个看图 API,一张图最多 384 token
海外梯子

2026 年 8 月 21 日下午,DeepSeek 官方 API 文档里悄悄多了一个新名字:deepseek-v4-flash-vision-exp。V4 系列第一款原生支持图片输入的视觉模型就这么上线了,没有发布会、没有预告。一周前 DeepSeek 刚开源 Harness 智能体框架,GitHub 讨论区里”怎么让 DeepSeek 看图”还是高频问题,现在官方自己把这块拼图补上了。

太长不看版

维度结论
模型名deepseek-v4-flash-vision-exp(Exp = 实验版)
上线时间2026-08-21,V4 系列首款原生视觉模型
文本能力与 V4-Flash 正式版持平,看图不降智
视觉能力多模态 Agent 基准接近 Opus-4.8
图片计费一张图最多 384 token,价格与 V4-Flash 一致
传图方式Base64 内联 / 外部 URL / Files API 三种
接口兼容OpenAI 格式 + Anthropic 格式 + Responses API
适合谁要做"能看图的 Agent"的开发者,成本敏感的项目

一句话:DeepSeek 从纯文本模型正式迈进了多模态 Agent 底座,而且价格延续了 Flash 系列的性价比路线。

背景:DeepSeek 终于”睁眼”了

要理解这个模型为什么重要,得先看它上线前一周发生了什么。

8 月 13 日,DeepSeek 开源了 Harness(简称 dsh)——一个”一切皆插件”的智能体框架,模型负责思考、框架负责干活,能调终端、文件、代码和外部工具。热度爆炸,上线 12 小时 star 破 5 万。

但一个尴尬的问题马上暴露出来:DeepSeek 自己的模型看不见图。 V4 Flash 和 V4 Pro 在模型目录里都被声明为纯文本模型,输入模态只有 text。开发者往 Harness 里传截图,直接返回一行报错:MODEL_DOES_NOT_SUPPORT_IMAGES

于是社区开始自己给 DeepSeek “装眼睛”。一种方案是在前面接一个 Qwen-VL 之类的视觉模型,先把图转成文字描述再交给 DeepSeek 推理;另一种方案是改 Harness,让图片先存到工作区再由视觉插件读取。几天之内 GitHub 上冒出好几个 vision bridge 插件。

结果一周后,官方出手了。deepseek-v4-flash-vision-exp 上线,V4 系列第一次原生支持图片输入,Agent 终于能”自己看图、自己理解、自己推理、自己调工具”。

核心能力:看图不降智

视觉模型最容易踩的坑是”为了看图牺牲文本”。V4-Flash-Vision-Exp 没有这个毛病。

官方明确说:在 Agent、推理、世界知识等纯文本基准上,Vision-Exp 与 V4-Flash 正式版持平。它不是特化模型,而是在 Flash 基础上叠加了视觉理解。

视觉部分提升是结构性的。官方给出的多模态 Agent 基准数据:

基准V4-Flash-Vision-ExpV4-FlashOpus-4.8
Terminal Bench 2.183.982.785.0
Toolathlon-Verified75.970.376.2
DeepSWE59.354.458.0
NL2Repo57.754.269.7

Terminal Bench、DeepSWE 这些任务以前是纯文本 Agent 的天下,现在加入视觉输入后依然稳在第一梯队,DeepSWE 甚至超过了 Opus-4.8(59.3 vs 58.0)。官方给的总评是”多模态 Agent 能力已接近 Opus-4.8”,考虑到价格差,这句话含金量不低。

价格:一张图最多 384 token

计费规则是这篇最值得展开的部分,因为它直接决定了你的账单。

图片会按尺寸换算成 token,与文本 token 一起计费,价格和 V4-Flash 完全一致——输入 $0.14/百万 tokens(缓存命中 $0.0028),输出 $0.28/百万 tokens。没有额外的视觉处理溢价。

进模型前每张图片会被自动缩放:

  • 总像素小于约 384×384 的图片保持长宽比放大
  • 更大的图片保持长宽比缩小,缩小后总像素约相当于 800×800

所以每张图片消耗的 token 有硬上限:384 个。2000×2000 和 5000×5000 的图,处理后 token 数相同。

对比一下隔壁:GPT 和 Claude 处理同等分辨率的图片通常消耗 800 到 1100 个 token。同一张图,DeepSeek 的 token 开销不到竞品一半。 这个数字背后是 DeepSeek 此前公布的 “Thinking with Visual Primitives” 框架——把视觉元素压缩成空间坐标式的原语,而不是把整张图拆成密密麻麻的图像 patch。

多张图独立计费,每张都按同一规则算,没有额外计算方式。

接入教程:三种传图方式

上手很简单:模型参数设成 deepseek-v4-flash-vision-exp,base_url 用 https://api.deepseek.com,图片以 content 块数组传入,标准 OpenAI 兼容格式。

1. Base64 内联(本地文件最简单)

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
import base64
from openai import OpenAI

client = OpenAI(api_key="你的API密钥", base_url="https://api.deepseek.com")

with open("image.jpg", "rb") as f:
b64 = base64.b64encode(f.read()).decode("utf-8")

response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "这张图片里有什么?"},
{"type": "image_url", "image_url": {"url": f"data:image/jpeg;base64,{b64}"}},
],
}
],
)
print(response.choices[0].message.content)

2. 外部图片 URL(图片已在网上)

1
2
3
4
5
6
7
8
9
10
11
12
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "描述一下这张图片。"},
{"type": "image_url", "image_url": {"url": "https://example.com/image.jpg"}},
],
}
],
)

URL 最长 8192 个字符,图片最大 32 MiB,需在 60 秒内下载完成。

3. Files API(多请求复用同一张图)

上传一次拿 file_id,之后反复引用,不用重复上传:

1
2
3
4
5
6
7
8
9
10
11
12
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "这张图片里有什么?"},
{"type": "file", "file_id": "file-api-xxxxxxxxxxxxxxxx"},
],
}
],
)

图片很大(超过 32 MiB)或者请求体接近 48 MiB 限制时,Files API 是唯一解——它支持单图最大 64 MiB。

Anthropic 兼容格式

用 Claude SDK 的,base_url 换成 https://api.deepseek.com/anthropic 即可,图片用 image 块:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
import anthropic

client = anthropic.Anthropic() # ANTHROPIC_BASE_URL=https://api.deepseek.com/anthropic
message = client.messages.create(
model="deepseek-v4-flash-vision-exp",
max_tokens=1024,
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "这张图片里有什么?"},
{
"type": "image",
"source": {
"type": "base64",
"media_type": "image/jpeg",
"data": "<BASE64_DATA>",
},
},
],
}
],
)

detail 参数:控制精度和省钱

image_url 输入可以加 detail 字段控制处理方式:

取值行为
low缩放至 512×512,不需要精细细节时更快更省 token
high / original保留原图
auto自动选择,当前等价于 original

批量 OCR、快速识别场景用 low 能再省一笔;需要读小字、细线条时用 original

限制清单(写代码前先看)

限制项数值
支持格式JPEG、PNG、GIF、WebP
请求体大小48 MiB
单图最大(base64 / URL)32 MiB
单图最大(Files API)64 MiB
单请求最大图片数600 张
图片最大尺寸单边 8192 像素(≥15 张图时降为 4096)

两个硬性规则要记住:图片只能出现在 user 消息里,system/assistant 消息带图直接 400;只有 deepseek-v4-flash-vision-exp 这个模型接受图片,其他模型传图也会 400。

适合谁用

人群推荐理由
Agent 开发者终于不用再外接视觉模型做 bridge,原生看图让 Harness 类框架闭环
文档/流程自动化界面截图解析、报错截图识别、图表数据提取一条龙
前端工程师设计稿截图转描述、UI 重构参考,图文联合输入
成本敏感的个人开发者一张图最多 384 token,价格碾压同级别视觉模型

官方演示的案例是生成商业定制 PPT——给一组图片和需求,直接产出完整方案。这类”看图干活”的场景会越来越多。

FAQ

Q:Exp 后缀是什么意思?能用于生产吗? A:实验版(Experimental)。官方提示快速迭代中、可能有破坏性变更,生产环境建议先小流量验证再上。

Q:图片怎么计费? A:按尺寸换算成 token,每张最多 384 个,与文本一起按 V4-Flash 价格计费,无视觉溢价。

Q:纯文本任务用这个模型会变贵吗? A:不会。纯文本能力与 V4-Flash 持平,价格也一样。但纯文本场景直接用 V4-Flash 更省心,Vision 版留给需要看图的。

Q:图片能放 system 消息里吗? A:不能。图片只支持 user 消息,否则返回 400。

Q:和 Qwen-VL 这类视觉模型比怎么选? A:如果已经在用 DeepSeek 生态(API、Harness),Vision-Exp 免去桥接层、格式统一,迁移成本最低;对比竞品 token 开销不到一半。

Q:响应速度怎么样? A:与 V4-Flash 同规格,实际速度取决于图片大小和 detail 等级,low 模式明显更快。

总结

V4-Flash-Vision-Exp 是 DeepSeek 补齐多模态闭环的关键一步:模型能看图了,Agent 才算真正”睁眼”。价格延续 Flash 系列的高性价比——一张图最多 384 token、文本能力不降级、多模态 Agent 逼近 Opus-4.8,对开发者是实打实的低成本选项。Exp 后缀提醒你它还在快速迭代,但方向已经很明确:DeepSeek 的下半场,是能看、能想、能干活的多模态 Agent。

想第一时间用上这类新模型、跑通自己的 Agent 项目,稳定的跨境网络加速服务是基础配置。下面是几个实测稳定的国际网络优化方案:

服务商特点适合
光速云IEPL 专线 + IEPL专线 多路复用,100+ 节点主力首选,开发者重度使用
飞猫云老牌稳定,IEPL 专线长期稳定党
微风网络低价入门,¥6.99/月新用户尝鲜
飞猫云IEPL 专线,性价比高进阶用户

延伸阅读:DeepSeek V4-Flash 正式版指南(纯文本 API 接入)DeepSeek Harness 上手指南(Agent 框架)DeepSeek 入门到精通(注册与基础用法)