DeepSeek发布实验性Flash视觉模型
The Decoder··作者 Matthias Bastian
关键信息
该模型支持JPEG、PNG、GIF和WebP等图片格式,并会根据文件实际内容而不是文件名或声明的MIME类型来识别格式。DeepSeek还表示,每张图片会被归一化到大约800×800像素,单张图片最多消耗384个token,且API单次请求最多可包含600张图片。
资讯摘要
DeepSeek推出了V4-Flash-Vision-Exp,这是一款实验性的多模态模型,在DeepSeek-V4-Flash的基础上增加了图像处理能力。公司表示,这个版本在保留基础文本模型推理能力和世界知识表现的同时,又加入了视觉理解。DeepSeek称,这个视觉版本在其内部多模态智能体基准测试中表现非常接近Opus 4.8。公司将这款模型定位为面向智能体场景,而不仅仅是通用聊天用途。它被设计为可配合不同的智能体框架使用,并能够描述图片、从截图中提取文字、分析图表。API文档说明它支持JPEG、PNG、GIF和WebP格式,而且会根据上传文件的真实内容识别格式,而不是依赖文件名或声明的MIME类型。
DeepSeek还表示,该模型兼容OpenAI的Chat Completions和Responses API,以及Anthropic的Messages端点,同时Harness框架0.1.1版本已开箱支持该模型。开发者可以通过Base64、最大32 MiB的公开URL,或者新的免费Files API上传图片,后者单文件上限为64 MiB。可选的detail参数可以把图片降到512×512以节省token,而模型会根据长宽比自动把图片归一化到大约800×800。公司称,单次请求最多可包含600张图片,但当请求中的图片数量达到15张或更多时,单边最长尺寸会从8192像素降到4096像素。图片只能放在用户消息中,计费则沿用V4-Flash的价格。

资讯正文
Deepseek 发布实验性 Flash 视觉模型,在 agent 基准测试上可与 Opus 4.8 匹敌
中国 AI 公司 Deepseek 发布了 V4-Flash-Vision-Exp,这是一款实验性的多模态模型,在其文本能力之外增加了图像理解能力。根据 Deepseek 自身的基准测试,这款模型在 agent 任务上的表现几乎与 Opus 4.8 持平。
Deepseek 表示,Deepseek-V4-Flash-Vision-Exp 在保留基础模型在推理和世界知识方面文本性能的同时,加入了图像处理能力。在该公司的内部多模态 agent 基准测试中,这一视觉版本的得分接近 Opus 4.8。
Deepseek 旨在面向视觉 agent 工作流
Deepseek 正在将这款模型定位于基于 agent 的应用场景。它被设计为可与不同的 agent 框架协同工作,并将视觉理解与工具使用结合起来。在实际使用中,它可以描述图像、从截图中提取文本,并分析图表。根据 API 文档,它支持 JPEG、PNG、GIF 和 WebP,并会根据实际文件内容而不是文件名或声明的 MIME 类型来识别格式。
该模型可与 OpenAI 的 Chat Completions 和 Responses API 以及 Anthropic 的 Messages 端点配合使用。Deepseek 还发布了其 Harness 框架的 0.1.1 版本,该版本可开箱即用地支持新模型。
定价与图像限制
向模型发送图像有三种方式。开发者可以直接使用 Base64 编码嵌入图像,指定可公开访问的 URL(上限 32 MiB),或者使用新的免费 Files API。Files API 允许你上传一次文件,并在多个请求中通过 ID 引用它,单文件大小上限为 64 MiB。
可选的“detail”字段会将图像缩小到 512 x 512 像素,在不需要精细视觉细节时可节省 token。模型在处理前会根据宽高比自动将图像标准化到大约 800 x 800 像素。无论原始分辨率如何,每张图像最多只计费 384 个 token。价格遵循 V4-Flash 的费率。
单次请求最多可包含 600 张图像。边长上限为每边 8,192 像素,但当一次请求包含 15 张或更多图像时,这一上限会降至 4,096 像素。图像只能放在用户消息中。
来源与参考
收录于 2026-08-22