Skip to content
登录/注册

DeepSeek V4 Flash Vision Exp

deepseek-v4-flash-vision-exp

使用实验性 deepseek-v4-flash-vision-exp 模型执行混合图像和文本任务,例如屏幕截图检查、文档提取、图表分析和视觉代理。

上下文窗口1.0M
提供商DeepSeek
创建时间2026/08/24

在线体验

定价

同一模型能力,多条服务通道;按延迟、稳定性与成本灵活选择。

价格单位:$ / 1M tokens
指定服务通道:在请求体加入 provider 字段,例如 "provider": { "channel": "direct" }。可选 direct / stable / economical;不传则使用默认通道。

直连通道

官方直连链路,适合需要原生体验与完整上下文的请求。

输入输出缓存命中
0.44/M1.32/M0.01/M

介绍

输入
文本
输出
文本

DeepSeek V4 Flash Vision Exp API:给 Flash 装上眼睛的多模态实验模型

DeepSeek V4 Flash Vision Exp 是 DeepSeek 于 2026 年 8 月 21 日上线的实验性多模态模型,在 V4 Flash 的基础上加入了图像理解能力。文本能力——包括智能体、推理和世界知识——与 V4 Flash 完全持平,也就是说加视觉不牺牲原有文本表现

最值得关注的是它在多模态智能体评测上的跃升:整体表现逼近 Claude Opus 4.8,11 项基准中有 3 项反超。ApexBench(Pass@1)从纯文本 V4 Flash 的 26.2 跳到 36.5,Terminal Bench 2.1 达到 83.9(V4 Flash 为 82.7,Opus 4.8 为 85.0)——而它依然是那个 13B 激活参数的高效稀疏 MoE。

海鲸AI 通过 OpenAI 兼容接口提供 DeepSeek V4 Flash Vision Exp,支持图像输入、工具调用与流式输出。

获取 API 密钥 · 模型 ID:deepseek-v4-flash-vision-exp


为什么选择 DeepSeek V4 Flash Vision Exp

  • 多模态智能体逼近 Opus 4.8 —— 11 项基准中 3 项反超,价格却是 Flash 档位
  • 文本能力零损失 —— 智能体、推理、世界知识与 V4 Flash 持平
  • 单图最多 384 token —— 无论分辨率多高,图像计费封顶,成本可预期
  • 284B 总参数 / 13B 激活 —— 与 Flash 相同的高效稀疏 MoE
  • 100 万 token 上下文 —— 图文混排的长文档一次装下
  • 单请求最多 600 张图 —— 大批量图像任务不用拆请求

核心能力

01 多模态智能体

这是本次升级的核心。加入视觉后,模型可以在智能体流程中直接"看"截图、界面和图表来决定下一步动作,多模态智能体基准上的表现已经接近顶级闭源模型。

  • ApexBench(Pass@1)36.5,比纯文本 Flash 提升 10 分以上
  • Terminal Bench 2.1 达 83.9,超过纯文本 Flash
  • 截图理解驱动的自动化操作流程

02 图像理解与信息提取

支持图像描述、截图文字提取和图表分析三类核心视觉任务,覆盖日常多模态需求的主要场景。

  • 截图与扫描件的文字提取
  • 图表、示意图的结构化解读
  • 图文混排文档的综合理解

03 可控的图像成本

每张图像最多按 384 token 计费,与分辨率无关;还可以用 detail 字段进一步降低对细节要求不高的图像的 token 消耗。图像按 V4 Flash 档位计价。

  • 单图 token 上限 384,成本封顶
  • detail 字段按需降低消耗
  • 大批量图像处理的总成本可精确预估

04 灵活的图像输入方式

支持 JPEG、PNG、GIF、WebP 四种格式,按文件实际内容识别格式而非扩展名。可通过 Base64 内嵌、公网 URL(最大 32 MiB)或免费的 Files API(最大 64 MiB)传入——Files API 上传一次即可跨请求用 file_id 复用,省去重复传输。

  • Base64 / URL / Files API 三种传入方式
  • Files API 免费,支持跨请求复用
  • 单请求最多 600 张图,最长边 8192 像素(15 张以上时为 4096)

最佳使用场景

场景 说明
多模态智能体 看截图操作界面、读图表做决策的自动化流程
文档数字化 扫描件、截图的批量文字提取与结构化
图表分析 报表、示意图、技术图纸的解读
图文混排长文档 100 万 token 窗口内的多模态文档理解
大批量图像管线 单请求 600 张图 + 单图成本封顶,适合规模化处理
低成本视觉原型 用 Flash 档位价格验证多模态产品思路

DeepSeek V4 Flash Vision Exp 与 V4 Flash 的差异

能力 V4 Flash Vision Exp V4 Flash
模型 ID deepseek-v4-flash-vision-exp deepseek-v4-flash
输入模态 文本 + 图像 仅文本
文本能力 与 Flash 持平 基准
ApexBench(Pass@1) 36.5 26.2
Terminal Bench 2.1 83.9 82.7
总参数 / 激活参数 2840 亿 / 13B 2840 亿 / 13B
上下文窗口 100 万 token 100 万 token
最大输出 384K token 384K token
状态 实验版(Exp) 正式版

具体计费以页面上方的实时价格卡片为准。


常见问题

它和 V4 Flash 是什么关系? 它是 V4 Flash 的多模态实验版:同一个 284B/13B 稀疏 MoE 基座,文本能力持平,额外增加了图像输入。可以理解为"会看图的 Flash"。

多模态表现到底怎么样? 在多模态智能体基准上整体逼近 Claude Opus 4.8,11 项中有 3 项反超。代表性数据:ApexBench(Pass@1)36.5、Terminal Bench 2.1 83.9。

图像怎么计费? 每张图像最多折算 384 token,与分辨率无关,按 V4 Flash 档位计价。对细节要求不高的图像可以用 detail 字段进一步省 token。

图像输入有什么限制? 支持 JPEG、PNG、GIF、WebP;单请求最多 600 张;图像最长边 8192 像素(超过 15 张时降为 4096);URL 方式单文件最大 32 MiB,Files API 最大 64 MiB。图像在处理前会归一化到约 800×800 像素。

"Exp" 后缀意味着什么? 它是实验性版本,DeepSeek 用它验证多模态方向,接口和行为可能随正式版发布而调整。生产环境建议做好模型 ID 可配置,方便未来平滑切换到正式版。

上下文和输出上限? 100 万 token 上下文,最大输出 384K token,与 V4 Flash 相同。


为什么选择海鲸AI 使用 DeepSeek V4 Flash Vision Exp API

  • 免自建集群 —— 无需自备 GPU 资源即可调用
  • OpenAI 兼容接口 —— 现有多模态代码几乎零改动接入
  • 同账户对比闭源模型 —— 与 Claude、GPT 的视觉能力直接横评
  • 人民币结算 —— 国产模型按人民币计价

API

API 接入信息

Model ID在推理接口中指定模型
deepseek-v4-flash-vision-exp
API Key推理接口的 Bearer Token(鉴权令牌)
Base URL兼容 OpenAI 协议 · /chat/completions
OpenAIhttps://api.seawhaleai.com/v2/
provider 可选指定服务通道,不传则由系统选择默认通道
"provider": { "channel": "direct" }

deepseek-v4-flash-vision-exp 接入示例

海鲸AI 兼容 OpenAI 接口协议,可直接使用 OpenAI SDK 或 HTTP 请求接入,默认开启流式输出。

关于 provider 参数(可选,海鲸AI 扩展字段):同一模型通常有多条服务通道,价格与稳定性略有差异。在请求体中加入 provider 字段即可指定通道;不传该字段时由系统自动选择默认通道,不影响正常调用。

provider 并非 OpenAI 官方协议中的字段,而是海鲸AI 的扩展参数,仅在本平台生效。OpenAI SDK 允许透传此类自定义字段,用法见下方示例。

取值通道适用场景
direct直连通道官方直连链路,追求原生体验与完整上下文
stable优选通道兼顾可用性、速度,适合日常生产调用
economical特惠通道成本优先,适合批量处理与价格敏感业务

具体通道与对应价格以上方「定价」为准(各模型开通的通道可能不同)。补充说明:

  • 写法:"provider": { "channel": "direct" }
  • 若指定的通道该模型未开通,会自动回退到默认通道并正常返回,不会报错。
  • 使用官方 SDK 时:Python 需通过 extra_body 传入;Node.js 直接写在请求对象中即可透传,TypeScript 项目加一行 // @ts-expect-error 跳过类型检查。
js
curl https://api.seawhaleai.com/v2/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer <API_KEY>" \
  -d '{
    "model": "deepseek-v4-flash-vision-exp",
    "messages": [
      {"role": "system", "content": "你是一个有帮助的助手。"},
      {"role": "user", "content": "你好!"}
    ],
    "provider": { "channel": "direct" },
    "stream": true
  }'
# provider 为可选字段,删除该行即使用默认通
js
from openai import OpenAI

client = OpenAI(
    base_url="https://api.seawhaleai.com/v2",
    api_key="<API_KEY>",
)

stream = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {"role": "system", "content": "你是一个有帮助的助手。"},
        {"role": "user", "content": "你好!"},
    ],
    stream=True,
    # 可选:指定服务通道,不传则使用默认通道
    extra_body={"provider": {"channel": "direct"}},
)

for chunk in stream:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)
js
import OpenAI from 'openai'

const client = new OpenAI({
  baseURL: 'https://api.seawhaleai.com/v2',
  apiKey: '<API_KEY>',
})

const stream = await client.chat.completions.create({
  model: 'deepseek-v4-flash-vision-exp',
  messages: [
    { role: 'system', content: '你是一个有帮助的助手。' },
    { role: 'user', content: '你好!' },
  ],
  stream: true,
  // 可选:指定服务通道,不传则使用默认通道
  // @ts-expect-error provider 为海鲸AI 扩展字段,不在 OpenAI SDK 类型定义内
  provider: { channel: 'direct' },
})

for await (const chunk of stream) {
  process.stdout.write(chunk.choices[0]?.delta?.content ?? '')
}