【事件概述】
DeepSeek 于 2026 年 8 月 31 日在官方 Hugging Face 账号开放 DeepSeek-V4-Flash-Vision-Exp 权重与参考推理代码。它是 DeepSeek-V4 系列首款实验性多模态模型:在 DeepSeek-V4-Flash 架构上加入视觉模块并继续训练,使模型能够联合处理文字与图像,同时保留文本推理和智能体任务能力。
这次事件要和更早的 API 上线区分。DeepSeek 官方 API 更新页显示,该模型已于 2026 年 8 月 21 日进入 API;8 月 31 日发生的新变化是官方 Hugging Face 权重仓库公开。本文报道的是开放权重,不把两次日期混为一次“首次发布”。
【模型与开发者】
模型:DeepSeek-V4-Flash-Vision-Exp
开发者:DeepSeek
官方开放权重日期:2026 年 8 月 31 日(依据 DeepSeek 官方 Hugging Face 仓库 createdAt 元数据)
模型定位:DeepSeek-V4 系列首款实验性多模态模型
模型规模:Hugging Face 文件元数据标注约 305B 参数
权重与文件类型:Safetensors,仓库包含 BF16、FP8 等多种张量类型
许可证:MIT
【关键能力与改动】
1. 原生图文输入:模型在 V4 Flash 文本架构上加入视觉编码器与对齐模块,并经过继续训练获得图像理解能力,可用于图表、界面、文档截图和其他图文混合任务。
2. 面向多模态智能体:官方将重点放在需要观察图像并调用工具完成任务的智能体场景,而不只是单张图片描述。模型仓库支持 OpenAI 风格的消息内容块,也提供“路径”形式的紧凑输入写法。
3. 保留文本智能体能力:官方称,相比 DeepSeek-V4-Flash-0731,新模型显著改善多模态智能体能力,同时在纯文本智能体任务上保持相近表现。它不是用视觉能力替换文本能力,而是在同一模型中增加视觉链路。
4. 开放参考实现:仓库不只有模型分片,还包括 tokenizer、消息编码、权重转换和最小 PyTorch 推理实现。参考实现覆盖视觉编码器、aligner、DFlash attention、MoE、Hyper-Connections 与 DSpark 前向过程,便于部署团队审查输入编码和推理链路。
5. 支持主流服务框架:官方模型卡提供 vLLM 与 SGLang 的服务示例,并包含工具调用、推理解析和 DSpark 推测解码配置。部署时仍需使用与该模型匹配的镜像、版本和解析器,不能把普通文本模型配置直接照搬。
【官方评测怎么看】
在 DeepSeek 公布的设置下,DeepSeek-V4-Flash-Vision-Exp 在 ApexBench Pass@1 得到 36.5,而不读取多模态元素的 V4-Flash-0731 对照为 26.2;在 Agents' Last Exam 上分别为 27.3 和 25.2。新模型在 Chartography 为 64.3,在 ZeroBench Pass@5 为 35.0。
纯文本智能体评测并非全部提升:例如 Terminal Bench 2.1 为 83.9、DeepSWE 为 59.3,但 Cybergym 为 75.3,低于 V4-Flash-0731 的 76.7。官方说明文本评测使用 DeepSeek Harness minimal 模式、max reasoning effort、temperature 1.0 和 top_p 0.95。以上均是开发者在特定框架和配置下报告的结果,不等于独立评测,也不能直接推导真实业务成功率。
【适用对象】
它适合研究或建设视觉智能体、网页与桌面界面理解、图表分析、文档截图处理、代码仓库与终端协作等系统的团队。已经使用 DeepSeek V4 Flash,并希望在同一智能体框架中加入图像观察能力的开发者,可以重点评估这次权重开放。
它不适合把“实验模型”直接当成无需验证的生产视觉服务。对只需轻量 OCR、图像分类或移动端推理的项目,305B 规模模型的部署成本可能明显高于专用小模型,应该比较准确率、时延、硬件占用和总成本。
【实际影响】
此前开发者可以通过 DeepSeek API 调用该视觉模型,但难以在自己的基础设施中检查完整推理链路。权重和参考实现开放后,研究团队可以进行私有部署、量化、框架适配、离线评测和安全测试,也能针对自己的图表、界面或文档数据验证模型表现。
官方仓库还把视觉编码、提示编码和服务配置公开出来,降低第三方推理框架适配时的猜测成本。不过,开放权重并不自动等于低门槛部署。官方 vLLM 示例使用单个 4×GB300 节点,这只是官方示例配置,不能被写成唯一或最低硬件要求,但足以说明原始模型面向高端多卡环境。
【限制与使用提醒】
第一,名称中的 Exp 明确表示实验版本。模型能力、接口、推荐镜像和推理参数都可能继续变化,生产部署必须固定权重修订、容器版本与配置,并准备回滚方案。
第二,官方模型卡重点给出了基准和推理方法,但没有在页面中提供可覆盖所有场景的安全结论。用于金融、医疗、法律、工业控制或自动执行操作时,应加入权限隔离、工具白名单、人工确认和完整日志。
第三,多模态基准提升不等于 OCR、表格、GUI、空间推理和视频等每个任务都同样可靠。实际应用要用自己的图像分辨率、语言、页面布局和工具环境重新测试,并检查幻觉、漏读和坐标定位误差。
第四,官方比较中,V4-Flash-0731 在部分视觉基准被标注为忽略多模态输入,因此差距不能简单理解为同等视觉条件下的全面胜出;与其他闭源模型的数字也受代理框架、提示、预算和采样设置影响。
第五,Hugging Face 页面显示的 305B 是仓库文件元数据对应的模型规模。官方模型卡没有在正文中给出可据此确认的激活参数量,本文不推测每次推理实际激活多少参数。
【官方来源】
DeepSeek 官方 Hugging Face 模型页:https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
DeepSeek 官方 API 发布说明:https://api-docs.deepseek.com/news/news260821/
官方权重仓库元数据:https://huggingface.co/api/models/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp |