模型介绍
中文整理DeepSeek-V4-Flash-Vision-Exp 模型卡片
模型定位
DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek-V4 系列中首个实验性多模态模型。该模型在 DeepSeek-V4-Flash 架构基础上加入视觉模块,通过持续训练解锁视觉理解能力。
主要能力
该模型在多模态代理能力方面相比 DeepSeek-V4-Flash-0731 有显著提升,同时在纯文本代理任务上保持相当的表现。支持视觉理解与文本处理的多模态交互。
基准测试表现
文本代理能力测试中,该模型在 Terminal Bench 2.1 得分 83.9,NL2Repo 得分 57.7,Cybergym 得分 75.3,DeepSWE 得分 59.3,Toolathlon-Verified 得分 75.9,DSBench-Hard 得分 63.6,AutomationBench 得分 25.7。
多模态代理能力测试中,ApexBench 通过率 36.5,Agents' Last Exam 得分 27.3,Chartography 得分 64.3,ZeroBench 通过率 35.0。
输入输出格式
支持 OpenAI 风格的 JSON 内容块输入,同时也支持紧凑路径 TXT 符号表示法。两种输入方式可编码为相同的提示和 token ID。
运行要求
依赖 PyTorch 推理实现。模型包含视觉编码器和对齐器、DFlash attention、MoE 机制、Hyper-Connections 以及 DSpark 前向路径。仓库包含 tokenizer、提示编码参考和最小化 PyTorch 推理实现。encoding/ 和 inference/ 目录相互独立,提示格式化不依赖 PyTorch。
基本用法
可通过 vLLM 在单节点 4×GB300 上运行模型。也可使用 SGLang,启用 DSpark 时需设置 --speculative-algorithm DSPARK,无需单独指定草稿模型路径。具体操作请参考各框架的详细说明文档。
许可证
MIT 许可证
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
