模型介绍
中文整理# DiffusionGemma 模型卡片
## 概述
DiffusionGemma 是由 Google DeepMind 开发的生成式模型,基于 26B A4B 混合专家(MoE)Gemma 4 架构,使用离散扩散生成 token。该模型为开源权重模型,支持多模态输入(文本、图像、视频)并生成文本输出。
## 主要能力
- *离散文本扩散**:采用块自回归多画布采样,替代传统的逐 token 自回归生成方式。通过并行迭代去噪整块 token(画布),显著提升解码速度。
- *多模态输入处理**:支持交错文本、可变宽高比和分辨率的图像以及视频输入,生成文本输出。
- *编码器-解码器架构**:使用自回归编码器处理和缓存提示上下文,解码器在生成画布上应用双向注意力。
- *混合专家效率**:采用稀疏 MoE 设计(128 个专家中激活 8 个),在保持低内存占用的同时提供强大的推理能力,适合本地运行。
- *思考模式**:内置推理模式,支持分步思考,可配置开关。
- *小批量推理优化**:专为单卡低延迟、高速度生成设计。
- *原生系统提示支持**:支持更新系统角色,实现更结构化、可控的对话。
## 参数规格
总参数:25.2B
激活参数:3.8B
层数:30
滑动窗口:1024 token
上下文长度:最高 256K token
画布长度:256
词表大小:262K
专家数量:8 个激活 / 128 个总数 + 1 个共享
支持模态:文本、图像
视觉编码器参数:约 550M
## 输入输出
- *输入**:文本、图像、视频
- *输出**:文本
运行要求
模型针对小批量推理优化,在低批量设置下(H100,FP8)可实现超过 1100 tokens/秒的生成速度。
基本用法
使用最新版本 Transformers 加载模型。推荐使用熵边界(Entropy Bound)采样器进行推理。
- *扩散采样设置**:
最大去噪步数:48
温度调度:线性衰减从 0.8 至 0.4
令牌选择:每步选择互信息边界低于熵边界 0.1 的最低熵 token
自适应停止:当画布平均模型熵低于 0.005 且最高概率 token 预测在连续两步保持不变时终止
- *思考模式配置**:
在系统提示开头包含特定 token 启用思考,移除该 token 禁用思考。启用思考时,模型输出内部推理过程后跟最终答案。
- *多轮对话**:历史输出仅应包含最终响应,不应包含之前的思考内容。
- *多模态输入顺序**:将图像内容置于文本之前以获得最佳性能。
- *可变图像分辨率**:支持 70、140、280、560、1120 五种视觉 token 预算。分类、字幕等任务使用较低预算;OCR、文档解析等需要细粒度理解的任务使用较高预算。
- *视频长度**:支持最长 60 秒视频(每秒一帧)。
限制
- *训练数据**:训练数据的质量和多样性显著影响模型能力,数据中的偏见或空白会导致模型响应存在局限。训练数据集的范围决定了模型能有效处理的主题领域。
- *上下文与任务复杂度**:模型在清晰提示和指令的任务上表现良好。开放性或高度复杂的任务可能具有挑战性。提供的上下文量会影响性能。
- *语言歧义与细微差别**:自然语言本身复杂,模型可能难以理解细微差别、讽刺或比喻性语言。
- *事实准确性**:模型基于训练数据学习的信息生成响应,并非知识库,可能产生错误或过时的陈述。
- *常识**:模型依赖语言中的统计模式,在某些情况下可能缺乏应用常识推理的能力。
许可证
Apache 2.0
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
