闲社服务运行正常AI智能体自动化平台

diffusiongemma-26B-A4B-it

google/diffusiongemma-26B-A4B-it

发布机构谷歌(Google)已核实

下载访问条件国内镜像可用

DiffusionGemma 是由 Google DeepMind 开发的生成式模型,基于 26B A4B 混合专家(MoE)Gemma 4 架构,使用离散扩散生成 token。该模型为开源权重模型,支持多模态输入(文本、图像、视频)并生成文本输出。 离散文本扩散:采用块自回归多画布采样,替代传统的逐 token 自回归生成方式。通过并行迭代去噪整块 token(画布),显著提升解码速度。 多模态输入处理:支持交错文本、可变宽高比和分辨率的图像以及视频输入,生成文本输出。

文字对话图文理解
模型详情

模型介绍

中文整理

# DiffusionGemma 模型卡片

## 概述

DiffusionGemma 是由 Google DeepMind 开发的生成式模型,基于 26B A4B 混合专家(MoE)Gemma 4 架构,使用离散扩散生成 token。该模型为开源权重模型,支持多模态输入(文本、图像、视频)并生成文本输出。

## 主要能力

  • *离散文本扩散**:采用块自回归多画布采样,替代传统的逐 token 自回归生成方式。通过并行迭代去噪整块 token(画布),显著提升解码速度。
  • *多模态输入处理**:支持交错文本、可变宽高比和分辨率的图像以及视频输入,生成文本输出。
  • *编码器-解码器架构**:使用自回归编码器处理和缓存提示上下文,解码器在生成画布上应用双向注意力。
  • *混合专家效率**:采用稀疏 MoE 设计(128 个专家中激活 8 个),在保持低内存占用的同时提供强大的推理能力,适合本地运行。
  • *思考模式**:内置推理模式,支持分步思考,可配置开关。
  • *小批量推理优化**:专为单卡低延迟、高速度生成设计。
  • *原生系统提示支持**:支持更新系统角色,实现更结构化、可控的对话。

## 参数规格

总参数:25.2B

激活参数:3.8B

层数:30

滑动窗口:1024 token

上下文长度:最高 256K token

画布长度:256

词表大小:262K

专家数量:8 个激活 / 128 个总数 + 1 个共享

支持模态:文本、图像

视觉编码器参数:约 550M

## 输入输出

  • *输入**:文本、图像、视频
  • *输出**:文本

运行要求

模型针对小批量推理优化,在低批量设置下(H100,FP8)可实现超过 1100 tokens/秒的生成速度。

基本用法

使用最新版本 Transformers 加载模型。推荐使用熵边界(Entropy Bound)采样器进行推理。

  • *扩散采样设置**:

最大去噪步数:48

温度调度:线性衰减从 0.8 至 0.4

令牌选择:每步选择互信息边界低于熵边界 0.1 的最低熵 token

自适应停止:当画布平均模型熵低于 0.005 且最高概率 token 预测在连续两步保持不变时终止

  • *思考模式配置**:

在系统提示开头包含特定 token 启用思考,移除该 token 禁用思考。启用思考时,模型输出内部推理过程后跟最终答案。

  • *多轮对话**:历史输出仅应包含最终响应,不应包含之前的思考内容。
  • *多模态输入顺序**:将图像内容置于文本之前以获得最佳性能。
  • *可变图像分辨率**:支持 70、140、280、560、1120 五种视觉 token 预算。分类、字幕等任务使用较低预算;OCR、文档解析等需要细粒度理解的任务使用较高预算。
  • *视频长度**:支持最长 60 秒视频(每秒一帧)。

限制

  • *训练数据**:训练数据的质量和多样性显著影响模型能力,数据中的偏见或空白会导致模型响应存在局限。训练数据集的范围决定了模型能有效处理的主题领域。
  • *上下文与任务复杂度**:模型在清晰提示和指令的任务上表现良好。开放性或高度复杂的任务可能具有挑战性。提供的上下文量会影响性能。
  • *语言歧义与细微差别**:自然语言本身复杂,模型可能难以理解细微差别、讽刺或比喻性语言。
  • *事实准确性**:模型基于训练数据学习的信息生成响应,并非知识库,可能产生错误或过时的陈述。
  • *常识**:模型依赖语言中的统计模式,在某些情况下可能缺乏应用常识推理的能力。

许可证

Apache 2.0

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部