模型介绍
中文整理# Gemma 4 MTP 模型卡片
许可证
Apache 2.0
## 作者
Google DeepMind
模型用途
本模型卡片适用于 Gemma 4 模型的 Multi-Token Prediction(MTP)草稿模型。MTP 通过在基础模型上扩展一个更小、更快的草稿模型来实现。当在投机解码(Speculative Decoding)流程中使用时,草稿模型会提前预测多个令牌,然后由目标模型并行验证。这可以实现显著的解码加速(最高 3 倍),同时保证与标准生成完全相同的质量,使其非常适合低延迟和设备端应用。
Gemma 是由 Google DeepMind 构建的开源模型系列。Gemma 4 是多模态模型,处理文本和图像输入(E2B、E4B 和 12B 支持音频),并生成文本输出。该版本包含预训练和指令微调两种形式的开源权重模型。Gemma 4 支持最高 256K 个令牌的上下文窗口,并支持超过 140 种语言的多语言功能。
## 主要能力**推理能力**:全系列模型均设计为高能力推理器,支持可配置的思考模式。
- *多模态扩展**:处理文本、图像(所有模型支持可变宽高比和分辨率)、视频,以及音频(E2B、E4B 和 12B 原生支持)。
- *多样化和高效架构**:提供不同规模的 Dense 和混合专家(MoE)变体,支持可扩展部署。
- *设备端优化**:较小的模型专为在笔记本电脑和移动设备上的高效本地执行而设计。
- *扩展上下文窗口**:小型模型支持 128K 上下文窗口,中型模型支持 256K。
- *增强的编码和智能体能力**:在编码基准测试中取得显著改进,同时支持原生函数调用,为高能力自主智能体提供动力。
- *原生系统提示支持**:Gemma 4 引入对系统角色的原生支持,实现更结构化和可控的对话。
## 模型规格
### Dense 模型
| 属性 | E2B | E4B | 12B Unified | 31B Dense |
|------|-----|-----|-------------|-----------|
| 总参数 | 2.3B 有效参数(含嵌入 5.1B) | 4.5B 有效参数(含嵌入 8B) | 11.95B | 30.7B |
| 层数 | 35 | 42 | 48 | 60 |
| 滑动窗口 | 512 令牌 | 512 令牌 | 1024 令牌 | 1024 令牌 |
| 上下文长度 | 128K 令牌 | 128K 令牌 | 256K 令牌 | 256K 令牌 |
| 词表大小 | 262K | 262K | 262K | 262K |
| 支持模态 | 文本、图像、音频 | 文本、图像、音频 | 文本、图像、音频 | 文本、图像 |
| 视觉编码器参数 | 约 150M | 约 150M | - | 约 550M |
| 音频编码器参数 | 约 300M | 约 300M | - | 不支持音频 |
E2B 和 E4B 中的"E"代表"有效参数"。较小模型采用逐层嵌入(PLE)以最大化设备端部署的参数效率。PLE 为每个解码器层提供自己的小型嵌入表,而非添加更多层或参数。
Gemma 4 12B Unified 的"Unified"代表无编码器架构。其他 Gemma 4 模型使用专用编码器处理多模态数据。12B Unified 通过轻量线性层将原始图像块和音频波形直接投影到 LLM 的嵌入空间中。
### MoE 模型
| 属性 | 26B A4B MoE |
|------|-------------|
| 总参数 | 25.2B |
| 活跃参数 | 3.8B |
| 层数 | 30 |
| 滑动窗口 | 1024 令牌 |
| 上下文长度 | 256K 令牌 |
| 词表大小 | 262K |
| 专家数量 | 8 个活跃 / 128 个总计 + 1 个共享 |
| 支持模态 | 文本、图像 |
| 视觉编码器参数 | 约 550M |
26B A4B 中的"A"代表"活跃参数"。通过在推理期间仅激活 4B 子集参数,MoE 模型运行速度远快于其 26B 总参数所暗示的速度。
## 输入输出
- *输入**:文本、图像、视频、音频(仅 E2B、E4B、12B 支持)
- *输出**:文本
运行要求
- *基础依赖**:
- transformers
- torch
- accelerate
- *音频处理额外依赖**:
- torchvision
- librosa
- *视觉处理额外依赖**:
- torchvision
基本用法
- 使用 Transformers 库加载模型
- 采样参数建议:temperature=1.0,top_p=0.95,top_k=64
- 启用思考模式:在系统提示开头包含相应令牌,设置 enable_thinking=True
- 多模态输入顺序:图像内容置于文本之前,音频内容置于文本之后
- 可变图像分辨率:支持 70、140、280、560、1120 的视觉令牌预算
- 音频最长 30 秒,视频最长 60 秒
限制
- *训练数据影响**:训练数据的质量和多样性显著影响模型能力。训练数据中的偏见或差距可能导致模型在某些方面的表现受限。
- *音频支持**:仅 E2B、E4B 和 12B 模型支持音频处理。
- *上下文长度**:不同模型有不同的上下文窗口限制。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
