模型介绍
中文整理模型用途
本模型卡面向Gemma 4模型的Multi-Token Prediction(MTP)草稿模型。MTP通过为基线模型扩展一个更小、更快的草稿模型来实现。在Speculative Decoding流水线中,草稿模型提前预测多个token,目标模型随后并行验证。这可以实现显著的解码加速(最高3倍),同时保证与标准生成完全相同的质量,使其非常适合低延迟和设备端应用。
Gemma是由Google DeepMind构建的开放模型系列。Gemma 4模型是多模态的,处理文本和图像输入(E2B、E4B和12B支持音频),并生成文本输出。该版本包含预训练和指令微调两种形式的开放权重模型。Gemma 4支持最高256K token的上下文窗口,支持超过140种语言。
主要能力
Gemma 4具备以下核心能力:
推理能力:全系列模型均设计为高能力推理者,支持可配置的思考模式。
扩展多模态:处理文本、图像(所有模型支持可变宽高比和分辨率)、视频,以及音频(E2B、E4B和12B原生支持)。
多样且高效的架构:提供不同规模的Dense和混合专家(MoE)变体,支持可扩展部署。
设备端优化:较小的模型专为笔记本电脑和移动设备的高效本地运行而设计。
增强的上下文窗口:小模型支持128K token上下文,中等模型支持256K。
增强的编码和智能体能力:在编码基准测试中取得显著提升,同时支持原生函数调用,为高能力自主智能体提供动力。
原生系统提示支持:Gemma 4引入对系统角色的原生支持,实现更结构化和可控的对话。
输入输出
输入:文本、图像、视频、音频(仅E2B、E4B、12B支持)
输出:文本
Dense模型规格:
E2B:有效参数2.3B(含嵌入5.1B),35层,滑动窗口512 token,上下文128K,词汇量262K,支持文本、图像、音频
E4B:有效参数4.5B(含嵌入8B),42层,滑动窗口512 token,上下文128K,词汇量262K,支持文本、图像、音频
12B Unified:参数11.95B,48层,滑动窗口1024 token,上下文256K,词汇量262K,支持文本、图像
31B Dense:参数30.7B,60层,滑动窗口1024 token,上下文256K,词汇量262K,支持文本、图像
MoE模型规格:
26B A4B:总参数25.2B,活跃参数3.8B,30层,滑动窗口1024 token,上下文256K,词汇量262K,8个活跃专家/128个总专家加1个共享专家,支持文本、图像
运行要求
使用Gemma 4模型需要安装以下依赖:
pip install -U transformers torch accelerate
处理音频还需安装:torchvision librosa
处理图像和视频还需安装:torchvision
推荐采样配置:temperature=1.0,top p=0.95,top k=64
基本用法
- 加载模型后设置enable_thinking=True启用推理模式
- 多轮对话中,历史输出仅应包含最终回复,之前的思考内容不应添加到下一轮用户输入之前(工具调用除外)
- 多模态输入优化:图像内容放在文本之前,音频内容放在文本之后
- 图像分辨率:支持70、140、280、560、1120 token预算,低预算适用于分类、字幕或视频理解,高预算适用于OCR、文档解析或阅读小文本
- 音频处理:ASR和自动语音翻译有特定的提示结构模板
- 音频最长30秒,视频最长60秒(假设每秒处理一帧)
限制
训练数据质量与多样性显著影响模型能力。训练数据中的偏见或差距可能导致模型在某些领域的表现受限。用户应了解模型可能在其训练数据覆盖不足的领域表现不佳。
许可证
Apache 2.0
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
