模型介绍
中文整理模型名称
Gemma 4 MTP (Multi-Token Prediction) Drafters
许可证
Apache 2.0
作者
Google DeepMind
模型用途
MTP是用于Gemma 4模型的加速draft模型,通过扩展基础模型添加一个更小、更快的draft模型来工作。在Speculative Decoding流水线中,draft模型提前预测多个token,目标模型随后并行验证。这可以实现高达3倍的解码加速,同时保证与标准生成完全相同的质量,适用于低延迟和设备端应用场景。
主要能力
Gemma 4是由Google DeepMind构建的开放模型系列。该系列为多模态模型,支持文本和图像输入(E2B、E4B和12B型号还支持音频),生成文本输出。提供预训练和指令微调两种版本。上下文窗口最高支持256K token,支持超过140种语言。
模型系列包含Dense和混合专家(MoE)两种架构,共五个规格:E2B、E4B、12B、26B A4B和31B。适用于文本生成、编程和推理任务,可部署从高端手机到笔记本电脑和服务器的各种环境。
核心能力包括:内置推理模式,支持逐步思考;图像理解(目标检测、文档解析、屏幕UI理解、图表理解、OCR多语言支持、手写识别);视频理解;多模态输入交叉混合;原生函数调用支持;编程能力;多语言支持(开箱即用35种以上语言,预训练覆盖140种以上语言);音频处理(仅E2B、E4B、12B支持语音识别和翻译)。
输入输出
输入:文本、图像、音频(根据型号)
输出:文本
运行要求
基础依赖:transformers、torch、accelerate
音频处理额外依赖:torchvision、librosa
视频处理额外依赖:torchvision、librosa
基本用法
使用Transformers加载模型。建议采样配置:temperature=1.0,top_p=0.95,top_k=64。
启用推理模式:在系统提示开头包含触发token。模型会输出内部推理过程后跟最终答案。
多轮对话:历史输出仅应包含最终响应,不要在下一轮用户输入前添加之前的思考内容(工具调用轮次除外)。
多模态输入顺序:图像内容放在文本之前,音频内容放在文本之后。
图像分辨率:支持可变的token预算(70、140、280、560、1120),低预算适用于分类、字幕或视频理解,高预算适用于OCR、文档解析或阅读小文本。
音频处理:最长支持30秒。视频处理:最长支持60秒(每秒一帧)。
限制
训练数据质量与多样性显著影响模型能力。训练数据中的偏见或缺陷可能导致模型在某些任务上表现不佳。模型在特定领域的专业知识可能有限,可能产生看似合理但实际不准确的输出。音频处理仅支持30秒以内,E2B、E4B和12B型号支持音频功能,其他型号不支持。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
