闲社服务运行正常AI智能体自动化平台

gemma-4-12B-it-assistant

google/gemma-4-12B-it-assistant

发布机构谷歌(Google)已核实

下载访问条件国内镜像可用

Gemma 4 MTP (Multi-Token Prediction) Drafters MTP是用于Gemma 4模型的加速draft模型,通过扩展基础模型添加一个更小、更快的draft模型来工作。在Speculative Decoding流水线中,draft模型提前预测多个token,目标模型随后并行验证。这可以实现高达3倍的解码加速,同时保证与标准生成完全相同的质量,适用于低延迟和设备端应用场景。 Gemma 4是由Google DeepMind构建的开放模型系列。该

文字对话
模型详情

模型介绍

中文整理

模型名称

Gemma 4 MTP (Multi-Token Prediction) Drafters

许可证

Apache 2.0

作者

Google DeepMind

模型用途

MTP是用于Gemma 4模型的加速draft模型,通过扩展基础模型添加一个更小、更快的draft模型来工作。在Speculative Decoding流水线中,draft模型提前预测多个token,目标模型随后并行验证。这可以实现高达3倍的解码加速,同时保证与标准生成完全相同的质量,适用于低延迟和设备端应用场景。

主要能力

Gemma 4是由Google DeepMind构建的开放模型系列。该系列为多模态模型,支持文本和图像输入(E2B、E4B和12B型号还支持音频),生成文本输出。提供预训练和指令微调两种版本。上下文窗口最高支持256K token,支持超过140种语言。

模型系列包含Dense和混合专家(MoE)两种架构,共五个规格:E2B、E4B、12B、26B A4B和31B。适用于文本生成、编程和推理任务,可部署从高端手机到笔记本电脑和服务器的各种环境。

核心能力包括:内置推理模式,支持逐步思考;图像理解(目标检测、文档解析、屏幕UI理解、图表理解、OCR多语言支持、手写识别);视频理解;多模态输入交叉混合;原生函数调用支持;编程能力;多语言支持(开箱即用35种以上语言,预训练覆盖140种以上语言);音频处理(仅E2B、E4B、12B支持语音识别和翻译)。

输入输出

输入:文本、图像、音频(根据型号)

输出:文本

运行要求

基础依赖:transformers、torch、accelerate

音频处理额外依赖:torchvision、librosa

视频处理额外依赖:torchvision、librosa

基本用法

使用Transformers加载模型。建议采样配置:temperature=1.0,top_p=0.95,top_k=64。

启用推理模式:在系统提示开头包含触发token。模型会输出内部推理过程后跟最终答案。

多轮对话:历史输出仅应包含最终响应,不要在下一轮用户输入前添加之前的思考内容(工具调用轮次除外)。

多模态输入顺序:图像内容放在文本之前,音频内容放在文本之后。

图像分辨率:支持可变的token预算(70、140、280、560、1120),低预算适用于分类、字幕或视频理解,高预算适用于OCR、文档解析或阅读小文本。

音频处理:最长支持30秒。视频处理:最长支持60秒(每秒一帧)。

限制

训练数据质量与多样性显著影响模型能力。训练数据中的偏见或缺陷可能导致模型在某些任务上表现不佳。模型在特定领域的专业知识可能有限,可能产生看似合理但实际不准确的输出。音频处理仅支持30秒以内,E2B、E4B和12B型号支持音频功能,其他型号不支持。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部