闲社服务运行正常AI智能体自动化平台

gemma-scope-2-4b-it

google/gemma-scope-2-4b-it

发布机构谷歌(Google)已核实

下载访问条件国内镜像可用

Gemma Scope 2 是一个全面开源的稀疏自编码器和转码器套件,专为 Gemma 3 模型系列设计。该套件可帮助分析模型的内部激活,将其分解为底层概念,类似于生物学家使用显微镜研究动植物的单个细胞。 提供针对 Gemma 3 多种参数规模(270M、1B、4B、12B、27B)的预训练和指令微调模型的稀疏自编码器。包含多层 SAE 变体:部分残差流交叉编码器和跨层转码器。 本仓库包含在 Gemma V3 4B IT 上训练的稀疏自编码器和转码器。模型宽度支持 16k、6

其他模型
模型详情

模型介绍

中文整理

模型用途

Gemma Scope 2 是一个全面开源的稀疏自编码器和转码器套件,专为 Gemma 3 模型系列设计。该套件可帮助分析模型的内部激活,将其分解为底层概念,类似于生物学家使用显微镜研究动植物的单个细胞。

主要能力

提供针对 Gemma 3 多种参数规模(270M、1B、4B、12B、27B)的预训练和指令微调模型的稀疏自编码器。包含多层 SAE 变体:部分残差流交叉编码器和跨层转码器。

运行要求

本仓库包含在 Gemma V3 4B IT 上训练的稀疏自编码器和转码器。模型宽度支持 16k、64k、256k、1m 四种规格。L0 目标值分为 small(10-20)、medium(30-60)、large(60-150)三档。

基本用法

单层模型:resid post、attn out、mlp out 分别在模型的残差流、注意力输出、MLP 输出的 4 个不同层级(25%、50%、65%、85% 深度)训练 SAE。transcoder 包含在同一 4 层上训练的转码器。resid post all、attn out all、mlp out all、transcoder all 覆盖模型的每个层级。

多层模型:crosscoder 在残差流的 4 个连续层级上训练弱因果交叉编码器。clt 跨层转码器从每个 MLP 层之前的残差流值重建整个模型的 MLP 输出。

选择建议:除完整电路分析外,推荐使用层级子文件夹中的 SAE 或转码器。宽度推荐 64k 或 256k。L0 推荐 "medium",适用于大多数任务。

限制

具体功能特性和性能表现需参考 Neuronpedia 页面获取定性了解。不同宽度和 L0 值会影响可提取的特征类型,需根据具体用例选择。

许可证

CC-BY-4.0(知识共享署名 4.0 国际许可证)

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部