闲社服务运行正常AI智能体自动化平台

Hy3-GGUF

AngelSlim/Hy3-GGUF

发布机构AngelSlim

下载访问条件魔搭来源

Hy3 致力于构建更直观、更全面、更高效的 LLM 压缩工具包。本项目提供针对 llama.cpp 的低比特量化 Hy3(hy v3)GGUF 模型,支持开箱即用,并包含 MTP 自推测解码功能。 附带混合精度量化配方,用户可使用自己的校准数据集进行量化 输入:校准数据集(纯文本文件,需预先应用模型特殊标记)

文字对话
模型详情

模型介绍

中文整理

# Hy3 llama.cpp 量化模型

模型用途

Hy3 致力于构建更直观、更全面、更高效的 LLM 压缩工具包。本项目提供针对 llama.cpp 的低比特量化 Hy3(hy v3)GGUF 模型,支持开箱即用,并包含 MTP 自推测解码功能。

## 主要能力

  • 提供低比特量化 GGUF 模型
  • 支持 MTP 自推测解码
  • 附带混合精度量化配方,用户可使用自己的校准数据集进行量化

## 输入输出

  • 输入:校准数据集(纯文本文件,需预先应用模型特殊标记)
  • 输出:量化后的 GGUF 模型文件

运行要求

  • 需使用包含 hy v3 支持的 llama.cpp(PR #25395 合并后的版本)
  • 推荐 GPU 配置:

| GPU 数量 | 显存 | 推荐量化格式 | MTP 支持 |

|---------|------|-------------|---------|

| 1× H20 (96 GB) | IQ1_M | 否 | |

| 2× H20 (192 GB) | IQ1_M | 是 | |

| 2× H20 (192 GB) | Q4_K_M | 是 | |

| 4× H20 (384 GB) | Q4_K_M | 是 | |

  • 权重需求:IQ1_M 约 83 GiB,Q4_K_M 约 166 GiB(MTP 额外增加约 2 GiB)

基本用法

  • 克隆并构建最新 llama.cpp(需包含 hy v3 支持)
  • 将 Hugging Face 模型转换为 BF16 GGUF
  • 使用校准数据集计算重要性矩阵(imatrix)
  • 选择对应配方进行量化

量化配方说明:

  • 注意力机制(q/k/v)和词嵌入/输出头保持高精度
  • 共享专家保持在 q5_K–q6_K
  • 路由专家使用激进低比特

限制

  • 早期版本的 GGUFs 无法在当前上游版本上正确加载
  • 需使用特定版本的 llama.cpp
  • MTP 变体仅适用于包含 MTP 头的 GGUF

许可证

未在文档中明确说明许可证信息。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部