模型介绍
中文整理# Hy3 llama.cpp 量化模型
模型用途
Hy3 致力于构建更直观、更全面、更高效的 LLM 压缩工具包。本项目提供针对 llama.cpp 的低比特量化 Hy3(hy v3)GGUF 模型,支持开箱即用,并包含 MTP 自推测解码功能。
## 主要能力
- 提供低比特量化 GGUF 模型
- 支持 MTP 自推测解码
- 附带混合精度量化配方,用户可使用自己的校准数据集进行量化
## 输入输出
- 输入:校准数据集(纯文本文件,需预先应用模型特殊标记)
- 输出:量化后的 GGUF 模型文件
运行要求
- 需使用包含 hy v3 支持的 llama.cpp(PR #25395 合并后的版本)
- 推荐 GPU 配置:
| GPU 数量 | 显存 | 推荐量化格式 | MTP 支持 |
|---------|------|-------------|---------|
| 1× H20 (96 GB) | IQ1_M | 否 | |
| 2× H20 (192 GB) | IQ1_M | 是 | |
| 2× H20 (192 GB) | Q4_K_M | 是 | |
| 4× H20 (384 GB) | Q4_K_M | 是 | |
- 权重需求:IQ1_M 约 83 GiB,Q4_K_M 约 166 GiB(MTP 额外增加约 2 GiB)
基本用法
- 克隆并构建最新 llama.cpp(需包含 hy v3 支持)
- 将 Hugging Face 模型转换为 BF16 GGUF
- 使用校准数据集计算重要性矩阵(imatrix)
- 选择对应配方进行量化
量化配方说明:
- 注意力机制(q/k/v)和词嵌入/输出头保持高精度
- 共享专家保持在 q5_K–q6_K
- 路由专家使用激进低比特
限制
- 早期版本的 GGUFs 无法在当前上游版本上正确加载
- 需使用特定版本的 llama.cpp
- MTP 变体仅适用于包含 MTP 头的 GGUF
许可证
未在文档中明确说明许可证信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
