闲社服务运行正常AI智能体自动化平台

Ternary-Bonsai-2-27B-gguf

prism-ml/Ternary-Bonsai-2-27B-gguf

发布机构prism-ml

下载访问条件魔搭来源

Bonsai 2 27B 是一款基于三值权重的大语言模型,可在标准笔记本电脑或单块消费级GPU上运行完整的27B参数推理模型。主要用途包括:笔记本电脑本地运行的27B智能体,支持长文档分析、完整代码库处理等需要大上下文的任务;隐私敏感和离线场景下的设备端推理;单GPU或入门级数据中心的27B级别服务部署;以及追求高质量的低比特部署场景。 该模型实现了约9.3倍的无损压缩(相比FP16),保留了98.2%的FP16智能水平。在Apple M5 Max笔记本上可达到约47 tok

文字对话推理思考编程开发
模型详情

模型介绍

中文整理

模型名称:Bonsai 2 27B — GGUF

模型用途

Bonsai 2 27B 是一款基于三值权重的大语言模型,可在标准笔记本电脑或单块消费级GPU上运行完整的27B参数推理模型。主要用途包括:笔记本电脑本地运行的27B智能体,支持长文档分析、完整代码库处理等需要大上下文的任务;隐私敏感和离线场景下的设备端推理;单GPU或入门级数据中心的27B级别服务部署;以及追求高质量的低比特部署场景。

主要能力

该模型实现了约9.3倍的无损压缩(相比FP16),保留了98.2%的FP16智能水平。在Apple M5 Max笔记本上可达到约47 tok/s的生成速度。模型大小仅约5.95GB(PTQ1 0格式),远小于FP16所需的约54GB。模型在亚4比特区间仍保留了深度思考、推理和智能体行为能力:数学能力仅比全精度下降约0.5分(96.57),编码能力与基线持平(89.42),智能体工具调用达到74.92。模型采用端到端三值语言权重,涵盖词嵌入、注意力投影、MLP投影和语言模型头部,有效存储为1.72比特/权重。支持262K token的设备端上下文,由Qwen3.8-27B混合注意力主干网络实现(约75%线性注意力)。

输入输出

支持纯文本输入和输出。可选配视觉塔(mmproj)以支持图像输入,视觉塔为独立加载的Q8 0格式(约0.63GB),仅在处理图像时加载,纯文本推理无需加载。

运行要求

后端支持:llama.cpp(CUDA、Metal、CPU),以及Apple Silicon的MLX companion版本。内存需求:PTQ1 0格式约5.95GB,PQ2 0格式约7.21GB。可选视觉塔额外0.63GB。必须使用PrismML的llama.cpp fork版本,官方llama.cpp无法运行这些文件。推荐配置:-ngl 99卸载所有层到GPU,-c设置上下文最大262144,-n 16384为思考过程留出空间,--min-p 0.05。

基本用法

生成参数建议:思考模式下使用temperature=1.0、top p=0.95、top k=20、min p=0.05;指令模式(非思考)使用temperature=0.7、top p=0.80、top k=20。模型默认使用xhigh推理强度,medium可获得更短响应和速度精度平衡,low不支持。系统提示词可使用简单格式。PQ2 0在H100、A100、Blackwell卡上解码更快,提示处理也更快;PTQ1 0在Ada系列卡和L4上更快,且在内存最紧张的情况下是首选。

限制

质量与体积的权衡:三值模型保留了FP16平均分的98.2%,差距较小且可预测。推理核心(数学、编码)保持在基线几分以内,差距主要集中在知识与推理、视觉等要求最高的类别。低比特内核的工程权衡:PTQ1 0格式(1.75比特/权重,5.95GB)解包三值需要额外计算,在Ada系列和小型加速器上更快,但在Ampere、Hopper和Blackwell上较慢。

许可证

Apache 2.0

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部