模型介绍
中文整理模型名称:CareBot
模型用途
医疗领域大型语言模型,支持中文和英文双语医疗知识理解与问答。
主要能力
基于LLaMA-8B作为基座模型,使用BAAI/IndustryCorpus2数据集进行领域预训练。模型具备中英文医疗领域知识理解能力,通过两阶段CPT策略将医学知识整合到大型语言模型中。
训练方法
两阶段CPT策略:
第一阶段为Stable CPT,医学预训练语料与通用语料比例为19:1,中英文token比例为1:9,旨在保持和增强通用语言理解能力的同时专注于医学信息。
第二阶段为Boost CPT,高质量医学预训练语料与开源医学SFT数据比例为1:1,中英文token比例为4:6,逐步增加中文数据比例。
评估结果
在七个医学基准测试上进行了评估。英文基准测试(MMLU-Med、PubMedQA、MedQA、MedMCQA)性能略有下降,这是预期结果,因为LLaMA-8B基座模型本身具有较强的英文能力。中文基准测试(C-Eval-Med、CMMLU-Med、CMB)显示出显著提升,采用两阶段方法的模型提升尤为明显。两阶段CPT策略有效将医学领域知识整合到模型中,显著增强了中文医疗能力。
限制
由于专注于提升中文医疗能力,英文医疗能力相比基座模型略有下降。
许可证
原文未提供许可证相关信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
