模型介绍
中文整理# OPI-Llama-3.1-8B-Instruct 模型卡片
模型用途
OPI-Llama-3.1-8B-Instruct 是一个专门针对蛋白质相关任务进行微调的大语言模型,基于 Meta-Llama-3.1-8B-Instruct 训练。该模型用于处理蛋白质科学领域的各种任务,包括序列理解、功能注释预测和知识挖掘等。
## 主要能力
该模型在以下九类任务上进行评估:
- *序列理解任务**
- EC 编号预测
- 折叠类型预测
- *亚细胞定位预测**
- 蛋白质亚细胞定位预测
- *注释预测**
- 功能关键词预测
- 基因本体(GO)术语预测
- 功能描述预测
- *知识挖掘**
- 从基因符号预测组织位置
- 从基因符号预测癌症
- 从基因名称预测癌症
## 输入输出
输入:自然语言形式的蛋白质序列、基因符号或基因名称相关查询
输出:基于蛋白质科学知识的预测结果,如 EC 编号、折叠类型、功能关键词、GO 术语、功能描述、组织位置或癌症预测等
运行要求
基础模型:Meta-Llama-3.1-8B-Instruct
训练数据:OPI 完整训练集(1.61M 条训练数据)
基本用法
该模型基于完整的 OPI 训练集进行微调。如需使用或复现,需访问项目 GitHub 仓库获取训练和测试的详细说明。
## 评估结果
模型在各项测试任务上的性能表现如下:
- *EC 编号预测**
- split100 测试集:精确率 0.3724,召回率 0.3374,F1 值 0.3468
- price 测试集:精确率 0.0738,召回率 0.0738,F1 值 0.0738
- *折叠类型预测**
- Fold Holdout:准确率 0.1045
- Superfamily Holdout:准确率 0.1507
- Family Holdout:准确率 0.6145
- *亚细胞定位预测**
- 准确率 0.4214
- *功能关键词预测**
- CASPSimilarSeq:精确率 0.4202,召回率 0.5057,F1 值 0.4385
- IDFilterSeq:精确率 0.6762,召回率 0.6905,F1 值 0.6650
- UniProtSeq:精确率 0.7606,召回率 0.7489,F1 值 0.7374
- *GO 术语预测**
- CASPSimilarSeq:精确率 0.1113,召回率 0.0936,F1 值 0.099
- IDFilterSeq:精确率 0.6686,召回率 0.6287,F1 值 0.6304
- UniProtSeq:精确率 0.7150,召回率 0.6897,F1 值 0.6849
- *功能描述预测**
- CASPSimilarSeq:Rouge-L 0.7524
- IDFilterSeq:Rouge-L 0.4786
- UniProtSeq:Rouge-L 0.5144
- *组织位置预测**
- 从基因符号预测:精确率 0.4002,召回率 0.9356,F1 值 0.5466
- *癌症预测**
- 从基因符号预测:精确率 0.2890,召回率 0.2701,F1 值 0.2664
- 从基因名称预测:精确率 0.2786,召回率 0.2707,F1 值 0.2659
许可证
模型基于 Meta-Llama-3.1-8B-Instruct,需遵守其原始许可证条款。具体许可证信息请参阅 Meta 官方发布页面。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
