模型介绍
中文整理模型名称
Qwen2.5-Math-PRM-72B
模型用途
过程奖励模型(Process Reward Model),用于对大型语言模型数学推理过程中的中间步骤进行质量评估和错误识别。与结果奖励模型(ORM)不同,该模型专注于提供推理过程反馈,而非直接生成答案。
主要能力
在Best-of-N(BoN)评估中表现出色,在ProcessBench基准测试中展现出较强的中间步骤错误识别能力。可用于过程监督,帮助识别和减轻数学推理过程中的中间错误。
输入输出
输入:数学问题的解题步骤序列
输出:每个步骤的奖励分数(0到1之间的概率值),反映该步骤的正确性
运行要求
依赖transformers>=4.40.0,推荐使用最新版本。GPU内存和吞吐量要求可参考Qwen2模型的类似配置。
基本用法
该模型不用于生成内容,而是对推理过程进行评分。使用时建议:
步骤分隔:使用双换行符("\n\n")分隔解题过程中的各个步骤
奖励计算:在每个步骤后插入特殊token“”,提取该token被分类为正类的概率作为奖励值
限制
仅适用于数学推理任务的过程评估,不适用于其他类型的任务。
许可证
未在该文档中提供许可证信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
