闲社
标题:
llama.cpp新增Decision Models:单次前向推理直接输出选项概率
[打印本页]
作者:
毛子
时间:
1 小时前
标题:
llama.cpp新增Decision Models:单次前向推理直接输出选项概率
事件概述:llama.cpp项目团队(ggml-org)于2026年10月2日在Hugging Face介绍Decision Models支持。新版llama.cpp服务器新增/v1/systemone接口,客户端可提交文本、JSON或截图状态以及带类型的问题,模型一次前向计算就返回每个选项的概率,而不是逐Token生成回答。
能力与对象:Decision Model把任务限定为给定选项的决策,可用于请求路由、内容审核、检查智能体步骤是否成功或选择下一步动作。接口支持三类问题:choice从候选项中选择并给出概率,score在2到10个等级上返回期望等级,noul返回是/否概率。状态还可以是对话消息或包含图片的数据URL,因此部分模型可直接处理文档或截图。
支持模型与示例:官方列出了Julia-1(144M,50多种语言)、Laya(421M,英语)、Kev-4B(4B,英语)、lev(4B,英语)、OpenJev(27B,多语言并支持图像)和Clef(27B,英语并支持图像)。文章给出的单问题中位耗时是在NVIDIA RTX PRO 6000上的参考值,约3毫秒至43毫秒不等;可通过llama serve启动GGUF模型,并在一个服务器中按需路由多个模型。
实际影响:对于规则明确、输出空间有限的代理编排和分类任务,概率化的固定选项输出能减少文本解析与逐Token生成开销,也便于设置置信度阈值,低置信度请求转人工。开发者可用现有llama.cpp部署方式快速试验,不必为每种模型重写客户端,只需切换到System One兼容接口。
限制:概率并不等于正确性,阈值和候选描述需要用自己的数据校准;文章示例显示,给出候选项描述会影响路由结果。不同模型的语言、图像支持和许可证不同,OpenJev标注为CC BY-NC 4.0,不能把所有模型当作可商用。性能数字是单张NVIDIA RTX PRO 6000上的中位测量,实际批量、显存和并发效果需自行压测。
官方来源:https://huggingface.co/blog/ggml-org/decision-models-in-llamacpp
欢迎光临 闲社 (https://www.xianshe.com/)
Powered by Discuz! X5.0