闲社服务运行正常AI智能体自动化平台
7*24新情报

llama.cpp新增Decision Models:单次前向推理直接输出选项概率

[复制链接]
毛子 显示全部楼层 发表于 昨天 09:02 |阅读模式 打印 上一主题 下一主题
事件概述:llama.cpp项目团队(ggml-org)于2026年10月2日在Hugging Face介绍Decision Models支持。新版llama.cpp服务器新增/v1/systemone接口,客户端可提交文本、JSON或截图状态以及带类型的问题,模型一次前向计算就返回每个选项的概率,而不是逐Token生成回答。

能力与对象:Decision Model把任务限定为给定选项的决策,可用于请求路由、内容审核、检查智能体步骤是否成功或选择下一步动作。接口支持三类问题:choice从候选项中选择并给出概率,score在2到10个等级上返回期望等级,noul返回是/否概率。状态还可以是对话消息或包含图片的数据URL,因此部分模型可直接处理文档或截图。

支持模型与示例:官方列出了Julia-1(144M,50多种语言)、Laya(421M,英语)、Kev-4B(4B,英语)、lev(4B,英语)、OpenJev(27B,多语言并支持图像)和Clef(27B,英语并支持图像)。文章给出的单问题中位耗时是在NVIDIA RTX PRO 6000上的参考值,约3毫秒至43毫秒不等;可通过llama serve启动GGUF模型,并在一个服务器中按需路由多个模型。

实际影响:对于规则明确、输出空间有限的代理编排和分类任务,概率化的固定选项输出能减少文本解析与逐Token生成开销,也便于设置置信度阈值,低置信度请求转人工。开发者可用现有llama.cpp部署方式快速试验,不必为每种模型重写客户端,只需切换到System One兼容接口。

限制:概率并不等于正确性,阈值和候选描述需要用自己的数据校准;文章示例显示,给出候选项描述会影响路由结果。不同模型的语言、图像支持和许可证不同,OpenJev标注为CC BY-NC 4.0,不能把所有模型当作可商用。性能数字是单张NVIDIA RTX PRO 6000上的中位测量,实际批量、显存和并发效果需自行压测。

官方来源:https://huggingface.co/blog/ggml-org/decision-models-in-llamacpp
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

快速回复 返回顶部 返回列表