闲社

标题: inclusionAI开源SingProbe:逐Token监控安全与幻觉 [打印本页]

作者: fleaf32    时间: 2026-9-7 13:03
标题: inclusionAI开源SingProbe:逐Token监控安全与幻觉
【事件概述】
inclusionAI 的 Sing Team 于 2026 年 8 月 31 日发布 SingProbe 技术报告,随后开放 Ling-3.0-flash 与 Ling-3.0-tiny 两组探针权重及训练代码。SingProbe 不再单独运行一个大型安全模型,而是复用基础模型生成过程中已有的隐藏状态,在每个 Token 处连续判断查询意图、回复是否不安全以及幻觉风险。官方模型卡称,额外解码开销低于 0.5%。

【模型与开发者】
项目:SingProbe
开发者:inclusionAI Sing Team
官方发布日期:2026 年 8 月 31 日
开放模型:Ling-3.0-flash-singprobe、Ling-3.0-tiny-singprobe
基础模型:Ling-3.0-flash、Ling-3.0-tiny
探针规模:Flash 版 5.18M 参数,Tiny 版 3.22M 参数
主要任务:查询意图、回复安全、幻觉风险的逐 Token 检测
许可证:模型页标注 MIT

日期核对说明:arXiv 记录显示 SingProbe Technical Report v1 于 2026-08-31 12:42 UTC 提交;两组 inclusionAI 官方 Hugging Face 模型仓库于 9 月 1 日建立。本文把 8 月 31 日作为研究成果发布日期,同时说明权重随后开放,不把模型页后续更新时间当成首次发布日。

【关键能力与改动】
1. 内生式安全护栏:传统方案通常把生成模型的文本再交给外部分类器。SingProbe 直接读取基础模型部分层的隐藏状态,试图在文字完全生成前捕捉风险信号。
2. 每 Token 连续评分:探针为生成序列中的每个 Token 输出一组分数,包括 8 类查询意图、回复不安全分数和幻觉分数。系统可以观察风险如何随回复展开,而不是只在整段完成后给一次判断。
3. 轻量参数:Ling-3.0-flash 版本使用第 13、26、40 层隐藏状态,探针为 5.18M 参数;Tiny 版本使用第 6、14、22 层,探针为 3.22M 参数。基础模型在训练探针时保持冻结。
4. 低额外开销:官方模型卡报告两组部署的解码额外开销均低于 0.5%。这是在其实现与测试环境下测得的结果,实际服务器吞吐仍需自行验证。
5. 三类任务统一:同一框架同时做查询风险分类、回复安全分类与幻觉检测,减少为每类问题分别部署一个独立护栏模型的复杂度。
6. 流式防护:SingStreamBench 专门测试护栏能否在正常前缀上保持安静,并在不安全内容开始出现时尽快报警。技术报告还研究了利用探针分数约束后续解码,而不只是被动记录。
7. 代码与权重开放:官方 GitHub 提供训练流水线、数据格式、配置和检查点转换代码;两组 Hugging Face 仓库提供 BF16 Safetensors 权重与自定义加载代码。

【适用对象】
适合已经部署 Ling-3.0-flash 或 Ling-3.0-tiny,并希望在生成过程中增加低延迟风险监控的模型服务团队。在线客服、企业助手、内容生成、代码智能体和需要观察幻觉趋势的应用,可以把 SingProbe 作为附加信号纳入现有策略。

它也适合研究者探索基础模型内部表示能否承担安全检测任务。与读取最终文本相比,隐藏状态可能更早暴露模型的意图变化,但这种信号仍需要结合明确的阻断策略、日志和人工复核。

【实际影响】
独立护栏模型会增加显存、延迟和服务编排成本,而且护栏容量可能跟不上快速变强的基础模型。SingProbe 的思路是复用生成时已经计算的内部状态,只训练一个很小的探针,从而让安全信号与主模型解码同步产生。

如果生产测试能够复现低开销与早期预警效果,团队可以在内容尚未完整输出时暂停、降级或转人工。但探针分数不是最终事实判断,也不应直接替代领域规则和外部安全模型;更稳妥的方式是把它加入多层防御体系。

【实现方式简述】
基础模型通过打补丁的 SGLang 服务实时导出指定层的归一化隐藏状态,训练端把多层特征拼接后交给两类可选探针:两层 MLP,或带因果多查询注意力的 GuardAttnProbe。基础模型参数保持冻结,只训练探针。

模型卡给出的部署示例需要特定的 SGLang 或 vLLM 集成分支,并要求基础模型与探针检查点严格配对。Flash 探针只能和 inclusionAI/Ling-3.0-flash 配合,Tiny 探针只能和 inclusionAI/Ling-3.0-tiny 配合。

【官方评测怎么看】
Flash 模型卡报告,在指定基准集合上,回复安全分类平均 F1 为 0.8728,流式安全 R-AUC/T-AUC 为 0.9887/0.9481,幻觉检测 AUC 为 0.8012;Tiny 版也给出了相应结果。以上数字来自开发团队自己的模型卡和技术报告,基准、阈值及数据分布都会影响结果,不能直接外推为真实业务准确率。

更重要的是误报与漏报的业务代价。模型卡报告的正常回复误报率来自五个数据集平均值,但真实系统中的长对话、混合语言、专业术语和对抗输入可能产生不同分布,上线时必须重新校准阈值。

【限制与使用提醒】
第一,目前集成只支持 Ling-3.0 的 BailingMoeV3ForCausalLM 基础模型,并非可以直接附加到任意 LLM 的通用插件。模型与探针层号、隐藏维度不匹配会导致结果无效。

第二,部署依赖 token-probe 补丁版 SGLang 或项目指定的 vLLM 分支,上游稳定版本不一定具备相同接口。团队需要承担编译、兼容性、升级和安全维护成本。

第三,低于 0.5% 的开销是官方测试结果,不保证在所有并发量、GPU、序列长度和服务框架上成立。导出隐藏状态还会增加内存与数据流量,应进行端到端压测。

第四,幻觉检测只能给风险分数,无法证明一句话真实或虚假。医疗、法律、金融和科研内容仍需检索证据、来源核对与人工审核。

第五,安全分类器会有误报和漏报,攻击者也可能针对探针规避检测。不能把单一探针当作完整安全边界;输入过滤、输出检查、工具权限、沙箱和审计仍然必要。

第六,训练自己的探针需要安全与幻觉标注数据,并在 SGLang 推理与探针训练之间传输隐藏状态。数据路径、tmpfs、日志和检查点可能包含敏感信息,必须设置访问控制和生命周期管理。

第七,Hugging Face 页面当前没有推理服务商直接托管这些模型。使用者需要自行准备兼容的 CUDA、PyTorch、Transformers、SGLang/vLLM 与 flash-linear-attention 环境。

第八,技术报告是 arXiv 预印本,尚不能等同于已完成同行评审的定论。本文只复述官方公开机制与结果,不把实验表现描述为绝对安全保证。

【官方来源】
inclusionAI Flash 探针模型页:https://huggingface.co/inclusionAI/Ling-3.0-flash-singprobe
inclusionAI Tiny 探针模型页:https://huggingface.co/inclusionAI/Ling-3.0-tiny-singprobe
官方训练代码:https://github.com/inclusionAI/SingProbe
技术报告:https://arxiv.org/abs/2608.30703
作者: 冰咖啡    时间: 3 天前
复用隐藏状态做逐Token探针这个思路挺聪明的,省了额外安全模型的开销。不过0.5%解码开销是在什么batch size下测的?还有探针本身会不会被对抗性prompt绕过,这个才是关键 🤔




欢迎光临 闲社 (https://www.xianshe.com/) Powered by Discuz! X5.0