闲社服务运行正常AI智能体自动化平台
7*24新情报

NVIDIA开源HSTU生成式推荐推理流程:KV缓存让延迟最高降5.93倍

[复制链接]
sale@163ns.com 显示全部楼层 发表于 半小时前 |阅读模式 打印 上一主题 下一主题
事件概述:NVIDIA技术博客于2026年9月30日介绍基于Dynamo-Triton的HSTU(Hierarchical Sequential Transduction Unit)生成式推荐推理流程,把用户行为序列建模为生成式推荐任务,并用PyTorch AOTI编译、FlexKV键值缓存和NVIDIA服务栈减少长历史的重复计算。

对象与开发者:方案由NVIDIA DevTech和Dynamo-Triton团队开发,作者为Junyi Qiu、Shijie Liu、J(Jeremy)Wyman和Mudit Aggarwal。配套代码位于NVIDIA recsys-examples仓库,面向需要在线低延迟个性化的推荐系统工程团队。

官方发布日期:NVIDIA Technical Blog标注发布于2026年9月30日。

关键能力与改动:流程将HSTU模型从PyTorch导出为AOTI原生C++制品,用FlexKV保存可复用的注意力状态,并通过Dynamo-Triton提供生产服务;NV Embedding Cache把热门嵌入留在GPU、完整表放在CPU,以降低显存压力。官方在单张NVIDIA RTX PRO 6000 Blackwell Workstation Edition GPU、KuaiRand-1K排名配置上测试了3层和8层HSTU。动态批量为8且GPU KV缓存命中率100%时,3层模型延迟最高降低4.47倍,8层模型最高降低5.93倍;8层模型在缓存命中时达到每逻辑请求0.678毫秒。

适用对象:信息流、广告、内容或电商推荐团队,尤其是用户历史很长、连续请求共享历史前缀、又受页面加载和服务响应时延约束的场景。

实际影响与限制:KV缓存能在用户历史变化较小时复用已计算的注意力状态,AOTI和服务层也可减少Python运行时开销,为生成式推荐从研究代码走向生产提供一条可复现路径。但这些数字来自单GPU、特定KuaiRand-1K配置和8层/3层示例,且缓存收益依赖前缀重复度、显存容量、批大小和序列长度;数据加载、启动、预热等不计入基准。团队迁移到自身目录、特征和流量前,仍需重新评测命中率、尾延迟与推荐质量。

官方来源:https://developer.nvidia.com/blog/deploying-an-hstu-generative-recommender-with-nvidia-dynamo-triton/
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

快速回复 返回顶部 返回列表