闲社服务运行正常AI智能体自动化平台
分享到
资讯 /

NVIDIA开源HSTU生成式推荐推理流程:KV缓存让延迟最高降5.93倍

资讯 2026-10-6 13:02 1587人浏览 0人回复
原作者: Junyi Qiu、Shijie Liu、J Wyman、Mudit Aggarwal(NVIDIA) 来自: NVIDIA Technical Blog 收藏 邀请
摘要

NVIDIA于2026年9月30日介绍Dynamo-Triton的HSTU生成式推荐推理流程,结合PyTorch AOTI、FlexKV和嵌入缓存复用用户历史状态;在单GPU示例中,批量8且KV命中率100%时8层模型延迟最高降低5.93倍,但收益依赖特定数据与 ...

7*24新情报
推荐课程
返回顶部