AB
AiBoss站
快讯

NVIDIA 发布 HSTU 生成式推荐推理工作流,接入 Dynamo-Triton

NVIDIA 在 recsys-examples 中提供端到端 HSTU 生成式推荐推理工作流,结合 PyTorch AOTI 编译、FlexKV 键值缓存与 Dynamo-Triton 部署。官方基准显示,在 RTX PRO 6000 Blackwell 工作站版 GPU 上,八层模型在批大小 8、GPU KV 缓存命中率 100% 时延迟最多降低 5.93 倍。

核心事实

NVIDIA 开发者博客介绍,NVIDIA Dynamo-Triton(原 NVIDIA Triton Inference Server)现已通过 NVIDIA recsys-examples 仓库支持端到端的 HSTU(Hierarchical Sequential Transduction Unit)生成式推荐推理工作流。该工作流把 HSTU 模型、PyTorch AOTI(Ahead-of-Time Inductor)编译、FlexKV 支持的 KV 缓存、原生 C++ 校验、NV Embedding Cache 与 Dynamo-Triton 部署串联起来,目标是让 HSTU 排序模型从 PyTorch 开发阶段走向生产推理,而无需为另一套运行时重写模型。

背景与影响

生成式推荐把推荐任务重新表述为对用户行为的序列建模:用户交互、上下文、候选物品与动作都成为高基数事件流中的 token,模型据此生成或打分下一个相关物品。这种方式的代价是推理开销大——历史序列长、嵌入表庞大、同一用户可能反复请求且只带来少量新信息。工作流中的 KV 缓存用于存储可复用的键值状态,避免重复计算用户历史;GPU 缓存采用分页 KV 数据表,支持查找、分配、追加与淘汰,空间紧张时可按 LRU 类策略淘汰较早用户,主机侧存储则作为另一层缓存。PyTorch AOTI 将模型提前编译为可由原生 C++ 运行时加载的包,以降低 Python 运行时开销。据该博客,在 NVIDIA RTX PRO 6000 Blackwell Workstation Edition GPU 上、动态批大小 8、GPU KV 缓存命中率 100% 的条件下,相比同样 AOTI 配置但不启用 KV 缓存,三层 HSTU 模型延迟最多降低 4.47 倍,八层模型最多降低 5.93 倍。基准采用 KuaiRand-1K 排序配置,模型为三层与八层 HSTU 变体,隐藏维度 512、四个注意力头、BF16 权重与 BF16 KV 缓存,历史序列总长上限 8192(4096 组物品与动作对),候选序列长度上限 100,六个上下文特征。

限制与来源

上述数字来自 NVIDIA 官方博客公布的基准,测试环境为单 GPU、特定数据集与模型配置,实际表现会随硬件、模型深度、批大小与缓存命中情况变化,不代表其他部署条件下的结果。博客未披露该工作流的定价、许可条款或各地区的可用性,相关功能与支持范围请以 NVIDIA 官网及 recsys-examples 仓库当前信息为准。本文信息源自 NVIDIA 开发者博客文章《Deploying an HSTU Generative Recommender with NVIDIA Dynamo-Triton》。