AB
AiBoss站
快讯

英伟达发布机密计算推理优化方案,称吞吐保留超96%

英伟达技术博客介绍在机密计算环境下运行生产级AI推理的适配方法,称TensorRT LLM通过三项针对性优化,在八卡B200系统上保留了CC关闭状态下超过96%的输出吞吐。

核心事实

英伟达开发者博客发布文章,介绍如何在机密计算(Confidential Computing,CC)环境下运行生产级AI推理。文章称,CC通过内存加密的机密虚拟机、机密GPU以及加密的NVLink,为处理敏感数据与专有模型上下文的推理负载提供可信执行环境。但启用CC后,内存搬运、计时、调度与多卡通信的既有假设会发生变化,若运行时不做适配,将带来性能开销。

文章给出的受控对比方法为:在模型、硬件、框架版本、序列长度、并行度与并发度保持一致的前提下,仅切换CC开关,并统计输出吞吐保留率与每输出token耗时(TPOT)开销。据该文披露,在1块DGX B200系统(8颗B200 GPU)上,并发1至16时,CC开启后保留了CC关闭基线96.1%至98.2%的输出token吞吐,平均TPOT开销在1.2%至4.3%之间。

背景与影响

文章指出,TensorRT LLM针对CC环境做了三类适配:一是主机到设备的数据搬运改用页锁定内存以外的选择,并将重复的token与采样数据回读移至异步worker;二是内核自动调优在CC下改用GPU全局计时器,以规避CUDA事件时间戳不稳定的问题;三是针对B200 CC配置中NVLS多播不可用的情况,选择更合适的通信算法。

对计划将私有推理投入生产的平台团队而言,该文建议把安全配置与推理优化视为同一个部署问题,并使用自身实际负载分别跑CC开启与关闭的基准测试。

限制与来源

上述数据来自英伟达性能工程团队在特定软硬件配置下的测试,并非通用结论,不同模型、序列长度、并发度与拓扑下的表现可能不同。文章未披露定价、地区可用性或授权条款,相关功能与支持情况请以英伟达官网当前信息为准。本文为技术博客内容,不构成任何采购或投资建议。