AB
AiBoss站
快讯

NVIDIA 发布 AIPerf:面向大规模 LLM 推理的多进程基准测试工具

NVIDIA 开发者博客介绍 AIPerf,作为 GenAI-Perf 的继任者,它采用多进程架构以避免客户端成为高并发基准测试的瓶颈,支持 15 种以上端点类型与多种流量到达模式。

核心事实

NVIDIA 开发者博客发布文章,介绍其 LLM 推理基准测试工具 AIPerf。据该文描述,AIPerf 是 GenAI-Perf 的指定继任者,属于从底层重写的工具,不再像 GenAI-Perf 那样运行在 Perf Analyzer 之上。其关键设计是采用多进程架构:由工作进程生成负载,独立的记录处理服务负责结果,各组件通过 ZMQ 协调,以避免客户端自身成为高并发场景下的瓶颈。

文章称,AIPerf 支持 15 种以上端点类型,涵盖 chat、responses、NIM rankings、图像生成等,并支持 ShareGPT 等公开数据集以及来自 Mooncake、Baseten、WEKA(AgentX)的 trace 回放格式。在负载形态方面,它支持 constant、Poisson、gamma 等到达模式,可调节突发性,并支持并发与请求速率的渐进爬坡。

背景与影响

该文指出,许多基准测试工具采用单进程架构,在真实并发或请求速率下会受 Python GIL 限制,导致测量结果难以完全信任。AIPerf 的多进程设计意在让压测客户端能够充分打满真实服务端,而不先于服务端成为瓶颈。

在指标方面,文章列出四项核心指标:TTFT(首 token 时间)、ITL(token 间延迟)、请求延迟与输出 token 吞吐量,并称这些指标会以 p25、p50、p75、p90、p95、p99 等百分位以及最小值、最大值、平均值、标准差的形式呈现。若环境中提供 DCGM 或 pynvml,AIPerf 还会在同一轮运行输出中采集 GPU 功耗、利用率与显存占用等遥测数据。文章还以 Qwen3-0.6B 配合 vLLM 为例,演示了静态合成负载与 Poisson 到达模式两种配置方式。

限制与来源

需要说明的是,上述内容来自 NVIDIA 开发者博客的一篇文章,其中包含 AI 生成的摘要,原文亦提示 AI 生成内容可能总结不完整,建议核实重要信息。本文未对 AIPerf 的实际性能、并发上限或与其他工具的对比做任何独立验证,文中也未给出定价、许可证、地区可用性或正式发布时间等信息。工具的功能范围、支持的端点类型与数据集、安装方式及平台依赖(例如 aarch64 上相关依赖需要 C 工具链)均可能随版本变化,具体请以 NVIDIA 官网及官方文档的当前信息为准。