AB
AiBoss站
快讯

英伟达 TensorRT Edge-LLM 在 Jetson AGX Thor 完成 MLPerf 边缘智能体基准测试

英伟达开发者博客称,TensorRT Edge-LLM 在单台 Jetson AGX Thor 开发者套件上运行 Qwen3.6-27B,完成 MLPerf Inference v6.1 边缘智能体性能负载,用时 24 分 36 秒,据报比 llama.cpp 参考实现快 6.4 倍。

核心事实

英伟达开发者博客发布文章称,其 TensorRT Edge-LLM 在单台 NVIDIA Jetson AGX Thor 开发者套件上运行 Qwen3.6-27B 模型,完成了 MLPerf Inference v6.1 的边缘智能体(Edge Agentic)基准测试。据该文章描述,系统输出吞吐为 52.33 tokens/秒,首 token 中位时延 247.12 毫秒,每输出 token 中位耗时 14.68 毫秒,BFCL 总体准确率为 87.94%。性能负载共 1,007 轮,据称在 24 分 36 秒内完成,而 MLCommons 公布的 llama.cpp 参考运行耗时 2 小时 37 分钟,前者约为后者的 6.4 倍速度。

背景与影响

文章指出,智能体工作流不同于单轮问答,需要反复选择工具、读取结果并在不断变长的上下文中继续推理,因此对边缘推理的吞吐、长上下文处理和工具调用正确性提出更高要求。该提交采用 NVFP4 量化权重与激活、FP8 KV 缓存、基于树的多 token 预测(MTP)以及跨轮次的 KV 缓存复用。文章称,缓存复用使约 96% 的提示 token 命中热缓存,仅需预填充约 0.5M 的 13.6M 提示 token;相比 3 步线性 MTP,树式 MTP 在该负载上据报可再带来约 40% 的解码性能提升。相关实现位于 TensorRT Edge-LLM 的 release/0.9.1-mlpinf 分支,并提供了量化检查点与运行说明。

限制与来源

上述数据均来自英伟达开发者博客的自我披露,属于厂商提交结果,尚未经独立第三方复现验证。MLPerf 官方结果与规则细节应以 MLCommons 公布的信息为准;模型可用性、量化检查点获取方式、软件分支状态及硬件配置要求可能随时调整,请以英伟达官网与代码仓库当前信息为准。本文不构成任何采购、投资或部署建议。