AB
AiBoss
News

NVIDIA Jetson 边缘部署推理模型:NVFP4 与投机解码带来最高 6.28 倍吞吐提升

NVIDIA 技术博客介绍如何在 Jetson 平台部署并优化新一代紧凑型开源推理模型。以 Nemotron 3.5 Lightning 和 Qwen3.8-27B 为例,NVFP4 量化与投机解码组合在 Jetson 上带来最高 6.28 倍解码吞吐提升,并讨论了不同模型架构的适用场景与验证方法。

核心事实

NVIDIA 技术博客于 2026 年 9 月 4 日发布文章,介绍如何在 Jetson 边缘设备上部署和优化新一代紧凑型开源推理模型。文章以 Nemotron 3.5 Lightning 和 Qwen3.8-27B 为例,指出这些模型已具备此前需要大型数据中心系统才能提供的推理与智能体能力。其中,Nemotron 3.5 Lightning 采用混合专家(MoE)架构,总参数 300 亿,但每个 token 仅激活 30 亿参数;Qwen3.8-27B 则为稠密模型,每个 token 激活全部 270 亿参数。文章称,通过 NVFP4 量化与投机解码技术组合,在 Jetson 上相比 BF16 可实现最高 6.28 倍的解码吞吐提升。

背景与影响

文章指出,过去具备多步推理能力的模型过大,无法在边缘硬件本地运行,开发者不得不将推理路由至数据中心,这增加了网络依赖与成本,并可能暴露需保留在设备上的数据。如今,2026 年发布的紧凑型开源模型在智能水平上已接近 2025 年的前沿模型,且参数量大幅减少,Jetson 可在本地运行这些模型,支持车载助手、实时异常检测及恶劣环境下的机器人等应用。文章建议,对于 Jetson Orin Nano 可考虑 Gemma 4 E4B,而 Jetson AGX Orin 和 Jetson AGX Thor 则适合 Nemotron 3.5 Lightning 与 Qwen3.8-27B。优化方面,NVFP4 量化可减少每次推理所需的数据搬运与处理量,投机解码则通过草稿模型一次提出多个 token 供主模型验证,从而在一次验证步骤中推进多个 token。文章强调,最快的投机解码配置因模型而异:Nemotron 3.5 Lightning 搭配 DSpark 效果最佳,而 Qwen3.8-27B 则搭配 DFlash2 表现最好,开发者应针对目标模型测试不同方法与草稿检查点。

限制与来源

文章提醒,模型级基准测试有助于识别良好的投机解码配置,但应用生成的文本类型不同,性能会随工作负载变化,因此必须使用具有代表性的提示词进行应用级验证,通用基准无法确认检查点是否保留了特定数据所需的行为。文中提供的部署命令需在 Jetson AGX Thor 或 Jetson AGX Orin 上运行 JetPack 7.2,并配置 NVIDIA Container Runtime 与 Docker,同时需接受 NVIDIA Nemotron 与 Qwen3.8 检查点的许可条款。本文内容基于 NVIDIA 技术博客,具体性能数据与配置建议请以 NVIDIA 官方文档及 Jetson AI Lab 页面当前信息为准。