AB
AiBoss
News

NVIDIA 发布 DOCA GPUNetIO:统一 GPU 发起网络通信的 GDA-KI 基础

NVIDIA 在开发者博客介绍 DOCA GPUNetIO,称其作为统一的 GDA-KI 基础,让 CUDA 内核直接驱动以太网、RDMA、Verbs 与 DMA 操作,使 CPU 退出应用关键路径;同时提供完整 DOCA SDK 版本与轻量开源 Verbs 版本。

核心事实

NVIDIA 在开发者博客发文介绍 DOCA GPUNetIO,称其为面向实时数据包处理与数据搬运的 GPU 中心网络 SDK 层。该框架整合 GPUDirect RDMA、GPUDirect Async Kernel-Initiated(GDA-KI)与 GDRCopy,使 CUDA 内核可直接驱动以太网、RDMA、Verbs 和 DMA 操作,从而让 CPU 退出应用关键路径。据文章描述,GPUNetIO 同时提供控制路径上的 CPU 函数(用于导出基于 DOCA Ethernet、DOCA Verbs、DOCA DMA、DOCA CommChannel 创建的 GPU 内存传输对象)与数据路径上的 GPU CUDA 函数。

背景与影响

文章称,在 GPUNetIO 成为共享基础之前,各通信库各自实现 GDA-KI 风格的 GPU 发起 RDMA,代码与维护彼此独立。统一到 GPUNetIO 后,NCCL、NVSHMEM、UCX/NIXL、Holoscan Sensor Bridge 等可共用同一实现,减少重复工程与行为碎片化。文中提到,NCCL GIN 自 2.27 版本起将开源 GPUNetIO Verbs 路径作为后端;NVSHMEM 3.7 引入基于 GPUNetIO 的传输层,并称基准测试显示 GDA-KI 在小消息尺寸下带来更好的 CTA 与 QP 扩展性。此外,NVQLink 使用基于 GPUNetIO 的 GPU RoCE Transceiver 算子,在 IGX Thor 搭配 Blackwell GPU 与 ConnectX-7 的量子-经典工作流中实现约 2.6 微秒的最小往返延迟。NVIDIA 同时提供完整 DOCA SDK 版本(超集)与轻量、聚焦 RDMA Verbs 的开源版本;开源实现可在运行时检测 DOCA SDK,并通过 dlopen 调用部分闭源函数,若 SDK 不存在则独立运行。

限制与来源

上述性能数字与集成情况均来自 NVIDIA 官方技术博客,尚未见独立第三方验证;相关版本号、可用性与功能范围可能随产品更新变化,请以 NVIDIA 官网及 DOCA 编程指南当前信息为准。本文不构成任何投资或采购建议。