AB
AiBoss站
快讯

NVIDIA 发布 Topograph:为 AI 集群提供拓扑感知调度

NVIDIA 开发者博客介绍开源工具 Topograph,可从云 API 或本地网络系统发现集群拓扑,并输出为 Kubernetes 节点标签、Slurm 配置或 Slinky ConfigMap,供调度器做拓扑感知的负载放置。

核心事实

NVIDIA 开发者博客发布文章,介绍开源工具 NVIDIA Topograph。据该文描述,Topograph 可从云服务商 API 或本地网络系统发现集群拓扑,将其归一化为统一模型,再以工作负载管理器可识别的格式发布,包括 Kubernetes 节点标签、Slurm 拓扑配置以及 Slinky ConfigMap。文章称,当集群发生变化时,Topograph 会重新生成拓扑视图,使调度器无需人工维护快照。文中列出的已集成云服务商包括 Google Cloud、Lambda、Nebius、Nscale 与 Oracle Cloud Infrastructure;本地环境则涉及 InfiniBand、Spectrum-X 与 Multi-Node NVLink 域。

背景与影响

文章指出,AI 工厂属于功率受限系统,GPU 负载放置是重要优化环节。放置不当会割裂拓扑域,使流量跨越共享链路,从而降低吞吐并抬高作业成本。Topograph 的设计思路是让调度器基于当前拓扑数据,把紧耦合负载放到通信距离更近的域内。文章称其可与 Dynamic Resource Allocation(DRA)和 KAI Scheduler 配合,实现拓扑感知的 gang 调度;部署方式包括 Kubernetes 上的 Helm 以及 Slurm 集群上的原生包,并提供可在无生产硬件条件下测试的模拟工具。相关代码位于 dsx-ai-factory/topograph 仓库。

限制与来源

本文内容来自 NVIDIA 开发者博客,其中部分摘要由 AI 生成,原文亦提示 AI 生成内容可能不完整,重要信息需自行核实。文中给出的支持矩阵标注为截至 2026 年 9 月 16 日的上游 main 分支状态,并说明具体要求可能随 Topograph 版本、环境和 provider 配置而变化;NFD 引擎需要 alpha 阶段的 NodeFeatureGroupAPI 特性门控。Topograph 反映的是上报拓扑而非预期拓扑,fabric 变化的可见性取决于 provider 及其触发事件。上述功能、支持范围与部署要求均以官方仓库和官网当前信息为准。