AB
AiBoss
ニュース

AWS 发布 SageMaker HyperPod 多团队共享 GPU 集群参考架构

AWS 博客介绍了一套在 Amazon SageMaker HyperPod 上构建多租户环境的参考架构,通过 IAM Identity Center、按团队划分的 SageMaker AI 域、Kubernetes 命名空间、HyperPod Task Governance 与命名空间级成本分摊,让多个团队共享同一 GPU 集群并保持隔离与公平。

AWS 公布 HyperPod 多租户共享 GPU 集群参考架构

AWS 在官方博客发布了一套参考架构,用于在 Amazon SageMaker HyperPod 上构建多团队(多租户)共享 GPU 集群的环境。该架构以 Amazon EKS 编排的 HyperPod 集群为基础,组合使用 AWS IAM Identity Center 做集中身份认证、为每个团队配置独立的 SageMaker AI 域、以 Kubernetes 命名空间隔离工作负载、用 HyperPod Task Governance 做算力配额与调度优先级管理,并通过命名空间级成本分摊实现按团队的支出可见性与费用归属。博客示例中,两个团队共享同一个 HyperPod EKS 集群,各自运行在独立命名空间内。

背景与影响

博客指出,同一家公司内越来越多的团队需要共享昂贵的 GPU 集群来支撑生成式 AI 工作,例如大语言模型训练、计算机视觉推理以及新模型架构实验。若缺少多租户设计,组织会面临资源消耗失控、团队间隔离薄弱、共享 GPU 成本难以归因到具体团队,以及管理开销拖慢创新等问题。该架构在认证、授权到工作负载执行的各环节实现隔离:用户经 Identity Center 门户联邦登录后,可经 CLI 或团队专属 SageMaker Studio 界面提交任务;EKS 访问条目将 IAM 角色映射到限定在各自命名空间的 Kubernetes 权限;存储层则使用 POSIX 兼容文件系统(Amazon FSx for Lustre 或 Amazon FSx for OpenZFS)划分团队共享目录与用户主目录,并配合按团队或共享的 Amazon S3 存储桶。

限制与来源

上述内容来自 AWS 官方博客文章《Share GPU clusters across teams with isolation and fairness using Amazon SageMaker HyperPod》,作者为 Giuseppe Angelo Porcelli 与 Mayank Gupta,署名日期为 2026 年 10 月 8 日。该文为参考架构与最佳实践说明,未给出实测性能数据或定价信息;具体功能可用性、区域支持、配额与计费方式请以 AWS 官网当前信息为准。