AB
AiBoss
News

AWS 与 NVIDIA 合作推出 Cosmos 3 物理 AI 模型工厂方案

AWS 发布博客,介绍如何在 SageMaker HyperPod 上利用 NVIDIA Cosmos 3 构建物理 AI 模型工厂,通过统一模型与持续流水线降低多阶段 GPU 调度成本。

核心事实

AWS 于 2026 年 9 月 4 日发布技术博客,介绍如何结合 NVIDIA Cosmos 3 与 Amazon SageMaker HyperPod 构建“物理 AI 模型工厂”。该方案面向机器人、自动驾驶等物理 AI 系统,通过持续流水线(合成数据生成、感知与策略模型后训练、闭环仿真评估)将新真实世界数据转化为更优模型。Cosmos 3 采用 Mixture-of-Transformers(MoT)设计,具备逐层联合注意力与训练/推理不对称特性,将视频、图像、动作、声音统一为单一 token 流,同一模型可承担世界模型、动作标注与策略推理三种角色。

背景与影响

传统物理 AI 流水线常为各阶段分别配置 GPU 集群,导致容量波动与调度开销。Cosmos 3 因单一模型覆盖生成、后训练与评估,可将三个阶段调度至同一持久 GPU 节点池,实现分时共享容量,从而提升 GPU 有效利用率(goodput)。AWS 提供了基于 Amazon EKS 的集群与共享多 TB 存储层配置指南,并演示了基于公开 DROID 数据集的机器人策略后训练完整流程。相关代码与配置已存放于 awsome-distributed-ai GitHub 仓库。Cosmos 3 已由 NVIDIA 以 Linux 基金会 OpenMDW-1.1 许可证发布,架构细节见其技术报告。

限制与来源

该方案涉及 GPU 容量承诺与成本考量,AWS 建议通过灵活训练计划或容量预留避免跨可用区/区域的数据迁移波动。文中未提供具体性能基准或价格数据,实际部署效果可能因工作负载而异。本文信息基于 AWS 官方博客(aws.amazon.com),具体功能、许可条款与可用性请以 AWS 与 NVIDIA 官网当前信息为准。