AWS 发布在 SageMaker HyperPod 上用 vLLM 部署 Qwen3.8-2.4T-A95B 的技术指南
AWS 博客发布技术文章,介绍如何在 Amazon SageMaker HyperPod 上使用 vLLM 部署 Qwen3.8-2.4T-A95B。文章称该模型为 Qwen-Max 级模型首次以开放权重形式发布,总参数 2.4 万亿、每 token 激活约 950 亿,原生上下文 262K tokens。
AWS 博客给出 Qwen3.8-2.4T-A95B 在 SageMaker HyperPod 上的部署路径
AWS 机器学习博客发布了一篇技术文章,介绍如何在 Amazon SageMaker HyperPod 上使用 vLLM 部署 Qwen3.8-2.4T-A95B。文章称,该模型由阿里 Qwen 团队发布,是 Qwen-Max 级模型首次以开放权重形式提供。按文中描述,模型总参数为 2.4 万亿,每个 token 激活约 950 亿参数,采用细粒度混合专家(MoE)架构,共 92 层,原生上下文窗口为 262,144 tokens,并称可扩展至约 101 万 tokens,最大输出长度为 128K tokens。文章还提到该模型具备原生多 token 预测(MTP)草稿头,可用于推测解码。
背景与影响
文章将开放权重模型的价值归结为三点:数据留在自有基础设施内、推理行为可定制、规模化时没有按 token 计费的 API 成本;代价则是运维复杂度,托管 2.4 万亿参数模型需要专用 GPU 基础设施与优化后的服务栈。文中给出的示例硬件为 ml.p6-b300 实例,配备 8 块 NVIDIA B300 Blackwell Ultra GPU,并提到社区量化版本(如 MXFP4、NVFP4)可将模型压缩至约 1.2 TB,从而放入单个 8 卡节点。文章还介绍了 HyperPod 以 Amazon EKS 为控制面,以及 Inference Operator 通过 InferenceEndpointConfig 这一自定义资源声明式指定模型、容器镜像、GPU 资源请求和 vLLM 启动参数。文章称这是其“在 SageMaker HyperPod 上部署开放万亿参数模型”系列的第二篇,第一篇涉及 Kimi K3。
限制与来源
需要说明的是,上述架构参数、上下文长度、量化体积与基准成绩均来自该博客文章及文中转述的厂商测试结果,本文未做独立验证。文中提到的 PaperBench 93.0、IFBench 82.8、终端编码 86.6 等分数被明确标注为“依据厂商基准测试结果”,不同评测条件可能得出不同结论。可用实例类型、区域支持、模型权重获取方式、量化版本可用性以及相关费用,均可能随时间变化,请以 AWS 与模型发布方的官网当前信息为准。本文不构成任何采购、投资或合规建议。