AB
AiBoss站
快讯

NVIDIA 发布 Qwen3.8-Flash-Next 在 GB300 NVL72 上的智能体编码实验指南

NVIDIA 技术博客发布文章,介绍在多模态 MoE 模型 Qwen3.8-Flash-Next 上于 GB300 NVL72 平台进行智能体编码实验的细节。该模型拥有 125B 参数,原生 262,144 token 上下文窗口,可扩展至 1M token,采用 Gated DeltaNet 与 Qwen Sparse Attention 混合架构。据称在 GB300 NVL72 上每 GPU 每秒可处理超过 16K tokens。

核心事实

NVIDIA 技术博客于 2026 年 8 月 26 日发布文章,介绍如何在 NVIDIA GB300 NVL72 平台上使用 Qwen3.8-Flash-Next 模型进行智能体编码(Agentic Coding)实验。该模型由阿里巴巴发布,作为 Qwen4 架构的预览版本,是一个多模态混合专家(MoE)模型,主模型拥有 1250 亿(125B)参数,另有 510 亿(51B)N-gram 嵌入参数,每个 token 激活 60 亿(6B)参数。模型原生支持 262,144 token 的上下文窗口,并可通过 YaRN 技术扩展至 100 万(1M)token。

背景与影响

该模型采用混合架构,每四层中有三层使用 Gated DeltaNet(GDN)将历史上下文压缩为固定大小的循环状态,以消除 KV 缓存随序列长度增长的问题;剩余一层使用 Qwen Sparse Attention(QSA)进行全上下文精确检索。据阿里巴巴公布的基准测试,与全注意力机制相比,QSA 在 1M token 工作负载下可实现最高 7.6 倍预填充和 4.9 倍解码加速;在 1M token 上下文长度、90% 前缀缓存命中率的在线服务测试中,其预填充吞吐量达到 Qwen3.7-Plus 的 8.6 倍。在 GB300 NVL72 上运行该模型,每 GPU 每秒可处理超过 16K tokens,每用户每秒超过 200 tokens。NVIDIA 提供 SGLang、vLLM 和 TensorRT LLM 的 Day 0 功能支持,并可通过 NeMo AutoModel 进行微调、使用 NeMo RL 配方进行强化学习。模型权重可从 Hugging Face 或 ModelScope 下载,也可通过 QwenCloud 托管服务试用。

限制与来源

上述性能数据均来自 NVIDIA 技术博客及阿里巴巴公布的基准测试,实际效果可能因硬件配置、工作负载及软件版本而异。文中提及的模型参数、上下文窗口及性能数字尚未获得阿里巴巴官方独立验证。开发者如需获取最新信息,请以 NVIDIA 开发者博客及 Qwen 官方发布为准。来源:NVIDIA Technical Blog