AB
AiBoss
project

Qwen3.8-Flash-Next - 面向 Qwen4 架构的实验性预览权重发布

Qwen3.8-Flash-Next 是 Qwen 在 Hugging Face 上发布的多模态模型权重仓库,任务类型为 image-text-to-text,采用 transformers 框架。据项目自述,它是一次围绕混合注意力、门控残差与 N-gram 嵌入的架构实验预览,为后续 Qwen4 探路。仓库采用自定义许可,截至 2026-09-26 近 30 天下载 846820 次、点赞 5703。

Qwen3.8-Flash-Next 是 Qwen 在 Hugging Face 上发布的一个模型权重与配置文件仓库,任务类型标注为 image-text-to-text,使用 transformers 框架。按照项目自述,这个仓库提供的是后训练模型在 Hugging Face Transformers 格式下的权重与配置,属于一次架构层面的实验性预览:它被描述为「将支撑 Qwen4 的架构」的公开权重首秀,重点不在于把参数量或上下文窗口继续堆大,而在于重新思考现代大语言模型核心组件在规模化条件下如何协作。它适合两类读者:一是需要在自有环境中加载多模态大模型权重、做推理或二次开发的工程人员;二是关注长上下文、稀疏注意力与参数扩展路线,想了解这一代架构设计取舍的研究者。需要说明的是,仓库本身是权重与配置的发布页,不是开箱即用的应用。

维护者与状态

该仓库由 Qwen 维护。根据官方接口数据,仓库创建时间为 2026-08-24,最后更新时间为 2026-08-27,两者相隔三天,说明这是一次集中发布后的短周期更新。许可证字段为 other,即自定义许可,具体条款需以仓库内的 LICENSE 文件为准。

热度方面,截至 2026-09-26 的数据读取时间,该仓库近 30 天下载量为 846820 次,点赞数为 5703。需要提醒的是,事实表中没有给出正式 release 的信息,因此这里不对版本发布节奏做任何推断;仓库当前呈现的状态就是上述创建与更新时间所对应的权重与配置文件集合。

主要能力

以下内容均来自项目自述(README 与模型卡),属于维护者对自身设计的说明,并非第三方评测结论。

据项目说明,Qwen3.8-Flash-Next 是这一新架构下的首个开放权重发布,主要引入了四项设计:

  • 带 QSA 的混合注意力:项目自述把原有的 Gated DeltaNet 与 Gated Attention 组合,改造成 Gated DeltaNet 与 Qwen Sparse Attention(QSA)的搭配。QSA 不在单个 token 粒度上做选择,而是在 micro-block 级别操作,据称可显著降低长上下文延迟,这一点在 agent 类负载日益占主导的背景下被项目方视为关键收益。
  • 门控残差(Gated Residual):README 中称,带归一化的残差流是深度模型训练可控的基础,而 Gated Residual 通过逐元素、数据相关的读门与逐分支的标量写门,来调节加宽残差流中的信息流动,从而在保持训练稳定性的同时提升跨层表达能力,并让推理开销维持在较低水平。
  • N-gram 嵌入:项目自述认为嵌入为参数扩展提供了另一条轴线,相比 Mixture-of-Experts 所需计算更少、也更适合卸载;通过短 n-gram 建立索引,可以在显存受限的加速器上高效扩展参数规模,同时不牺牲质量。
  • 定制训练配方:据项目说明,Muon 与 AdamW 优化器被分别应用于特定权重类别以提升效率;在重新拟合的 scaling law 指导下,训练取消了传统的 batch-size warmup,直接从目标 batch size 起步,从而大幅减少优化器步数,同时安全地支持更大的学习率以获得稳健收敛。

在模型结构层面,模型卡给出了较详细的规格:这是一个带视觉编码器的因果语言模型,训练阶段包含预训练与后训练。语言模型部分参数量为 125B,其中激活 6B,另有 51B 的 n-gram 嵌入参数与 4B 的 MTP 参数;隐藏维度 2560;token 嵌入为 248320(带 padding);n-gram 嵌入规模为 20,000,000,在第 2 层使用 bigram/trigram;层数 48,隐藏层布局为 12 ×(3 ×(Gated DeltaNet → MoE)→ 1 ×(Qwen Sparse Attention → MoE))。Gated DeltaNet 部分线性注意力头数为 V 方向 48、QK 方向 16,头维度 128;Qwen Sparse Attention 部分 Q 头 24、KV 头 2,头维度 256,旋转位置嵌入维度 64,索引器结构为 4 个查询头加 1 个共享键头的 MQA,索引器头维度 128,预算为 512 个 block 或 2048 个 token。MoE 部分专家数 512,激活 10 个路由专家加 1 个共享专家,专家中间维度 640。Gated Residual 分支数为 4,瓶颈秩 320。LM 输出维度 248320(带 padding)。MTP 为 1 层,采用多步训练。上下文长度原生 262,144 token,可扩展至 1,000,000 token。

此外,模型卡提到该仓库的产物兼容 Hugging Face Transformers、vLLM、SGLang、TokenSpeed 等推理与部署框架。项目自述还提到,若使用者希望免去基础设施维护、使用托管式可扩展推理,官方提供 Qwen Cloud 的 API 服务;其中 Qwen3.8-Flash 被描述为基于 Qwen3.8-Flash-Next 的官方版本,具备更多生产特性,例如默认 1M 上下文长度与官方内置工具。这部分属于项目方对配套服务的说明,本仓库本身仍是权重发布。

使用入口

仓库地址为 Qwen3.8-Flash-Next,权重与配置文件均在该页面提供。

关于调用方式,项目自述给出的信息是:仓库内为 Hugging Face Transformers 格式的后训练模型权重与配置,因此可通过 Transformers 加载;同时这些产物兼容 vLLM、SGLang、TokenSpeed 等框架。素材中没有给出具体的安装命令、依赖版本或示例代码,因此这里不代为补全。若需要托管式调用而非自行部署,项目自述指向官方 Qwen Cloud API 服务,具体接入方式需查阅官方文档。

许可与限制

许可证按官方接口字段为 other,即自定义许可,以仓库 LICENSE 为准,本文不对其商用与否作出判断。

使用边界方面,可依据素材明确提到的几点:其一,这是一个实验性预览发布,项目自述将其定位为「将支撑 Qwen4 的架构」的早期公开权重,而非最终产品形态;其二,模型规模较大,语言模型部分 125B 参数、激活 6B,另有 51B n-gram 嵌入与 4B MTP,对部署环境的显存与工程能力有相应要求,素材未列出具体硬件门槛,实际部署前需自行评估;其三,原生上下文长度为 262,144 token,扩展至 1,000,000 token 属于可扩展能力,并非默认配置;其四,模型卡中提到的 Qwen3.8-Flash 官方版本所具备的默认 1M 上下文与内置工具等生产特性,属于配套服务范畴,不等同于本仓库权重的能力。

最后需要说明,素材中出现的基准测试表格与对比数据均为项目方自述内容,本文未对其做独立验证,也不在此复述具体分数。