AB
AiBoss站
project

Naive-N0.5-Flash - 面向编程与 AI 研发的 309B 稀疏注意力 MoE 开放权重模型

Naive-N0.5-Flash 是 NaiveAI 发布的开放权重 MoE 文本生成模型,总参数 309B、激活参数 15.5B,采用滑动窗口注意力与 DeepSeek 稀疏注意力混合结构,项目自述原生支持 1M token 上下文,主要面向编程与 AI 研发场景。仓库以 MIT 许可发布,截至 2026-10-02 近 30 天下载 1167 次、点赞 127。

Naive-N0.5-Flash 是 NaiveAI 发布的一个开放权重文本生成模型,采用混合专家(MoE)架构,总参数 309B、激活参数 15.5B。据项目自述,它面向编程与 AI 研发两类任务,通过滑动窗口注意力(SWA)与 DeepSeek 稀疏注意力(DSA)的混合结构实现原生 1M token 上下文,网络中不含全注意力层。它适合需要长上下文代码理解与生成、以及希望自行部署开放权重模型的开发者与研究团队;由于权重体积与硬件门槛较高,个人小规模本地运行并不现实。

维护者与状态

该模型由 NaiveAI 维护,托管在 Hugging Face 上,任务类型标注为 text-generation。仓库创建于 2026-09-27,最后更新同样为 2026-09-27,即发布当天完成建仓与更新,此后暂无新的版本记录。事实表中没有给出正式 release 信息,因此这里不对版本节奏做任何推断。

热度方面,截至 2026-10-02,该仓库近 30 天下载量为 1167 次,点赞数为 127。这两个数字反映的是发布后短时间内的关注度,样本窗口很短,不宜据此判断长期使用规模。

主要能力

以下内容均来自项目自述(模型卡),未经本站独立验证,其中的性能数字与架构参数请以官方说明为准。

  • 长上下文与稀疏注意力。据项目说明,模型采用 SWA 与 DSA 混合的注意力布局,整体网络保持局部或稀疏,没有全注意力层。模型卡给出的配置为 48 层 Transformer,其中 39 层为 SWA、9 层为 DSA;SWA 窗口为 128 token,DSA 为骨干注意力选取 top 2,048 个 token,DSA 的 KV 分组为 4(GQA4),索引器查询头为 16。网络被组织为八个六层模块,标准模块为五层 SWA 加一层 DSA,第一个模块的首层也替换为 DSA。
  • 面向编程与 AI 研发。项目自述该模型主要面向 coding 与 AI R&D 场景,并在模型卡中给出了编程与智能体任务、以及 AI 研发类任务的评测图示。需要说明的是,这些评测结果由项目方自行给出,本站未复现,也不在此转述具体分数。
  • 推理系统与吞吐。据项目说明,配套推理系统 NaiveRT 结合了大内核融合、Programmatic Dependent Launch(PDL)与投机解码,标准模式下每用户 50 tokens/s,Ultrafast 模式下最高可达 2,000 tokens/s。这些数字来自项目自述,属于其宣称的优化目标,实际表现取决于硬件与部署配置。
  • 训练过程。模型卡称,在架构调整之后完成了 3.25T token 的多阶段训练,包含 50B token 的索引器预热、3T token 的稀疏注意力训练与 200B token 的学习率衰减,以适配新的稀疏注意力结构。模型基于开放权重的 MiMo-V2.5 基础模型继续预训练而来。
  • 开放权重与 API。据项目说明,模型权重与推理代码以 MIT 许可发布,同时计划提供 API 访问,并给出输入、输出与缓存读取每百万 token 分别为 $0.10 / $0.40 / $0.01 的定价。该定价为项目自述,是否生效、是否调整以官方渠道为准。

使用入口

模型仓库地址:Naive-N0.5-Flash。

据模型卡说明,模型支持 FP8 混合精度推理,需要具备 FP8 能力的 NVIDIA GPU,权重体积约 315 GB,另需为推理预留额外显存。推荐采样参数为 temperature=1.0、top_p=0.95。模型卡给出的 Transformers 调用方式如下,安装依赖:

pip install "transformers[torch,kernels]>=5.17.0"

加载与生成示例(照模型卡原文,模型 ID 为 NaiveAI/Naive-N0.5-Flash-FP8):

from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "NaiveAI/Naive-N0.5-Flash-FP8"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    trust_remote_code=True,
    dtype="auto",
    device_map="auto",
)

inputs = tokenizer.apply_chat_template(
    [{"role": "user", "content": "Hello!"}],
    add_generation_prompt=True,
    return_dict=True,
    return_tensors="pt",
).to(model.device)

output = model.generate(**inputs, max_new_tokens=2048)
response = tokenizer.decode(
    output[0, inputs["input_ids"].shape[1]:],
    skip_special_tokens=True,
)
print(response)

注意示例中启用了 trust_remote_code,加载前应自行确认远程代码内容。

许可与限制

许可证为 mit。模型卡同样声明以 MIT License 发布,权重与推理代码均在此许可下开放。

已知限制与前置条件(据项目自述):

  • 硬件门槛较高:需要支持 FP8 的 NVIDIA GPU,权重约 315 GB,另需额外显存用于推理,普通消费级设备难以承载。
  • 上下文虽为原生 1M token,但模型卡说明索引器仍需扫描完整历史,完整 KV 缓存也会保留,稀疏注意力降低的是注意力计算与内存访问开销,而非取消长上下文的存储成本。
  • 模型卡中的评测结果、吞吐数字与 API 定价均为项目方自述,本站未做独立验证,也未复现任何基准测试。
  • 模型定位为编程与 AI 研发,其他领域的适用性项目方未作说明。

如需引用该模型,模型卡提供了 BibTeX 条目,作者标注为 NaiveAI Team,年份 2026。