AB
AiBoss
project

AliceAI-Foundation-80B-A3B-Base - Yandex 开源的 80B 总参 / 3B 激活混合架构基础模型

AliceAI-Foundation-80B-A3B-Base 是 Yandex 在 Hugging Face 上开源的基础语言模型,采用混合架构与 MoE 层,总参数 80B、每 token 激活 3B,支持最长 262144 token 上下文,许可证为 apache-2.0。本文按官方接口信息与项目自述整理其架构、能力、使用入口与限制。

AliceAI-Foundation-80B-A3B-Base 是 Yandex 发布在 Hugging Face 上的一个基础语言模型(base model),任务类型为 text-generation,框架标注为 transformers。从命名可以看出它的两个关键数字:总参数量 80B,而每个 token 只激活其中 3B。据项目自述,这是一款采用混合架构并包含 MoE 层的基础模型,支持最长 262144 token 的上下文,并且是「完全从零开始训练」的。它面向的是需要长上下文、俄语事实性知识,以及希望在此基础上做后续微调或继续预训练的开发者与研究者。

维护者与状态

该模型由 yandex 维护,仓库位于 Hugging Face。根据官方接口数据,仓库创建时间为 2026-09-12,最后更新时间为 2026-09-22。截至 2026-09-23,近 30 天下载量为 1516,点赞数为 277。许可证为 apache-2.0。

需要说明的是,事实表中没有给出该仓库的正式 release 记录,因此这里不对版本发布节奏做任何推断。模型页面上呈现的是权重与配套材料本身,而非某个带版本号的发行包。

主要能力

以下内容来自项目自述(模型卡),属于维护者自己的描述,不是第三方评测结论。

  • 混合架构 + MoE:据项目说明,模型为自回归语言模型,处于预训练阶段。隐藏状态维度 2048,词表大小 129024,共 48 层。层结构被描述为 12 × (3 × (KDA → MoE) → 1 × (Gated Attention → MoE)),即 KDA 层与 Gated Attention 层按一定比例交替,每层后接 MoE。
  • KDA 层配置:项目自述给出 query 头 32、KV 头 32、query 头维度 128、KV 头维度 128、卷积核大小 4。
  • Gated Attention 配置:query 头 16、KV 头 2、query 头维度 256。
  • MoE 配置:专家数量 512,Top-K 为 10 加 1 个共享专家,专家中间维度 512。
  • MTP:包含 1 层 MTP(多 token 预测)结构,项目自述的 vLLM 启动示例中也用到了对应的投机解码配置。
  • 长上下文:上下文长度标注为 262144 token。
  • 训练方式:据项目说明,训练语料、架构与超参数均为重新构建与选择,并针对复杂推理和工具调用准备了数据;关键决策通过一系列各自 2 万亿 token 规模的从零训练进行验证。
  • 俄语事实性:项目自述称其在数学、编程等推理任务上达到更大规模开源模型的水平,并在俄语事实性知识任务上表现突出。随权重一并发布的还有面向俄语语境的事实性基准 WikiWebFacts 与 HardMultiQA,以及相应的评测协议。
  • 工具与推理标记:据项目说明,[COT_ENABLE][COT_START][COT_END] 以及工具相关标记都是词表中的普通原子 token,而非 Hugging Face 的特殊 token。

模型卡中列出了一批基准测试结果,覆盖俄语事实、教育、专家知识、数学、代码与长上下文等类别。这些数字均出自项目自述,本文不逐项复述,也不做横向比较;如需核对,请以仓库页面上的原始表格为准。

使用入口

模型权重与说明文档位于 yandex/AliceAI-Foundation-80B-A3B-Base

据项目说明,模型可以通过 Transformers 或 vLLM 两种方式运行。

Transformers 路径下,项目给出的参考版本为 Transformers 5.16.1,并提示在 GPU 上执行 KDA 层需要带 KDA 支持的 flash-linear-attention。安装示例:

python3 -m venv .venv
source .venv/bin/activate
pip install \
  transformers[sentencepiece]==5.16.1 \
  accelerate==1.14.0 \
  flash-linear-attention==0.5.0

调用时使用 AutoModelForCausalLMAutoTokenizer,并开启 trust_remote_code,以 bfloat16 加载、device_map="auto" 分配设备。

vLLM 路径下,项目说明需要 Docker 与 NVIDIA Container Toolkit,并给出了以 4 卡张量并行启动的示例,其中包含 --tensor-parallel-size 4--attention-backend FLASH_ATTN 以及 MTP 投机解码配置。服务启动后可通过 /v1/completions 接口发送请求。

分词方面,项目说明分词器以 LlamaTokenizer 形式从 tokenizer.model 加载,使用 SentencePiece BPE;tokenizer_config.jsonlegacy 被显式设为 false,项目提示不要将其改为 true

关于微调,项目自述提到训练时使用了标准 OpenAI Messages 格式来组织智能体数据,轨迹由 systemuserassistanttoolmeta 等角色消息构成,工具定义单独放在 tools 字段,并在分词前通过 chat_template.jinja 渲染。

许可与限制

许可证为 apache-2.0,具体条款以仓库中的 LICENSE 文件为准。

关于限制与前置条件,项目自述中明确提到的包括:运行 KDA 层需要带 KDA 支持的 flash-linear-attention;vLLM 路径依赖 Docker 与 NVIDIA Container Toolkit;示例以多卡张量并行为前提,若要使用全部 GPU 需相应调整设备参数与张量并行规模;分词器配置中的 legacy 不应被改为 true。此外,这是一个预训练阶段的基础模型,并非经过对齐的对话模型,项目自述中也没有给出量化版本、最低显存要求或推理速度方面的数据,实际部署前需要自行评估硬件条件。

本文所述能力与用法均来自官方接口信息与项目自述,未做独立验证。