AB
AiBoss
News

Aleph Alpha 发布 Kolibri:78.1B 参数英德双语 MoE 模型,每 token 仅激活 3.46B

德国 Aleph Alpha 发布开放权重英德双语 MoE 模型 Kolibri,总参数 78.1B、每 token 仅激活 3.46B,支持最长 1,048,576 token 上下文,以 Apache 2.0 许可在 Hugging Face 发布,面向公共管理、工业与航空航天等受监管领域的自主部署。

核心事实

德国 AI 公司 Aleph Alpha 发布了开放权重语言模型 Kolibri(Kolibri-1),这是一款面向德语和英语的混合专家(MoE)模型。据其技术报告,模型总参数为 78.1B,但每个 token 仅激活 3.46B,约占 4.4%。模型支持最长 1,048,576 token 的上下文,允许按请求设置推理强度(reasoning effort),并以 Apache 2.0 许可在 Hugging Face 上发布 FP8 与 BF16 权重。

部署方面,据该报道,FP8 检查点约 78GB,可在单张 B200、B300 或 H200 上运行,也可使用 2 张 H100 SXM5,通过 vLLM 配合专用的 Kolibri 推理与工具调用解析器提供服务。默认上下文为 262,144 token,需通过参数覆盖才能启用完整的 1M 窗口。

背景与影响

Kolibri 由 Aleph Alpha 在德国的团队端到端开发,训练基础设施位于德国和芬兰。报道称其设计面向欧盟《通用人工智能行为准则》、《人工智能法案》与 GDPR,数据管线在训练前会移除个人数据。架构上,模型堆叠 50 个 transformer 块,模型宽度 2,560;每个 MoE 层用 sigmoid 路由器对全部 384 个路由专家打分,每 token 送入前 6 个,并始终运行 1 个共享专家。注意力采用分组查询注意力,48 个查询头与 4 个 KV 头;每第 5 个块使用不带位置编码的完整注意力,其余 40 个块对前 512 个 token 使用带 RoPE 的滑动窗口注意力。

分词器使用 128,000 词表,报道称在德语文本上达到每 token 4.90 字节,相比 GPT-5 分词器的 4.35 字节,德语网页文本可减少 11.2% 的 token 数。训练方面,预训练覆盖 20T token,使用 768 张 NVIDIA B200 GPU,随后进行 3.44T token 的中期训练与 201B token 的长上下文阶段;后训练结合监督微调与在超过 120 万个内部任务上的强化学习。报道还称,在 Aleph Alpha 比较的 12 个 MoE 模型中,Kolibri 的英语(75.5)与德语(70.8)综合得分最高,但在 BFCL v4 上以 61.4 落后于 Qwen3.5 的 70.5。

限制与来源

上述参数、架构、训练规模与基准分数均来自 Aleph Alpha 的技术报告及 MarkTechPost 的报道,本站未独立验证。报道提到目前尚无厂商托管的 API 服务,也暂无 GGUF/Ollama 支持,需通过 vLLM 自行部署。模型的实际可用性、许可条款、硬件要求与采样参数建议可能变化,请以 Aleph Alpha 官网与 Hugging Face 模型卡当前信息为准。

来源:MarkTechPost