AB
AiBoss站
project

MiMo-V2.6-Flash-RL - 小米 MiMo-V2.6 系列中效率均衡的强化学习检查点

MiMo-V2.6-Flash-RL 是小米 MiMo 团队发布在 Hugging Face 上的文本生成模型,采用 MIT 许可,基于 transformers 框架。据项目自述,它是 MiMo-V2.6 系列中效率均衡的检查点,主打把强化学习算力、环境多样性与评分算力一起放大,让模型通过探索与反馈持续扩展能力边界。

MiMo-V2.6-Flash-RL 是小米 MiMo 团队发布在 Hugging Face 上的一个文本生成模型,仓库任务类型为 text-generation,依赖 transformers 框架。据项目自述,它是 MiMo-V2.6 系列中「效率均衡」的检查点,整个系列的目标是「把强化学习推向自我改进」——同时放大强化学习算力、环境多样性与评分算力,让模型通过探索与反馈不断扩展能力边界。它面向的是需要在代码、通用智能体、视觉与安全等方向做长程任务推理与工具调用的开发者,以及希望基于开源权重自行部署推理服务的团队。

维护者与状态

该仓库由 XiaomiMiMo 维护,创建时间为 2026-09-21,最后更新时间为 2026-09-22。截至 2026-09-23 的数据读取时间,近 30 天下载量为 2641,点赞数为 386。事实表中未列出该仓库的正式 release 信息,因此这里不对版本发布情况做额外推断。许可证为 mit。

主要能力

以下能力均来自项目自述(README / 模型卡),并非第三方评测结论。

  • 原生全模态与长程上下文:据项目说明,文本、图像、视频、音频由同一个模型处理,上下文长度达 1M tokens,可用于长仓库、工具调用轨迹以及多轮会话的智能体运行。
  • You Only RL Once:项目自述称,编码、通用智能体、视觉与网络安全等方向在同一个混合强化学习流程中完成,而不是按领域分别训练;任务与多种 harness 混在同一批次里,使能力之间相互强化,并让策略迁移到训练中未见过的 harness。
  • 强化学习算力扩展:README 中称其使用完全异步的 GRPO(Group Relative Policy Optimization),批次规模很大——每步 1,568 条 prompt × 16 次 rollout,每次更新涉及数十亿 tokens。
  • 分组式智能体评分(自我改进闭环):项目自述指出,二值化的通过/失败无法对通过的解法排序,因此对奖励信号本身也做了扩展。智能体评分器在每一组内部比较 rollout:Groupwise Reward Synthesis(GRS)离线从对比 rollout 中构建任务专属评分标准,并把评分标准质量与测试结果融合;Groupwise Advantage Redistribution(GAR)在线对通过轨迹排序,把优势向更高质量的解法倾斜。据项目说明,这一机制以策略自身样本为参照,形成自我改进闭环,并引导模型走向更短路径与更少 tokens。
  • 对齐强化学习:据项目说明,模型从自我纠错冷启动,会反思并重写自身不合适的回合,使其变成有依据的下一步;训练过程中通过环境加固、对抗筛选与验证器交叉检查,抑制 reward hacking。
  • MOPD2 蒸馏:项目自述称,混合强化学习之后采用 Multi-Prefix Multi-Teacher On-Policy Distillation,把学生自主 rollout 与带前缀条件的单轮 rollout(Teacher-Prefix 与 SFT-Prefix)结合,复用教师轨迹与 SFT 演示中的历史,使决策点无需重新生成前序回合即可训练,从而把能力扩展到难以验证的任务上。

模型结构方面,项目自述给出的信息包括:稀疏 MoE 架构,总参数 309B、激活参数 15B;上下文长度 1M tokens;视觉编码器为 681M 参数的 MiMo ViT(28 层,其中 24 层 SWA、4 层 Full);音频侧为 308M 的 AudioTokenizer 加 127M 的音频 patch 编码器;并配有 5 层投机解码器(MTP)。这些数字均出自项目自述,本文未做独立验证。

使用入口

模型权重与说明文档位于 XiaomiMiMo/MiMo-V2.6-Flash-RL

据项目说明,部署可参考 SGLang 的 MiMo cookbook,Docker 镜像为 lmsysorg/sglang:latest,示例启动命令如下:

sglang serve \
  --trust-remote-code \
  --model-path XiaomiMiMo/MiMo-V2.6-Flash-RL \
  --tp 8 \
  --dp 2 \
  --enable-dp-attention \
  --enable-dp-lm-head \
  --mm-enable-dp-encoder \
  --mem-fraction-static 0.65 \
  --chunked-prefill-size 16384 \
  --speculative-algorithm EAGLE \
  --speculative-num-steps 3 \
  --speculative-eagle-topk 1 \
  --speculative-num-draft-tokens 4 \
  --enable-multi-layer-eagle \
  --reasoning-parser mimo \
  --tool-call-parser mimo \
  --host 0.0.0.0 \
  --port 30000

项目自述同时给出了 vLLM 路径,建议参考 vLLM 的 MiMo-V2.5 配方,并提示稳定版 vLLM 可能滞后,预构建镜像为 vllm/vllm-openai:mimov25-cu129

vllm serve XiaomiMiMo/MiMo-V2.6-Flash-RL \
  --tensor-parallel-size 4 \
  --trust-remote-code \
  --gpu-memory-utilization 0.95 \
  --max-model-len auto \
  --reasoning-parser mimo \
  --tool-call-parser mimo \
  --enable-auto-tool-choice \
  --generation-config vllm

据项目说明,推荐采样参数为 temperature=1.0top_p=0.95。README 中还提到该模型可在 AI Studio、MiMo Code、Xiaomi MiMo Desktop、小米 MiMo 开放平台 API 以及 OpenRouter 上获取。

许可与限制

许可证为 mit,可按照该许可证条款使用,具体以仓库内 LICENSE 文件为准。

关于限制与前置条件,项目自述中明确提到的部分包括:SGLang 示例使用 --tp 8 --dp 2,vLLM 示例使用 --tensor-parallel-size 4--gpu-memory-utilization 0.95,说明本地部署对多卡与显存有较高要求;两个示例都需要 --trust-remote-code,即需要信任并执行仓库自带代码;项目自述还提示稳定版 vLLM 可能滞后于该模型的支持进度。此外,README 中列出的评测表格属于项目自述内容,本文未对其中的基准分数做独立核验,也不将其作为中立结论呈现。除上述内容外,本文不额外推断该模型的硬件适配范围或商用结论。