AB
AiBoss站
project

MiMo-V2.6-Pro-RL - 小米 MiMo 系列面向自我改进的旗舰强化学习检查点

MiMo-V2.6-Pro-RL 是小米 MiMo 团队发布在 Hugging Face 上的旗舰强化学习检查点,采用 MIT 许可,任务类型为 text-generation,基于 transformers 框架。据项目自述,该系列围绕「将强化学习扩展到自我改进」构建,模型原生支持文本、图像、视频与音频,上下文长度达 1M tokens,并给出 SGLang 与 vLLM 两种部署方式。

MiMo-V2.6-Pro-RL 是小米 MiMo 团队在 Hugging Face 上发布的旗舰检查点(checkpoint),仓库归属 XiaomiMiMo,任务类型为 text-generation,框架标注为 transformers。据项目自述,MiMo-V2.6 系列的目标是「将强化学习扩展到自我改进」(Scaling Reinforcement Learning Toward Self-Improvement),即同时扩展强化学习算力、环境多样性与评分器算力,让模型通过探索与反馈持续拓展能力边界。它面向的是需要长上下文、多模态输入与智能体(agent)能力的开发者与研究者:既包括希望直接调用托管服务的应用方,也包括打算自行部署推理服务的工程团队。

维护者与状态

该仓库由 XiaomiMiMo 维护,创建时间为 2026-09-21,最后更新时间为 2026-09-22,属于新近发布的模型仓库。许可证为 mit。截至 2026-09-24,近 30 天下载量为 4070,点赞数为 450。事实表中未提供正式 release 版本号信息,因此本文不对版本发布节奏作任何推断。

主要能力

以下能力均来自项目自述(模型卡与技术报告摘要),并非第三方评测结论。

  • 原生全模态与长程能力:据项目说明,模型在同一套权重内处理文本、图像、视频与音频,上下文长度达 1M tokens,可用于长代码仓库、工具调用轨迹(tool traces)以及多轮会话的智能体运行。
  • 「You Only RL Once」混合强化学习:项目自述其做法是把编码、通用智能体、视觉与网络安全等方向混合进同一次强化学习训练,而不是按领域分别训练;同一批次内混合任务与多种执行框架(harness),使能力之间相互强化,并让策略迁移到训练中未见过的框架上。
  • 强化学习算力扩展:据模型卡描述,训练采用完全异步的 GRPO(Group Relative Policy Optimization),批次规模为每步 1,568 条 prompt × 16 次 rollout,每次更新涉及数十亿 tokens。
  • 分组式智能体评分(自我改进闭环):项目自述指出,二值化的通过/失败信号无法对「都通过」的解法排序,因此对奖励信号本身做了扩展。其中 Groupwise Reward Synthesis(GRS)离线地从对比性 rollout 中构建任务专属评分细则,并把细则质量与测试结果融合;Groupwise Advantage Redistribution(GAR)在线对通过的轨迹排序,把优势值移向质量更高的解法。项目称该机制以策略自身采样为参照,形成自我改进闭环,并引导模型走向更短路径与更少 token 消耗。
  • 对齐强化学习:据项目说明,模型从自我纠错冷启动,会把自身不恰当的回答反思并改写为有依据的下一步;训练过程中通过环境加固、对抗性筛查与验证器交叉检查来抑制奖励黑客(reward hacking)。
  • MOPD2 蒸馏:混合强化学习之后,项目采用 Multi-Prefix Multi-Teacher On-Policy Distillation,把自主学生 rollout 与带前缀条件的单轮 rollout(Teacher-Prefix 与 SFT-Prefix)结合,复用教师轨迹与 SFT 演示中的历史,使决策点无需重新生成前序轮次即可参与训练,从而把能力扩展到难以验证的任务上。

在模型结构方面,项目自述其骨干为稀疏 MoE 架构,总参数 1.02T、激活参数 42B,上下文长度 1M tokens,视觉编码器为 681M 参数的 MiMo ViT,音频侧包含 308M 的 AudioTokenizer 与 127M 的音频 patch 编码器,并配有 5 层多 token 预测(MTP)推测解码器。模型卡同时列出了大量基准评测表格,但这些数字属于项目自述,本文不逐项复述,也不对其可信度作判断。

使用入口

模型仓库地址为 MiMo-V2.6-Pro-RL,权重与模型卡均在该页面提供。

据项目说明,部署可参考 SGLang 的 MiMo cookbook,官方给出的 Docker 镜像为 lmsysorg/sglang:latest。模型卡中的 SGLang 启动示例大致如下(多行命令,参数以仓库原文为准):

sglang serve --trust-remote-code --model-path XiaomiMiMo/MiMo-V2.6-Pro-RL --tp 16 --dp 2 --enable-dp-attention --mm-enable-dp-encoder --ep 16 --moe-a2a-backend deepep --moe-dense-tp-size 1 --mem-fraction-static 0.7 --max-running-requests 128 --chunked-prefill-size 32768 --page-size 64 --swa-full-tokens-ratio 0.3 --speculative-algorithm EAGLE --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4 --enable-multi-layer-eagle --reasoning-parser mimo --tool-call-parser mimo --host 0.0.0.0 --port 30000 --nnodes 2 --node-rank --dist-init-addr :20000

项目同时给出 vLLM 路径,建议参考 vLLM 的 MiMo-V2.5 recipe,预构建镜像为 docker pull vllm/vllm-openai:mimov25-cu129,启动命令示例为:

vllm serve XiaomiMiMo/MiMo-V2.6-Pro-RL --tensor-parallel-size 8 --trust-remote-code --gpu-memory-utilization 0.95 --max-model-len auto --reasoning-parser mimo --tool-call-parser mimo --enable-auto-tool-choice --generation-config vllm

模型卡推荐的采样参数为 temperature=1.0top_p=0.95。此外,项目自述该模型也可通过 AI Studio、MiMo Code、Xiaomi MiMo Desktop、小米 MiMo 开放平台 API 以及 OpenRouter 使用。

许可与限制

许可证为 mit,可按照该许可证条款使用,具体以仓库内 LICENSE 文件为准。

关于限制与前置条件,需要以项目自述为准:其一,上述部署命令涉及张量并行、专家并行与多节点配置(例如 --tp 16--nnodes 2),说明自行部署对硬件规模有较高要求,并非单卡可跑;其二,命令中带有 --trust-remote-code,意味着需要信任并执行仓库中的自定义代码,使用前应自行评估;其三,模型卡中的评测数字、参数规模与架构细节均为项目方自述,本文未做独立验证;其四,模型卡未在本文所引用的范围内说明具体的显存占用、最低硬件门槛与商用限制条款,这些信息需以仓库最新文档为准。