英伟达微调 Nemotron 家族,称在 IOI 与 IMO 双双达到金牌水平
英伟达团队在 Hugging Face 博客发文称,基于 Nemotron 3 通过监督微调、强化学习与生成-验证-修正推理流程,其专用模型在 IOI 2026 与 IMO 2026 达到金牌分数线,并公开了部分模型、数据集与推理流程。
核心事实
英伟达团队在 Hugging Face 博客发布文章,介绍其基于 Nemotron 3 的模型微调工作。据该文,团队通过监督微调(SFT)、强化学习(RL)以及反馈驱动的推理流程,构建出在两项竞赛中达到金牌水平的专用系统:在 IOI 2026 中,Nemotron-3-Ultra-CC 结合 SFT 与 GenCorrect 取得 535.4/600 分,高于 361.12 的金牌线;在 IMO 2026 中,由 Nemotron 3 Ultra 的通用、SFT 与 RL 检查点组成的生成-验证-修正系统取得 30/42 分,高于 29 分的官方金牌线。
背景与影响
文章称,IOI 侧重算法与代码在严格时限下通过隐藏测试,IMO 则要求严谨的自然语言证明,两者能力要求不同。团队总结出一套可复用的专业化流程:以较强的 Nemotron 基座模型为起点,整理领域问题与高质量推理轨迹,应用 SFT 及必要的 RL,再配合生成、评估、改进候选答案的推理循环。IOI 方向整理了 22,000 道题并生成合成推理轨迹;IMO 方向的 SFT 语料包含 414,890 条经过质量筛选的样本,覆盖 15,818 道证明题,RL 模型则在 9,597 道证明题上训练。文章强调,成绩来自模型、数据与推理流程的协同设计,而非单纯微调或暴力采样。
限制与来源
文章说明,IOI 结果为一次前瞻性实跑,采用与人类选手相同的时间、联网与提交限制,但属于非官方、无监督的基准测试,未计入官方 IOI 排名;IMO 系统提交的证明由官方 IMO 评分员评阅。相关模型、数据集与推理流程已在 Hugging Face 与 NeMo-Skills 仓库公开,具体可用范围、许可与版本请以官网当前信息为准。本文信息来自 Hugging Face 博客文章,相关竞赛成绩尚未获得独立第三方确认。