英伟达公开奥赛夺金配方 开源模型拿下IMO金牌

开源模型第一次把「奥赛金牌配方」完整摊在了桌面上。英伟达在 Hugging Face 博客公布,其基于 Nemotron 3 Ultra 微调的系统在 2026 年国际数学奥林匹克(IMO)上拿到 30 分(满分 42),超过 29 分的金牌线,6 道题中有 4 道拿到满分。整个系统全程只用自然语言写证明,没有形式化证明器、外部工具,也不联网,提交的证明由 IMO 官方阅卷人评定。
编程侧的成绩更夸张。一套竞赛定制的 Nemotron-3-Ultra-CC 系统在与人类选手完全相同的时间、联网和提交限制下,在 IOI 2026(国际信息学奥林匹克)的非官方评测中拿到 535.4 分(满分 600),不仅远超 361.12 分的金牌线,还高于当年人类选手的最高分 498.27。这一成绩未计入官方排名。
配方分两篇论文公开(arXiv:2609.02849、2609.10712)。编程侧从 2.2 万道精选题目出发,训练了两个专用模型:Nemotron-3-Nano-CC(总参数 30B、激活 3B)做 SFT 加强化学习,Nemotron-3-Ultra-CC(总参数 550B、激活 55B)只做 SFT。真正的关键在推理环节:一套名为 GenCorrect 的「生成—评估—修正」循环,让 Nano-CC 在 IOI 2025 上的成绩从训练后的 291 分一路推到 468 分,跨过 438.3 的金牌线。
数学侧的思路类似但更讲究配合。团队构建了覆盖 15818 道证明题、共 414890 条样本的 SFT 语料,让模型学会写证明、补漏洞、回应批改和判断证明是否完整,再用 9597 道贴近能力边界的题目做强化学习。由于 SFT 和 RL 两个检查点各有所长,最终系统让通用版加两个专用版共三个 Nemotron 3 Ultra 检查点协同迭代搜索,再由一个高算力阶段挑选最终提交。事实证明,合并 SFT 与 RL 检查点比在单个检查点上多采样更有效。
英伟达把权重、训练数据、训练与推理代码、提交的全部证明,以及一个包含 200 道全新奥赛级题目的 Nemotron-IMO-Bench 一并开源。团队想说明的是:金牌既不是靠模型规模堆出来的,也不是靠提示词技巧碰运气,而是模型、数据和推理循环协同设计的结果——当然,这套配方高度依赖昂贵的测试时计算。此前小红书的 dots-note-3.0 已成为首个经 IMO 官方评阅拿到满分的模型;英伟达这次的意义不在分数更高,而在路线可复现:不强求前沿实验室,一个强开源底座加精心设计的数据与推理循环,也能摸到金牌线。
编译自 Hugging Face Blog,原标题:"Fine-Tuning Nemotron for Gold-Level IOI and IMO Results"
