↑

NVIDIA|微调Nemotron达竞赛数学金牌水平

PromptTree|阅读 1
2026/10/08 08:35
NVIDIANemotronIMO竞赛数学推理
NVIDIA公布对Nemotron 3的微调成果:在IOI 2026与IMO 2026上分别取得约535.4/600与30/42,跨过两大赛事金牌线;方法上采用SFT补专业能力、强化学习攻边界难题、GenCorrect多轮生成-评估-修正的组合。

「AI能做竞赛题」不算新闻,「AI按人类评分员的标准拿金牌」才是有分量的一步。

NVIDIA于10月7日前后公布了一项围绕Nemotron 3的微调研究。公开数据显示,微调后的模型在国际信息学奥林匹克(IOI 2026)上取得约535.4/600分,在国际数学奥林匹克(IMO 2026)上取得约30/42分,两者均跨过对应赛事的金牌线。其中IMO成绩由官方评分员按正式标准判卷,可信度更高;IOI则属于非官方跑分口径。

方法拆解: 这套方案是三段式的组合——先用监督微调(SFT)补齐专业领域能力,再用强化学习(RL)去攻克边界难题,最后用GenCorrect做多轮「生成-评估-修正」的自我纠错。这一思路并不颠覆,但把「竞赛级」从单点模型能力,拆解成了可复现的训练与后处理流程。

背景与含义: 竞赛数学长期被视为衡量模型推理上限的标尺,因为题目「无套路可背」,需要真正的证明与构造能力。Nemotron此次跨过IMO金牌线,延续了近期「用推理+验证闭环逼近竞赛水平」的行业主线,也与OpenAI同期公开数学成果形成对照。对产业,这类能力的落点不在「参赛」,而在于把严谨的证明式推理迁移到代码验证、科研辅助与工业难题求解。观察点在于:非官方IOI跑分的可比性,以及跨届题目上的泛化是否稳健。

事实以NVIDIA相关发布与公开评测说明为准。