「AI能做竞赛题」不算新闻,「AI按人类评分员的标准拿金牌」才是有分量的一步。
NVIDIA于10月7日前后公布了一项围绕Nemotron 3的微调研究。公开数据显示,微调后的模型在国际信息学奥林匹克(IOI 2026)上取得约535.4/600分,在国际数学奥林匹克(IMO 2026)上取得约30/42分,两者均跨过对应赛事的金牌线。其中IMO成绩由官方评分员按正式标准判卷,可信度更高;IOI则属于非官方跑分口径。
方法拆解: 这套方案是三段式的组合——先用监督微调(SFT)补齐专业领域能力,再用强化学习(RL)去攻克边界难题,最后用GenCorrect做多轮「生成-评估-修正」的自我纠错。这一思路并不颠覆,但把「竞赛级」从单点模型能力,拆解成了可复现的训练与后处理流程。
背景与含义: 竞赛数学长期被视为衡量模型推理上限的标尺,因为题目「无套路可背」,需要真正的证明与构造能力。Nemotron此次跨过IMO金牌线,延续了近期「用推理+验证闭环逼近竞赛水平」的行业主线,也与OpenAI同期公开数学成果形成对照。对产业,这类能力的落点不在「参赛」,而在于把严谨的证明式推理迁移到代码验证、科研辅助与工业难题求解。观察点在于:非官方IOI跑分的可比性,以及跨届题目上的泛化是否稳健。
事实以NVIDIA相关发布与公开评测说明为准。