结论:后训练与测试时迭代使Nemotron实现金牌级超越

NVIDIA团队于Asia/Shanghai 9月3日首次公开的预印本报告端到端后训练管线取得竞赛编程突破:在IOI 2025上Nano-CC经GenCorrect达468分超越金牌线438.3,Ultra-CC达502分;在前瞻性IOI 2026非官方评测中,竞赛特化Ultra-CC以535.4/600分同时超越金牌线361.12与最高人类得分498.27,作者称首次AI超越IOI最高分。该结论为作者在受控harness与固定提交预算下的实验结果,仍为预印本未同行评审、限竞赛基准。

研究对象与方法

研究对象为大语言模型在IOI、ICPC等高难度竞赛编程中的推理与代码生成能力,强调新算法综合与约束推理而非常规补全。方法管线包括:其一22,000题库的自动化可执行环境清洗与去重;其二合成推理轨迹SFT,分别以DeepSeek-V4-Flash生成120万(Nano)与47.7万(Ultra)轨迹,含难易分层与自我精炼;其三仅对Nano的GRPO强化学习,基于可执行终端奖励(1/0)与无KL惩罚,372题验证集选优;其四GenCorrect测试时策略,每轮并行生成至200候选,经多样性聚类选10代表提交,累积子任务最佳分并携带反馈进入下一轮,末轮扩至1000候选并以执行生成测试输入的模型打分脚本重排。

评估条件与数据范围

评估覆盖IOI 2025、ICPC 2025世界总决赛与LiveCodeBench Pro,全部评测题已从SFT与RL训练中排除并去重,IOI 2026为赛前未公开的严格前瞻评测,在与人类相同时间、断网与每题50次提交、限本地执行的约束下进行,峰值占用760张GB300。基座为Nemotron-3-Nano-30B-A3B(3B激活)与Nemotron-3-Ultra-550B-A55B(55B激活),对照包括gpt-oss-120b、Qwen3.6-35B、DeepSeek-V4等。指标为IOI Score@1/Score@200(600分制归一与多运行均值)、ICPC与LCB Pro Pass@1。

主要结果

  • IOI 2025:Nano-CC单样本21.7%→48.5%(130→291分),Score@200 272→461;GenCorrect五轮均值Nano 360.6→468.2、Ultra 343.9→502.0,Ultra三轮即超金牌线,Nano四轮超线。 ICPC 2025:Nano 16.9%→51.0%(解题数8.6→9.4)、Ultra 54.0%→57.4%(9.0→9.6),均达或接近金牌队9题水平,Ultra一轮更早达9题。 LCB Pro:Nano 17.6%→71.6%、Ultra 72.6%→74.5%,超越多款同规模基座。 消融显示SFT贡献最大(Nano一轮SFT即达47.3%),RL仅约1-2个百分点且需强SFT初始化,规模与采样放大在Score@200与GenCorrect中进一步拉开Ultra优势。

以上提升均为作者报告的局部竞赛结果,经多运行平均(IOI超千次运行),但未在其他语言、真实项目或官方赛场复现。

限制、评审状态与潜在意义

该工作为预印本(arXiv:2609.02849,列于Thu, 3 Sep 2026的159篇cs.LG当日批次,提交Wed, 2 Sep 17:33 UTC对应上海9月3日01:33),尚未经同行评审。局限包括:限竞赛编程题型与作者harness,非官方排名且未受IOI监督;依赖教师模型短输出与大规模SFT,推理成本与能耗极高;自生成测试的执行选择可能引入偏差;未评估长程维护与真实工程约束。潜在意义在于揭示SFT与执行反馈驱动的测试时精炼是金牌级关键路径,为推理模型超越人类监督的扩展提供可复用范式,但向通用编程与生产部署转化仍需独立验证与成本评估。

作者强调,SFT提供了主要能力跃升,RL与GenCorrect在强初始化与足够采样下进一步放大,但RL的长程信用分配与稀疏信号仍是当前瓶颈。