核心发现
方法论
本研究提出端到端的专业化流程,包括大规模题库策划、合成推理轨迹生成、长上下文监督微调(SFT)及基于执行奖励的强化学习(RL)。利用22,000个题目,生成超过1.2百万推理轨迹,训练Nano-CC(30B-A3B)结合SFT和RL,以及Ultra-CC(550B-A55B)仅用SFT。引入GenCorrect策略,通过多轮生成、评估和优化多样解,提升模型性能。模型在IOI 2025中Score@1由130提升至291,经过GenCorrect后达468,超越官方金牌门槛438.3。Ultra-CC在IOI 2026中达535.4分,超越人类最高498.27,首次实现AI超越IOI顶尖人类。
关键结果
- Nano-CC在IOI 2025中Score@1由130提升至468,超越金牌门槛438.3,且在IOI 2026中达535.4分,超越人类最高水平。
- Ultra-CC仅用SFT达502分,未用RL,表现优异,验证了微调的关键作用。
- 引入GenCorrect多轮优化策略,显著提升模型解题能力,特别在多轮迭代中效果突出。
研究意义
该研究突破了AI在国际竞赛中的应用瓶颈,首次实现AI超越人类顶尖选手,推动AI reasoning和代码生成技术的前沿。其端到端流程为未来自动化编程、智能助教等应用提供技术基础,有望改变软件开发和教育模式。
技术贡献
提出结合大规模题库、合成推理轨迹、SFT和RL的完整训练流程,创新性引入GenCorrect测试策略,优化模型在有限提交次数下的解题质量。模型规模从30B到550B参数,验证了模型规模与性能的关系。实现了从数据策划到测试优化的闭环体系,显著提升竞赛表现。
新颖性
首次在国际竞赛中实现AI超越人类最高分,提出多轮生成与反馈的GenCorrect策略,结合大规模合成数据和强化学习,突破了传统模型训练的局限,展现出强大的推理和代码生成能力。
局限性
- 模型训练依赖大量高质量合成轨迹,成本高昂,实际部署受限于硬件资源。
- 在极端复杂或未见过的问题上仍可能表现不足,泛化能力有待提升。
- 多轮优化策略在某些场景可能引入过拟合风险,需进一步调优。
未来方向
未来将探索更高效的训练策略,减少对大规模合成数据的依赖,提升模型泛化能力。同时,结合多模态信息和自适应推理机制,增强模型在多样化竞赛环境中的表现。还将推动模型在实际软件开发和教育中的应用,逐步实现自动化编程和智能辅导。
AI 总览摘要
近年来,人工智能在自动编程领域取得了突破性进展,但在国际竞赛中超越人类顶尖选手仍是难题。传统模型多依赖有限数据和浅层微调,难以应对复杂推理和算法设计的挑战。本文提出一套端到端的专业化训练流程,结合大规模题库策划、合成推理轨迹、长上下文监督微调(SFT)和基于执行奖励的强化学习(RL),实现了AI在IOI等国际竞赛中的突破。通过22,000题的策划和超过1.2百万推理轨迹的生成,训练出Nano-CC(30B-A3B)和Ultra-CC(550B-A55B)模型。引入GenCorrect策略,在测试阶段多轮生成、评估和优化解答,大幅提升模型表现。结果显示,Nano-CC在IOI 2025中Score@1由130提升至468,超越官方金牌门槛438.3,且在IOI 2026中达535.4分,超越人类最高498.27。这一成果标志着AI在复杂推理和算法设计中的能力达到新高度,为未来自动化编程、智能教育和软件开发提供了坚实基础。该研究不仅验证了模型规模、数据质量和训练策略的关键作用,还展示了多轮迭代优化在有限提交预算下的巨大潜力。未来,研究将集中在提升模型泛化能力、降低训练成本,以及多模态推理的探索,推动AI在实际应用中的深度融合。
深度分析
研究背景
自动编程作为AI研究的重要方向,经历了从规则系统到深度学习模型的演变。早期方法如基于模板和搜索的系统逐渐被神经网络取代,代表性工作包括Codex、AlphaCode等。近年来,随着大规模预训练模型的发展,AI在代码生成和推理方面取得显著突破,但在复杂算法设计和竞赛环境中仍面临挑战。现有技术多依赖有限数据和微调,难以应对极端复杂问题。竞赛如IOI和ICPC成为检验模型推理和编码能力的理想平台,推动了技术的快速发展,但距离真正自主解决复杂问题仍有差距。
核心问题
核心问题在于如何通过大规模数据策划、合成推理轨迹和多轮优化,显著提升模型在国际竞赛中的表现。传统微调和微调不足以应对复杂算法设计的需求,模型在有限提交次数和时间限制下难以达到金牌水平。如何结合强化学习和生成式策略,优化模型解题能力,成为亟待解决的难题。这不仅关系到模型的推理深度,也涉及到数据质量、训练策略和测试优化的协同设计。
核心创新
本研究的创新点包括:1)构建大规模题库,涵盖多竞赛体系,确保多样性和代表性;2)利用合成推理轨迹,增强模型推理能力,特别是在复杂算法设计中;3)引入多轮生成与反馈机制GenCorrect,有效利用有限提交次数进行解题优化;4)结合SFT和RL,充分发挥模型微调和强化学习的优势,提升整体性能。这些创新突破了以往单一微调或微调+RL的局限,形成了完整的训练和测试闭环体系。
方法详解
- �� 数据策划:从全球竞赛题库和在线平台收集22,000题,自动封装成评测环境,过滤不一致或重复题目。
- �� 合成推理轨迹:利用DeepSeek-V4-Flash生成1.2百万推理轨迹,覆盖不同难度和类型题目,强化模型推理能力。
- �� 监督微调(SFT):Nano模型进行三轮微调,Ultra模型进行单轮微调,采用长上下文(262K tokens)训练,提升理解和推理能力。
- �� 强化学习(RL):Nano模型在过滤后3,219题上,采用GRPO算法进行策略优化,奖励基于代码执行成功。
- �� 测试时优化:引入GenCorrect策略,通过多轮生成、相似性筛选、多样性采样,结合反馈逐步优化解答。
- �� 训练与测试:模型在不同阶段进行性能验证,结合多轮优化和有限提交,最大化竞赛表现。
实验设计
在IOI 2025、ICPC 2025及LiveCodeBench Pro上进行评估,确保训练数据不重复。采用Score@1、Pass@1等指标,比较基线模型(如DeepSeek、GLM-5.2)和本研究模型。调优超参数包括生成轮数、子任务筛选策略和奖励机制。通过 ablation 实验验证SFT、RL和GenCorrect的贡献。模型规模从30B到550B参数,验证规模对性能的影响。多轮生成和反馈机制在提升解题准确率方面表现突出。
结果分析
Nano-CC在IOI 2025中Score@1由130提升至468,超越金牌门槛438.3,表现优于大部分基线模型。Ultra-CC仅用SFT达502分,验证微调的重要性。多轮GenCorrect优化策略使Nano-CC在IOI 2026中达535.4分,超越人类最高水平。模型在不同竞赛环境中表现一致,验证了方法的泛化能力。实验还显示,模型规模、合成数据和多轮优化对性能提升均有显著贡献。
应用场景
该技术可应用于自动化代码生成、智能编程助理、教育辅导等领域。通过结合大规模题库和多轮优化,可实现自动解题、算法设计和代码优化,降低人力成本。未来还可推广到工业软件开发、自动化测试和个性化学习平台,推动智能化普及。
局限与展望
模型训练依赖大量高质量合成轨迹,成本高昂,硬件需求大。复杂问题和极端场景下仍可能表现不足,泛化能力有限。多轮优化可能引入过拟合风险,需进一步调优。未来需降低成本、提升泛化和鲁棒性。
通俗解读 非专业人士也能看懂
想象一个工厂里有很多不同的机器,每台机器都能做不同的任务。以前,这些机器只能按照固定的流程工作,遇到新任务就很难应对。现在,科学家像给机器装上了智能大脑,让它们可以自己学习新技能。通过大量的练习和反馈,这些机器变得越来越聪明,甚至能在比赛中击败人类最厉害的工人。这就像你在游戏里不断练习,最终打败了所有对手。这个研究让AI变得像一个超级工匠,不仅能学会复杂的算法,还能在有限的机会里找到最优解,甚至超过了人类高手。这一切都归功于让AI不断尝试、学习和改进的特殊方法,就像你在学习骑自行车时不断调整平衡一样。
简单解释 像给14岁少年讲一样
想象你在学校参加一个编程比赛,平时练习题目很多,但比赛时间有限,要在短时间内写出最棒的代码。以前,电脑程序只能靠预先学会的知识答题,遇到新题就很难。现在,科学家们教会电脑像人一样学习:它们先看了很多题目,学会了基本的解题技巧,然后用一种特别的方法不断试错,逐步改进答案。就像你在游戏中不断尝试不同策略,直到找到最厉害的招数。这个方法让电脑变得超级聪明,不仅能解决复杂的问题,还能在比赛中击败人类顶尖选手。它们可以自己生成多种解法,评估哪个最好,然后不断改进,直到拿到最高分。这就像有个超级聪明的机器人教练,帮你在比赛中赢得冠军!
原文摘要
Competitive programming has become a key test of large language model reasoning, with international competitions such as IOI and ICPC representing its most challenging settings. We present an end-to-end specialization pipeline combining large-scale problem curation, synthetic reasoning traces, supervised fine-tuning (SFT), and reinforcement learning (RL). Using 22,000 curated problems, we train Nemotron-3-Nano-CC (30B-A3B) with SFT and RL and Nemotron-3-Ultra-CC (550B-A55B) with SFT alone. We further introduce GenCorrect, a feedback-driven test-time compute strategy that iteratively generates, evaluates, and refines diverse solutions. On IOI 2025, Nano-CC improves from 130 points to 291 after post-training and to 468 with GenCorrect, exceeding the gold threshold of 438.3 while Ultra-CC reaches 502. Guided by these results, we develop a competition-specific Ultra-CC system and evaluate it prospectively during IOI 2026. Under the same time, internet-access, and submission constraints as human contestants, it scores 535.4 out of 600, exceeding both the gold threshold of 361.12 and the top human score of 498.27. To our knowledge, this is the first AI system to outscore the highest-scoring human contestant on an IOI problem set.