Agentic Proposing: Enhancing Large Language Model Reasoning via Compositional Skill Synthesis
Agentic Proposing框架通过组合技能合成提升大语言模型推理能力,30B模型在AIME25上达到91.6%准确率。
核心发现
方法论
Agentic Proposing通过将问题合成建模为目标导向的决策过程,使用多粒度策略优化(MGPO)来动态选择和组合模块化推理技能。该框架由内部反思和工具使用的迭代工作流支持,生成高精度、可验证的训练轨迹。
关键结果
- 在数学、编码和科学领域,使用Agentic Proposing合成的数据训练的下游求解器显著优于现有基线。特别是,30B求解器在仅11,000条合成轨迹上训练后,在AIME25上达到91.6%的准确率。
- 4B求解器在10,000条合成轨迹上训练后,在数学、科学和编码领域的表现超过了现有的推理集合。
- Agentic Proposing生成的数据在跨领域泛化方面表现出色,证明高精度信号比模型规模更为重要。
研究意义
该研究通过引入Agentic Proposing框架,解决了大语言模型推理中高质量、可验证数据集的获取难题。它展示了小规模高质量合成信号如何有效替代大规模人工数据集,推动了学术界和工业界在复杂推理任务上的进步。
技术贡献
Agentic Proposing框架通过引入组合技能的概念,提供了一种新的方法来合成高难度问题。与现有方法不同,它不依赖于人类设计的生成模板,而是通过模块化逻辑工程探索推理前沿。
新颖性
Agentic Proposing首次将问题合成视为组合逻辑工程过程,通过模块化技能的动态组合实现高难度问题的生成,与传统的静态生成方法相比,具有显著的创新性。
局限性
- 在某些情况下,生成的问题可能仍然存在逻辑不一致的问题,尽管框架已经尽量减少这种情况。
- 框架的性能依赖于技能库的质量和多样性,可能需要进一步扩展。
未来方向
未来的研究方向包括扩展技能库以涵盖更多领域,优化MGPO算法以提高生成问题的质量,以及探索更多的应用场景。
AI 总览摘要
在大语言模型的推理能力提升中,获取高质量、可验证的数据集一直是一个挑战。现有的方法通常在问题复杂性和结构有效性之间存在权衡。Agentic Proposing框架通过将问题合成建模为目标导向的决策过程,动态选择和组合模块化推理技能,解决了这一难题。
该框架使用多粒度策略优化(MGPO),通过内部反思和工具使用的迭代工作流,生成高精度、可验证的训练轨迹。在数学、编码和科学领域,使用Agentic Proposing合成的数据训练的下游求解器显著优于现有基线。特别是,30B求解器在仅11,000条合成轨迹上训练后,在AIME25上达到91.6%的准确率,显示出强大的跨领域泛化能力。
这一研究展示了小规模高质量合成信号如何有效替代大规模人工数据集,推动了学术界和工业界在复杂推理任务上的进步。未来的研究方向包括扩展技能库以涵盖更多领域,优化MGPO算法以提高生成问题的质量,以及探索更多的应用场景。
深度分析
研究背景
大语言模型在复杂推理任务中的应用越来越广泛,但获取高质量、可验证的数据集仍然是一个挑战。现有的方法如MetaMath和WizardMath通常依赖于人类设计的生成模板,限制了问题构建的灵活性和复杂性。
核心问题
核心问题在于如何在不牺牲问题复杂性的情况下,生成结构有效且可验证的高难度问题。这一问题的解决对于提升大语言模型的推理能力至关重要。
核心创新
Agentic Proposing引入了组合技能的概念,将问题合成视为组合逻辑工程过程。通过动态选择和组合模块化推理技能,该框架能够生成高难度问题,而不依赖于固定的生成模板。
方法详解
- �� 使用多粒度策略优化(MGPO)来动态选择和组合模块化推理技能。
- �� 通过内部反思和工具使用的迭代工作流,生成高精度、可验证的训练轨迹。
- �� 引入组合技能的概念,将问题合成视为组合逻辑工程过程。
实验设计
实验设计包括在数学、编码和科学领域的多个基准数据集上进行测试。使用11,000条合成轨迹训练30B求解器,并与现有基线进行比较。
结果分析
实验结果显示,使用Agentic Proposing合成的数据训练的求解器在AIME25上达到91.6%的准确率,显著优于现有基线。该框架展示了强大的跨领域泛化能力。
应用场景
该框架可用于生成高质量训练数据,提升大语言模型在复杂推理任务中的表现,特别是在数学、编码和科学领域。
局限与展望
尽管框架已经尽量减少逻辑不一致的问题,但在某些情况下,生成的问题可能仍然存在此类问题。此外,框架的性能依赖于技能库的质量和多样性。
通俗解读 非专业人士也能看懂
想象一个工厂,生产复杂的产品。传统方法像是流水线,只能生产固定的产品。而Agentic Proposing就像一个智能工厂,可以根据需求灵活组合不同的零件,生产出复杂且高质量的产品。这个工厂有一个智能系统,能根据生产过程中的反馈不断调整,确保每个产品都是高质量的。这种灵活性和高效性使得它能够在不同领域中表现出色。
简单解释 像给14岁少年讲一样
想象你在玩一个需要解决难题的游戏。传统的游戏方式就像是用固定的策略去解题,但Agentic Proposing就像是一个超级助手,它能根据每个关卡的特点,灵活组合不同的技能来帮助你解题。这个助手还能根据你的反馈不断调整策略,确保你能顺利通关。这种灵活性和智能性让它在各种游戏中都表现出色!
术语表
Agentic Proposing (代理提议)
一种将问题合成建模为目标导向的决策过程的框架。
用于动态选择和组合模块化推理技能。
Multi-Granularity Policy Optimization (多粒度策略优化)
一种用于优化代理策略的算法,支持高精度问题生成。
用于Agentic Proposing框架中的策略优化。
Composable Agent Skills (可组合代理技能)
将问题构建逻辑分解为原子推理模块的概念。
用于动态组合生成复杂问题。
AIME25
一个数学竞赛基准数据集,用于测试模型的推理能力。
用于评估Agentic Proposing生成数据的有效性。
Verifiable Training Trajectories (可验证训练轨迹)
高精度、可验证的训练数据路径。
Agentic Proposing生成的训练数据。
开放问题 这项研究留下的未解疑问
- 1 如何进一步扩展技能库以涵盖更多领域?当前方法可能在某些领域表现不足。
- 2 如何优化MGPO算法以提高生成问题的质量?现有方法可能在极端难度问题上表现有限。
应用场景
近期应用
教育领域
可以用于生成高质量的练习题,帮助学生提高数学和科学推理能力。
远期愿景
人工智能研究
推动AI在复杂推理任务上的进步,可能改变未来的AI研究方向。
原文摘要
Advancing complex reasoning in large language models relies on high-quality, verifiable datasets, yet human annotation remains cost-prohibitive and difficult to scale. Current synthesis paradigms often face a recurring trade-off: maintaining structural validity typically restricts problem complexity, while relaxing constraints to increase difficulty frequently leads to inconsistent or unsolvable instances. To address this, we propose Agentic Proposing, a framework that models problem synthesis as a goal-driven sequential decision process where a specialized agent dynamically selects and composes modular reasoning skills. Through an iterative workflow of internal reflection and tool-use, we develop the Agentic-Proposer-4B using Multi-Granularity Policy Optimization (MGPO) to generate high-precision, verifiable training trajectories across mathematics, coding, and science. Empirical results demonstrate that downstream solvers trained on agent-synthesized data significantly outperform leading baselines and exhibit robust cross-domain generalization. Notably, a 30B solver trained on only 11,000 synthesized trajectories achieves a state-of-the-art 91.6% accuracy on AIME25, rivaling frontier-scale proprietary models such as GPT-5 and proving that a small volume of high-quality synthetic signals can effectively substitute for massive human-curated datasets.