CodeMidas: Scaling Agentic Coding RL Environments from Code Itself

TL;DR

CodeMidas通过源代码构建RL环境,提升MiMo-V2.5在五个基准上的表现。

cs.AI 🔴 高级 2026-09-19 23 次浏览
Bowen Ye Lei Li Shicheng Li Zihao Yue Linghao Zhang Hanglong Lv Yuanxin Liu Wenhan Ma Hao Tian Rang Li Jinhao Dong Yikai Zhao Xiangwei Deng Hailin Zhang Liang Zhao Qi Liu Lingpeng Kong Tong Yang Fuli Luo
强化学习 代码生成 开源代码库 环境构建 任务验证

核心发现

方法论

CodeMidas利用源代码构建可执行的RL环境。其流程包括任务设计、测试构建、执行一致性检查和后期过滤。通过探索代码库功能,制定行为规范,并通过执行原始代码构建测试。

关键结果

  • 训练MiMo-V2.5在DeepSWE基准上表现提升11.7%,在ProgramBench上提升17%,在Terminal-Bench v2.1上提升8.5%。
  • 增加高质量训练任务数量显著提高性能,3k任务集超过未经清理的8k任务集。
  • RL训练后,代理表现出更好的代码库探索和多样化的自我验证行为。

研究意义

CodeMidas通过将源代码转化为RL环境,为软件任务提供了可扩展的基础。此方法解决了现有方法依赖开发工件的问题,扩大了任务范围。

技术贡献

CodeMidas提供了一种从源代码直接构建RL环境的方法,减少了对开发记录的依赖,增强了任务的多样性和验证的可靠性。

新颖性

CodeMidas首次利用源代码本身构建RL环境,区别于依赖开发工件的传统方法,提供了更广泛的任务覆盖。

局限性

  • CodeMidas可能在处理复杂代码库时遇到挑战,尤其是那些缺乏清晰接口的库。
  • 任务过滤过程可能遗漏潜在有价值的任务。

未来方向

未来工作可探索如何进一步优化任务过滤过程,以及如何处理更复杂的代码库。

AI 总览摘要

CodeMidas是一种创新的强化学习环境构建方法,旨在通过源代码本身创建多样化的任务集。现有方法通常依赖开发工件,如问题和提交,限制了可提取任务的范围。CodeMidas通过探索代码库功能来制定行为规范,并通过执行原始代码构建测试,从而创建可执行的RL环境。实验结果显示,训练MiMo-V2.5在多个基准上表现显著提升,尤其是在DeepSWE、ProgramBench和Terminal-Bench v2.1上。此方法不仅提高了代理的代码库探索能力,还促进了多样化的自我验证行为。这项研究为构建RL环境提供了新的思路,具有广泛的应用潜力。

深度分析

研究背景

近年来,强化学习在代码生成领域取得了显著进展。传统方法依赖于开发记录,如问题和提交,限制了任务的多样性。CodeMidas通过直接从源代码构建RL环境,解决了这一问题。

核心问题

现有方法依赖开发工件,限制了任务的多样性和验证的可靠性。如何从源代码直接构建RL环境是一个关键挑战。

核心创新

CodeMidas通过源代码构建RL环境,提供了更广泛的任务覆盖。其创新在于利用代码库功能制定行为规范,并通过执行原始代码构建测试。

方法详解

  • �� 任务设计:识别代码库功能,制定行为规范。
  • �� 测试构建:通过执行原始代码构建测试。
  • �� 执行一致性检查:确保任务的执行稳定性。
  • �� 后期过滤:通过代理回滚过滤任务。

实验设计

实验使用5,545个任务训练MiMo-V2.5,评估在五个基准上的表现。使用GRPO算法进行训练,观察代理在不同任务上的表现提升。

结果分析

在DeepSWE基准上,MiMo-V2.5的通过率从10.0%提升到21.7%;在ProgramBench上,几乎解决的任务比例从4.5%提升到21.5%。

应用场景

CodeMidas可用于自动化代码生成、软件开发和测试优化,特别适用于需要多样化任务集的场景。

局限与展望

CodeMidas在处理复杂代码库时可能遇到挑战,任务过滤过程可能遗漏有价值的任务。未来工作可探索优化过滤过程。

通俗解读 非专业人士也能看懂

想象一个厨房,CodeMidas就像一个智能厨师。它从食材(源代码)中创造出各种美味的菜肴(任务)。传统厨师依赖食谱(开发记录),而CodeMidas则直接从食材中获取灵感,创造出更多样化的菜肴。通过不断尝试和调整,CodeMidas能够制作出更符合顾客口味的菜肴。

简单解释 像给14岁少年讲一样

嘿,想象一下你在玩一个游戏,CodeMidas就是你的超级助手。它能从游戏代码中找出各种任务,就像从游戏地图中发现隐藏的宝藏。传统方法就像只依靠游戏攻略,而CodeMidas能直接从游戏中找到线索,帮助你更快地通关!是不是很酷?

术语表

强化学习 (Reinforcement Learning)

一种机器学习方法,通过奖励和惩罚来训练代理。

用于训练代码生成代理。

源代码 (Source Code)

软件的原始代码文件,包含程序的功能实现。

用于构建RL环境的基础。

MiMo-V2.5

一种用于代码生成的强化学习模型。

在CodeMidas任务集上进行训练。

GRPO

一种优化算法,用于训练强化学习模型。

用于训练MiMo-V2.5。

任务过滤 (Task Filtering)

通过代理回滚和验证结果筛选任务。

确保任务的质量和多样性。

开放问题 这项研究留下的未解疑问

  • 1 如何处理缺乏清晰接口的复杂代码库仍是一个挑战。
  • 2 任务过滤过程可能遗漏潜在有价值的任务。

应用场景

近期应用

自动化代码生成

开发者可以使用CodeMidas生成多样化的代码任务,提高开发效率。

远期愿景

软件开发优化

CodeMidas有潜力改变软件开发流程,通过自动化任务生成提高生产力。

原文摘要

Training capable coding agents via reinforcement learning (RL) requires diverse tasks with reliable verifiers. Open-source codebases offer a rich source of such tasks, while existing methods typically rely on development artifacts such as issues and commits, limiting the range of tasks that can be extracted. To better scale RL environments, we present CodeMidas, an agentic pipeline that turns implemented functionality in existing codebases into executable RL environments using source code as its only task-specific input. CodeMidas allocates agentic compute to every stage of environment construction: agents explore implemented functionality to formulate behavioral specifications, construct tests grounded in execution of the original code, and validate and filter candidate tasks through execution checks and repeated solution rollouts. The resulting dataset has 5,545 training tasks from 3,185 open-source codebases spanning 23 programming languages and 15 technical domains. Training MiMo-V2.5 on these tasks with GRPO improves performance on all five diverse benchmarks, covering issue repair (DeepSWE + 11.7%), whole-program construction (ProgramBench +17%), and terminal work (Terminal-Bench v2.1 +8.5%). Ablations show that increasing the number of high-quality training tasks improves performance. Trajectory analysis shows the RL-trained agent demonstrates better behaviors like increasing codebase exploration and more diverse self-verification. These results establish source code as a scalable foundation for constructing RL environments that improve coding agents across diverse software tasks.

cs.AI