核心发现
方法论
ROMA把任务统一成四角色循环:Atomizer判定是否可分解,Planner把非原子任务拆成满足MECE的依赖DAG,Executors并行执行原子子任务,Aggregator自底向上压缩、校验并合并结果。它把控制流与模型选择解耦,支持搜索、思考、写作、代码四类任务,并用DSPy的结构化签名与MCP/沙盒执行器保持接口安全。
关键结果
- 在SEAL-0上,ROMA用GLM-4.6相较Kimi-Researcher准确率提升9.9%,说明递归分解与结构化聚合能显著增强冲突证据推理能力。
- 在EQ-Bench上,ROMA结合GEPA+后让DeepSeek-V3达到与Claude Sonnet 4.5相当的长文写作水平,表明开源模型可借助框架级编排逼近闭源顶级系统。
- GEPA+相较标准GEPA,在相同预算下通常带来2–6个绝对点提升,并将metric evaluation次数减少约3–4倍,验证了并行候选、judge/verifier重排与合同保真合并的效率优势。
研究意义
这项工作回应了多智能体系统的三个老问题:长链路任务中流程脆弱、上下文窗口膨胀、失败难以追踪。ROMA把“拆解—执行—聚合”做成统一递归协议,使系统能在深层推理中保持透明的树状轨迹,而不是依赖一次性、黑盒式提示。对研究而言,它提供了可复用的多智能体抽象;对工程而言,它让异构模型、工具和预算控制可以在同一框架内协同。
技术贡献
技术上,ROMA的贡献不是单纯换一个更强模型,而是提出可编排的元代理语义:is_atomic(t)→plan(t)→execute(t)→aggregate(·)。Planner输出依赖感知DAG而非线性计划,Aggregator不是拼接而是面向目标格式的压缩与验证,Executor按task_type选择ReAct、CoT、CodeAct等策略。GEPA+则把单模块提示搜索扩展为多模块、K-way并行提案+judge/verifier重排+结构化合并,兼顾探索性与接口稳定性。
新颖性
新意在于把“递归任务树”上升为开放、域无关的元代理框架,并首次把提示优化明确嵌入这一层级接口之中。与常见的线性agent或单一planner不同,ROMA强调MECE分解、依赖DAG、结构化聚合和模块合同;与传统GEPA相比,GEPA+不是对单个prompt做局部反思,而是跨Atomizer、Planner、Executor、Aggregator协同搜参。
局限性
- 作者主要在SEAL-0、FRAMES、SimpleQA、EQ-Bench和AbGen上评估,跨更多真实生产场景、不同工具生态与更长上下文的泛化仍未完全证明;此外,某些收益可能依赖高质量搜索结果与强judge模型。
- ROMA虽然支持异构模型,但实验大多仍用单一底座模型,尚未系统量化“不同角色配不同模型”在成本、延迟和质量上的最优分配,因此真实部署中的调度策略仍有空间。
未来方向
后续可系统研究异构角色分配、自动化依赖DAG学习、更加严格的聚合验证,以及面向更复杂工具链的安全执行。作者也明确留下了对跨角色模型组合的探索;社区可进一步把ROMA与长上下文记忆、可证明检验和在线自适应路由结合,提升深度推理的稳定性与可复现性。
AI 总览摘要
ROMA试图解决一个越来越尖锐的现实问题:当智能体不再是单轮问答,而是要处理跨文档检索、长链条推理、写作与代码执行时,传统“顺序式”编排很快就会失效。上下文越堆越长,模型越容易迷失;任务越复杂,错误越难定位;而不同系统又各自为政,缺少统一的构造方式。ROMA把这些痛点归纳为一个核心命题:多智能体不应只是把更多模型串起来,而应拥有一种可递归、可观察、可复用的元代理结构。
它的做法很像把一项大工程拆成一棵树。Atomizer先判断当前任务是否足够简单;若不是,Planner把它拆成满足MECE原则的子任务,并显式编码依赖关系,形成DAG;Executor只处理叶子任务,可按类型选择ReAct、CoT、CodeAct等执行策略;Aggregator则不做粗暴拼接,而是把子结果压缩、核验并合成为父任务所需的目标形态。整个系统以“is_atomic→plan→execute→aggregate”的统一递归循环运行,既能并行推进,也能保留层级化轨迹。
在此基础上,ROMA进一步提出GEPA+:一种面向模块化架构的多候选提示优化器。它不是像传统GEPA那样只对单一模块做局部反思,而是并行生成多个候选编辑,再借助judge与verifier重排,最后以合同保真方式合并。论文报告称,这一机制在相同预算下可带来2–6个绝对点提升,并将评估次数减少约3–4倍。实验上,ROMA+GLM-4.6在SEAL-0上较Kimi-Researcher提升9.9%;在EQ-Bench上,ROMA使DeepSeek-V3达到与Claude Sonnet 4.5相当的长文写作表现。更重要的是,ROMA把多智能体从“经验拼装”推进为一种可工程化、可调试、可迁移的系统范式。
深度分析
研究背景
大模型推动了智能体从单次生成走向多步协作,典型方向包括检索增强研究代理、代码代理与写作代理。此前系统常以手工提示、线性链式思维或固定工作流为主,代表性方法包括ReAct、CoT、CodeAct以及各类深度研究系统。但这些方法在长程任务中常遇到上下文膨胀、流程脆弱和黑盒难调试的问题。ROMA继承了“递归式分解”的思想,将其提升为域无关的统一架构,并通过DSPy式模块化签名,把规划、执行和聚合抽象成可编译、可替换的程序模块。
核心问题
论文要解决的核心问题是:如何让多智能体系统在长程任务中既能扩展推理深度,又不因顺序编排和上下文累积而失稳。具体瓶颈包括:长链任务中前一步错误会级联放大;单一上下文窗口无法容纳全部中间产物;不同角色之间缺少统一接口导致系统难迁移;以及失败轨迹不结构化,难以归因到规划、检索还是聚合环节。
核心创新
ROMA的第一项创新是四角色协议,把任务构造统一为Atomizer、Planner、Executors、Aggregator,彻底分离“是否拆分”“如何拆分”“如何执行”“如何汇总”。第二项创新是依赖感知DAG,Planner不仅分块,还显式表达左右依赖,使可并行部分真正并行。第三项创新是结构化聚合:Aggregator返回的是父节点所需的压缩结果,而非原始日志。第四项创新是GEPA+,把提示优化扩展为多模块、多候选、重排与合并的闭环,且强调接口合同不被破坏。
方法详解
- �� 输入:任务t及其上下文、约束和目标格式。
- �� Atomizer:调用is_atomic(t),判断是否可直接交给Executor;这一决策与task_type解耦。
- �� Planner:若非原子,执行plan(t),输出依赖DAG S(t);子任务既可独立,也可设置先后依赖。
- �� Executors:对叶子节点执行execute(t)→y;按task_type可路由到search、think、write、code四类专门执行器,分别可结合ReAct、CoT、Drafting、CodeAct或工具调用。
- �� Aggregator:对全部子结果调用aggregate({ys}),进行验证、压缩与格式化,输出父节点结果。
- �� 并行与安全:无依赖子任务可并行执行;代码任务在沙盒环境中运行,并通过MCP等标准接口访问外部工具。
- �� 优化:GEPA+为各模块并行生成k个候选prompt编辑,用Judge(π|D)=αJudge+βVerifier−γContractViolations排序,取前n个做结构化合并。
实验设计
实验覆盖SEAL-0、FRAMES、SimpleQA、EQ-Bench和AbGen。前3个主要测检索与推理,EQ-Bench测长文写作,AbGen测是否能设计严谨消融。搜索类任务使用GPT-5-mini search interface提供证据;推理与搜索实验主要用GLM;写作实验主要用DeepSeek-V3。评价器方面,SEAL-0/FRAMES/SimpleQA使用GPT-4o-mini作LLM judge,EQ-Bench按基准惯例使用Claude Sonnet 4。GEPA+只在EQ-Bench上系统应用,以突出提示优化对写作的影响。
结果分析
最突出结果是SEAL-0:ROMA用GLM-4.6相较Kimi-Researcher准确率提升9.9%,说明在冲突网页证据下,递归分解与聚合比单一路径式研究代理更稳健。第二,EQ-Bench上ROMA+GEPA+让DeepSeek-V3达到Claude Sonnet 4.5级别的长文写作表现,说明开源底座也能借助框架化编排逼近闭源前沿。第三,GEPA+相较标准GEPA通常带来2–6点绝对提升,并减少约3–4倍metric evaluations,显示多候选并行提案和合同保真合并能显著提升优化效率。
应用场景
ROMA适合需要长程、多步骤、跨工具协作的场景,例如深度研究、复杂问答、报告生成、代码辅助分析和带证据约束的写作。对产品团队而言,它提供了把不同模型按角色分工的通用骨架:便宜模型可负责局部执行,强模型可负责规划和汇总,工具可通过标准接口接入。对研究团队而言,它也便于做可解释调试与模块级消融。
局限与展望
ROMA的有效性仍主要在少数基准上验证,离真实企业工作流、极长上下文和高噪声工具环境还有距离。其性能也可能依赖高质量搜索证据、强judge模型以及人工设计的task_type与接口约束。未来要进一步证明其普适性,需要自动学习分解策略、评估不同角色的最优模型分配,并强化对错误聚合和依赖建模失败的诊断能力。
通俗解读 非专业人士也能看懂
你可以把ROMA想成一家会自己分工的大工厂。老板接到一个大订单时,不会把整件事扔给一个工人,而是先判断这单是不是小活;如果不是,就把大任务拆成很多小步骤。比如“做一桌宴席”会被拆成买菜、切菜、炒菜、摆盘,每一步都按顺序或并行完成。等每个小组干完活,最后还有一个总管把结果整理成能直接交付的成品,而不是把所有草稿一股脑倒回去。这样做的好处是:每个人只看自己那一小块,不容易乱;总管只看精简后的结果,桌子也不会被堆满。
GEPA+就像给这家工厂做“多轮改进会”。不是只听一个顾问的意见,而是同时让几位顾问各自提出修改方案,再由检查员看哪些方案靠谱、哪些会破坏原有流程,最后把最好的建议拼成一个不会出错的新版本。于是工厂既能越做越好,又不会因为改得太猛而把原来的秩序打乱。
简单解释 像给14岁少年讲一样
想象你在玩一个超大的开放世界游戏,要同时找线索、解谜、做任务、写攻略,还要别把背包塞爆!ROMA做的事,就像给你配了一个“队长+小队”系统。队长先看这任务是不是能直接做;如果太大,就把它拆成小任务:有人去找线索,有人负责推理,有人负责写总结,还有人负责把大家的结果整理成最终答案。
最酷的是,这些小任务还能同时进行!像打副本时,几个队友分头清怪,最后集合报点,不用一个人从头忙到尾。ROMA还会把中间结果压缩一下,避免“聊天记录”长到把脑子卡住。这样一来,任务越复杂,它越不容易乱套。
术语表
Atomizer(原子化判断器)
先判断一个任务是不是“已经小到可以直接做”。如果是,就不再拆分;如果不是,就交给Planner继续分解。它的作用是控制递归是否继续。
用于每个节点的is_atomic(t)判断。
Planner(规划器)
把一个大任务拆成多个子任务,并标明它们之间谁先谁后。技术上,它输出的是一个依赖感知的DAG,而不是简单列表。
用于plan(t)生成MECE子任务图。
Executor(执行器)
真正完成叶子任务的模块,可以做检索、推理、写作或代码执行。它只在局部上下文中工作,避免把整棵树的历史都塞进提示里。
用于execute(t)产生子结果y。
Aggregator(聚合器)
把多个子结果合并成父节点所需的简洁输出,并同时做验证与压缩。它不是机械拼接,而是结构化归纳。
用于aggregate({ys})自底向上汇总。
GEPA+
一种多候选提示优化方法,先并行提出多个prompt改法,再用judge和verifier筛选,最后合并成一个接口安全的更新。它比单提案式优化更稳、更省评估次数。
用于自动优化ROMA各组件提示。
开放问题 这项研究留下的未解疑问
- 1 ROMA的优势是否会在更长上下文、更复杂工具链或更脏的外部证据下继续保持,仍需更大规模、更多样化的真实任务验证;目前基准更多体现研究型场景。
- 2 多模型异构分配虽然被框架支持,但论文尚未系统搜索“哪个角色配哪个模型最优”。这会影响成本、时延与质量的三者平衡,也是部署端最关键的开放问题。
应用场景
近期应用
深度研究代理
研究团队可用ROMA把检索、筛选证据、归纳结论和写作分层拆开,减少长文研究中的上下文爆炸。前提是有稳定搜索接口和可验证的证据源,预期收益是更可追踪的研究流程。
长文写作与报告生成
内容团队可让不同角色分别负责提纲、段落、引用和润色,再由Aggregator统一格式。前提是定义好输出结构与质量规则,预期是更一致的长篇成稿质量。
远期愿景
通用可编排智能体平台
长期看,ROMA可发展成企业级智能体底座:不同模型按成本与能力分工,工具与记忆通过标准接口挂接,任务树全程可审计。难点在于自动分解、跨域泛化和安全验证的统一。
原文摘要
Current agentic frameworks underperform on long-horizon tasks. As reasoning depth increases, sequential orchestration becomes brittle, context windows impose hard limits that degrade performance, and opaque execution traces make failures difficult to localize or debug. We introduce ROMA (Recursive Open Meta-Agents), a domain-agnostic framework that addresses these limitations through recursive task decomposition and structured aggregation. ROMA decomposes goals into dependency-aware subtask trees that can be executed in parallel, while aggregation compresses and validates intermediate results to control context growth. Our framework standardizes agent construction around four modular roles --Atomizer (which decides whether a task should be decomposed), Planner, Executor, and Aggregator -- which cleanly separate orchestration from model selection and enable transparent, hierarchical execution traces. This design supports heterogeneous multi-agent systems that mix models and tools according to cost, latency, and capability. To adapt ROMA to specific tasks without fine-tuning, we further introduce GEPA$+$, an improved Genetic-Pareto prompt proposer that searches over prompts within ROMA's component hierarchy while preserving interface contracts. We show that ROMA, combined with GEPA+, delivers leading system-level performance on reasoning and long-form generation benchmarks. On SEAL-0, which evaluates reasoning over conflicting web evidence, ROMA instantiated with GLM-4.6 improves accuracy by 9.9\% over Kimi-Researcher. On EQ-Bench, a long-form writing benchmark, ROMA enables DeepSeek-V3 to match the performance of leading closed-source models such as Claude Sonnet 4.5. Our results demonstrate that recursive, modular agent architectures can scale reasoning depth while remaining interpretable, flexible, and model-agnostic.