Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms

TL;DR

本文比较三种融合范式(Merge、Mix RL、MOPD),在多领域RLVR中表现差异不大,但在单一任务上差距达8.6分,提供实用指导。

cs.CL 🔴 高级 2026-08-28 56 次浏览
Siye Wu Kai Yang Yuchen Cai Xin Xu Peng-Yuan Wang Jiaxuan Wang Jiashun Liu Jiafei Lyu Yangkun Chen Saiyong Yang Yanghua Xiao
强化学习 模型融合 多领域 深度学习 模型压缩

核心发现

方法论

研究采用共享专家和数据,基于不同模型规模(4B、8B)在多领域基准上对比Merge、Mix RL和MOPD三种融合范式。通过任务向量几何和训练动态分析,揭示各方法在跨域关系中的表现差异。实验涵盖五个领域(数学、科学、编码、指令跟随、代理),评估单样本准确率和能力保持,结合具体算法(如GRPO、LoRA、KL散度)进行系统比较。

关键结果

  • 三种方法平均性能差异不超过1.4分,但在单一基准上差距达8.6分,反映不同融合策略对跨域关系的影响。Merge通过压缩专家任务向量,适合已有专家场景;Mix RL在无专家情况下调整数据比例以实现跨域转移;MOPD保持专家优势但不超越教师,适合重视领域特定收益场景。
  • 所有方法均提升单样本准确率,无明显能力覆盖扩展或遗失,且在推理任务中表现稳定。训练动态显示,Mix RL依赖数据比例,MOPD受教师限制,Merge压缩专家更新,体现不同约束条件。
  • 在五个领域中,数学、科学、编码相互促进,指令跟随和代理几乎正交,反映在任务向量几何和参数空间的关系上。融合策略在不同领域表现出不同的迁移和保持特性,为实际应用提供指导。

研究意义

该研究系统比较了多领域RLVR中的三大融合范式,揭示其在模型性能、跨域关系和训练成本上的差异,为未来多任务、多领域模型的设计提供理论基础和实践指南。通过分析任务向量几何和训练动态,深化了对模型内部表示和跨域迁移的理解,推动大规模语言模型在多任务环境中的应用落地。研究强调在不同场景下选择合适融合策略的重要性,具有较强的实用价值和理论意义。

技术贡献

论文首次在统一框架下系统比较Merge、Mix RL和MOPD三种融合范式,结合任务向量几何和训练动态分析,明确了各自的优势与局限。提出基于专家任务向量的Merge融合策略,利用任务向量压缩实现无训练融合;设计数据池式的Mix RL,优化跨域数据比例以增强迁移能力;引入多教师策略的MOPD,平衡保持专家收益与模型复杂度。实验验证了不同方法在模型性能和能力保持上的差异,丰富了多任务学习和模型融合的理论体系。

新颖性

本研究首次在多领域RLVR中系统比较三大融合范式,结合任务向量几何和训练动态揭示其内在关系。提出基于任务向量的Merge融合策略,突破传统参数融合限制,提供低成本高效方案。通过多模型、多任务的实证分析,丰富了模型融合的理论理解,填补了不同融合策略在统一框架下对比的空白。这些创新为多任务、多领域模型的设计提供了新思路,具有较强的学术创新性。

局限性

  • 研究主要在特定模型(Qwen3-4B、8B)和五个预定义领域上进行,泛化到更大模型或更多领域仍需验证。
  • MOPD受教师模型性能限制,难以超越教师,限制了其在追求超越教师的场景中的应用潜力。
  • 融合成本和训练复杂度在实际部署中仍需权衡,尤其是MOPD的端到端成本较高,未来需优化效率。

未来方向

未来可探索融合策略在更大模型和更多任务中的扩展性,结合自适应任务向量调整和多教师集成优化,提升模型迁移和超越能力。同时,结合强化学习与自监督方法,增强模型的能力泛化和能力迁移,推动多领域多任务模型的实用化。进一步研究融合策略的理论边界和在实际应用中的鲁棒性,为多任务AI系统的构建提供更全面的解决方案。

AI 总览摘要

随着大规模语言模型在多任务环境中的广泛应用,如何有效融合不同任务专家成为研究焦点。传统方法多依赖单一训练或后处理融合,存在成本高、能力有限的问题。本文系统比较了三种主要融合范式:Merge、Mix RL和MOPD,基于共享专家和数据,在不同模型规模和多领域基准上进行评估。结果显示,三者在平均性能差异不超过1.4分,但在单一任务上差距达8.6分,反映出不同融合策略对跨域关系的影响。通过任务向量几何分析,揭示了数学、科学和编码领域的正向迁移,而指令跟随和代理几乎正交,说明不同任务的内部关系决定了融合效果。训练动态分析表明,Mix RL依赖数据比例,MOPD受教师限制,Merge压缩专家更新。所有方法均提升单样本准确率,未明显影响能力覆盖或遗失。研究提出实用指南:已有专家场景优先选择Merge,无专家时调整数据比例的Mix RL,重视领域收益的MOPD。该工作丰富了多任务模型融合的理论体系,为未来多领域、多任务AI系统设计提供重要参考。

深度分析

研究背景

近年来,随着大规模预训练模型的发展,强化学习与验证奖励(RLVR)成为提升模型特定能力的重要手段。早期研究如Guo等(2025)提出利用RLVR优化数学、编码等专业任务,取得显著效果。随后,研究逐渐关注多任务、多领域融合,出现多种融合策略,包括参数融合、数据融合和多教师蒸馏等。尽管这些方法在单一任务中表现优异,但在多任务、多领域环境中,模型间的交互、迁移和能力保持仍是挑战。现有研究多局限于单一范式或特定模型,缺乏系统性比较,限制了理论指导和实际应用的推广。

核心问题

多领域RLVR中,如何高效融合多个专家模型以实现跨域能力迁移,仍面临多重难题。不同融合策略在能力保持、迁移效果和训练成本上表现差异显著。Merge策略简单高效,但可能丢失部分专家信息;Mix RL灵活但依赖数据比例调节;MOPD能保持专家优势,但训练复杂且受教师限制。缺乏统一评估框架,难以指导实际部署。解决这些问题对于推动多任务、多领域AI模型的实用化具有重要意义。

核心创新

本研究的核心创新在于:1)提出以任务向量几何为基础的多范式融合分析框架,系统比较Merge、Mix RL和MOPD;2)基于任务向量压缩实现低成本融合,突破传统参数融合限制;3)结合训练动态和跨域关系,揭示不同融合策略在能力迁移和保持中的差异。这些创新不仅丰富了多任务学习的理论体系,也为实际模型部署提供了高效、灵活的解决方案。

方法详解

  • �� 设计共享专家和数据,基于不同模型规模(4B、8B)训练五个领域专家(数学、科学、编码、指令、代理);
  • �� 实现Merge:将专家任务向量通过线性组合融合到基础模型中,无需额外训练;
  • �� 实现Mix RL:在单一RLVR训练中,按比例采样不同领域数据,优化跨域迁移能力;
  • �� 实现MOPD:多教师蒸馏,将专家模型的输出 logits 作为教师,训练单一学生模型,保持专家优势;
  • �� 评估:在五个多领域基准(如AIME、GPQA、LiveCode、IFBench、BFCL)上比较性能,分析任务向量几何和训练动态。

实验设计

采用Qwen3-4B和8B模型,构建五个领域数据集,结合不同融合策略进行训练。每个方法在相同数据和模型基础上训练专家和融合模型,使用平均@16指标评估多任务性能。通过任务向量几何分析,揭示不同任务间的关系。实验还包括能力保持分析、跨域迁移效果和训练成本评估,确保结果的全面性和可靠性。

结果分析

融合策略普遍提升单样本准确率,平均性能差异在1.4分以内,但在单一基准上差距达8.6分。Merge和Mix RL在数学、科学、编码领域表现优异,指令跟随和代理领域表现较差。MOPD保持专家优势但未超越,训练成本最低但受教师限制。任务向量分析显示,数学、科学和编码正向迁移明显,指令和代理几乎正交,影响融合效果。结果验证了不同融合策略在能力迁移和保持中的差异,为实际应用提供指导。

应用场景

该研究为多任务、多领域AI模型设计提供理论基础和实践方案。可应用于客服、教育、科研等场景,提升模型在多任务环境中的效率和能力保持。融合策略的选择依据任务关系和成本考虑,有助于行业实现高效、多功能AI助手的部署。未来,结合自适应融合和多教师集成,将推动AI在复杂多变环境中的应用落地。

局限与展望

研究主要在特定模型和五个预定义领域上验证,泛化到更大模型或更多任务仍需验证。MOPD受教师模型性能限制,难以超越教师,限制了其潜力。融合成本较高,尤其是MOPD端到端训练复杂,实际部署中需优化效率。未来需探索更大规模模型、多任务适应性和训练效率提升的方法。

通俗解读 非专业人士也能看懂

想象一个工厂里有不同的车间,每个车间专门生产某一种产品,比如汽车、家具或电子产品。每个车间都有自己的技术和设备,生产出来的产品质量都很高,但彼此之间没有交流。现在,工厂想把这些车间的技术融合起来,打造一个多功能的超级工厂。有人建议用三种方法:一种是把每个车间的技术总结成一份简洁的说明书,然后合并到主工厂的操作手册里(Merge);另一种是把所有车间的生产数据放在一起,训练一个新工厂能同时生产多种产品(Mix RL);第三种是让每个车间的专家指导新工厂的操作,确保新工厂能复制他们的成功(MOPD)。这些方法各有优缺点,比如合并快但可能丢失细节,数据融合灵活但难以超越专家,指导式融合能保持优势但成本高。最终,工厂可以根据需要选择最合适的方法,既节省成本,又能实现多功能。

简单解释 像给14岁少年讲一样

想象你在学校里有不同的老师,每个老师都擅长不同的科目,比如数学、科学、英语。你想让一个新老师既能教数学,又能教科学,还能帮你写作文。现在有三种办法:第一种是把每个老师的教学技巧总结成一份说明,然后把这些技巧合成一个超级老师(Merge);第二种是让所有老师一起上课,学生在不同的时间听不同老师讲(Mix RL);第三种是让每个老师指导新老师,让新老师学会他们的本领(MOPD)。每种方法都各有优点,比如合成快但可能失去一些细节,大家一起上课可以学到很多,但不一定能超越老师,老师指导可以保持优势,但成本高。你可以根据自己的需要选择最合适的方法,既省钱又能学到多种技能。

原文摘要

Reinforcement learning with verifiable rewards (RLVR) improves specific capabilities of large language models, but covering multiple capabilities often involves training separate domain experts and subsequently consolidating them. We organize three fusion paradigms by the artefacts they reuse: Merge combines expert task vectors, Mix RL pools their datasets, and multi-teacher on-policy distillation (MOPD) uses both. Because they have largely been studied in isolation, how they compare and how to choose among them remain unclear. We compare all three using shared experts and data across model scales and a multi-domain benchmark suite. Although their average performance differs by at most 1.4 points, the gap reaches 8.6 points on a single benchmark, with domain-level variation tracking cross-domain relations visible in task-vector geometry. Training dynamics expose distinct constraints: Mix RL depends on domain mixture proportions, MOPD remains bounded by its teachers, and Merge compresses all expert updates into one. All three improve single-sample accuracy without measurable gains in solution coverage or losses in held-out capabilities. These results yield a practical guideline: use Merge when experts already exist and cheap fusion is paramount; Mix RL when training a unified model without experts, with domain proportions adjusted for cross-domain transfer; and MOPD when preserving domain-specific gains matters more than surpassing teachers or minimizing end-to-end cost.

cs.CL