A Systematic Study of In-the-Wild Model Merging for Large Language Models

TL;DR

研究发现,任务算术是唯一能在“野外”环境中提升大型语言模型性能的方法。

cs.CL 🔴 高级 2025-11-26 6 次浏览
Oğuz Kağan Hitit Leander Girrbach Zeynep Akata
模型合并 大型语言模型 任务算术 性能提升 野外环境

核心发现

方法论

本文系统评估了六种模型合并方法,包括任务算术、TIES-Merging和Model Stock,应用于四个开源大型语言模型(如Llama3和Qwen3)及其12个微调检查点。通过16个标准基准测试,评估了合并模型相较于基模型的性能提升可能性和相对增益。

关键结果

  • 任务算术在合并多个专家模型后,能稳定提升基模型性能,达到100%的成功率,且在Llama 3B模型上实现了最高13.07%的提升。
  • Model Stock在大多数情况下无法显著超越基模型,表现与基模型相近。
  • TIES-Merging尽管复杂,但未能超越任务算术,且在某些情况下表现不稳定。

研究意义

研究表明,当前的模型合并技术在处理异构和潜在冲突的模型版本时,无法有效提取有用的权重更新。这一发现激励了设计特定于大型语言模型的合并算法和合并感知的微调方法。

技术贡献

本文首次在大规模系统中验证了任务算术在“野外”环境中的有效性,揭示了现有合并方法的局限性,并提出了设计更复杂合并算法的需求。

新颖性

本研究首次系统性地评估了在异构专家模型合并中的表现,特别是在任务算术方法的应用中,展示了其在大型语言模型中的独特优势。

局限性

  • 现有合并方法在处理异构和冲突的模型版本时,未能有效提取有用的权重更新。
  • 任务算术的性能提升有限,通常不超过1%。
  • TIES-Merging在高合并数量时表现不稳定。

未来方向

未来研究方向包括开发特定于大型语言模型的合并算法,以及合并感知的微调方法,以更好地利用异构模型版本的能力。

AI 总览摘要

在大型语言模型的研究中,模型合并技术因其无需额外训练即可提升性能而备受关注。然而,当合并的专家模型在目标上重叠或冲突时,其优势尚不明确。本文系统评估了六种合并方法在四个开源大型语言模型上的表现,结果显示,任务算术是唯一能在“野外”环境中稳定提升性能的方法。尽管其他方法未能显著超越基模型,但研究揭示了设计特定于大型语言模型的合并算法的必要性。未来的研究应着眼于开发更复杂的合并方法,以充分利用异构模型版本的潜力。

深度分析

研究背景

模型合并技术近年来因其在无需额外训练的情况下提升模型性能的潜力而受到广泛关注。特别是在大型语言模型(LLM)领域,合并多个微调检查点以改善基模型的能力被视为一种有效的策略。然而,当这些检查点在目标上存在重叠或冲突时,合并的效果尚不明确。

核心问题

核心问题在于,当合并的专家模型在目标上重叠或冲突时,现有的合并方法是否仍能有效提升模型性能。这一问题的重要性在于,许多组织积累了大量微调检查点,但这些检查点并不总是朝着共同的改进方向发展。

核心创新

本文的创新在于首次系统性地评估了在异构专家模型合并中的表现,特别是在任务算术方法的应用中,展示了其在大型语言模型中的独特优势。研究揭示了现有合并方法的局限性,并提出了设计更复杂合并算法的需求。

方法详解

  • �� 评估六种合并方法,包括任务算术、TIES-Merging和Model Stock。
  • �� 在四个开源大型语言模型(如Llama3和Qwen3)上进行实验。
  • �� 使用16个标准基准测试评估合并模型的性能提升可能性和相对增益。

实验设计

实验设计包括在四个开源大型语言模型上应用六种合并方法,评估其在16个标准基准测试上的表现。使用的模型包括Llama3和Qwen3,微调检查点涉及多种目标和领域。

结果分析

结果显示,任务算术在合并多个专家模型后,能稳定提升基模型性能,达到100%的成功率,且在Llama 3B模型上实现了最高13.07%的提升。其他方法未能显著超越基模型。

应用场景

模型合并技术的应用场景包括多任务模型的构建、减轻微调和持续学习中的灾难性遗忘,以及增强模型的跨域泛化能力。

局限与展望

现有合并方法在处理异构和冲突的模型版本时,未能有效提取有用的权重更新。任务算术的性能提升有限,通常不超过1%。TIES-Merging在高合并数量时表现不稳定。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你有很多种调料(模型),每种调料都有不同的味道(任务)。有些调料味道相似,有些则完全不同。你想做一道新菜(合并模型),希望它比任何一种单独的调料都好吃。任务算术就像是把这些调料按一定比例混合,创造出新的味道。虽然有时混合的结果不如预期,但有时它能让菜肴更美味。这就是模型合并的基本原理:通过合并不同的微调模型,尝试提升整体性能。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你有很多角色,每个角色都有不同的技能。有些角色技能相似,有些则完全不同。你想创造一个超级角色,把所有角色的技能都合并在一起。任务算术就像是把这些技能按一定比例组合,创造出一个更强大的角色。虽然有时结果不如预期,但有时它能让你在游戏中表现更好。这就是模型合并的基本思想:通过合并不同的微调模型,尝试提升整体性能。

术语表

任务算术 (Task Arithmetic)

一种模型合并方法,通过在权重空间中进行向量加减来合并模型。

用于合并多个微调的检查点以提升基模型性能。

TIES-Merging

一种考虑权重空间冲突的合并方法,通过修剪和选择一致的更新来减少干扰。

在合并异构模型时用于减少冲突。

Model Stock

一种通过几何插值在微调检查点的几何中心附近移动合并权重的方法。

用于合并多个微调检查点。

大型语言模型 (LLM)

一种具有大量参数的语言模型,能够处理复杂的自然语言任务。

本文中评估的模型类型。

基准测试 (Benchmark)

用于评估模型性能的标准化测试集合。

用于评估合并模型的性能提升。

开放问题 这项研究留下的未解疑问

  • 1 如何有效提取异构和冲突模型版本中的有用权重更新仍是一个开放问题。
  • 2 现有方法在处理高合并数量时的不稳定性需要进一步研究。

应用场景

近期应用

多任务模型构建

通过合并不同任务的微调模型,构建更强大的多任务模型。

远期愿景

增强跨域泛化能力

通过模型合并技术,提升模型在不同领域中的泛化能力。

原文摘要

Model merging combines multiple fine-tuned checkpoints into a single model without additional training, offering an attractive approach to reusing models and efficiently improving performance. However, it remains unclear whether the advantages reported for settings where all merged experts have distinct roles and are tuned on clearly separated tasks also hold in settings where the merged experts do not have clearly distinct roles, but are trained on overlapping or even conflicting objectives. To evaluate this setting, we present a large-scale, systematic evaluation of "in-the-wild" model merging of heterogeneous experts, that may have been trained on overlapping or conflicting objectives. Concretely, we evaluate six state-of-the-art merging methods, including recent subspace methods, across four open-weight LLMs, twelve fine-tuned checkpoints per base model, and sixteen standard LLM benchmarks. Evaluating through standardized benchmarks, we measure both the probability that a model merged from a heterogeneous set of experts outperforms the base model and we measure relative gains over the best individual checkpoint. Our results show that the oldest and simplest method, Task Arithmetic, is the only approach that reliably yields performance gains on LLMs in this "in-the-wild" setting. Other interference-aware and subspace merging methods typically do not result in notable improvements over the base model. Our findings indicate that current merging techniques mostly do not enable extracting useful weight updates from heterogeneous and potentially conflicting versions. This motivates the design of LLM-specific merging algorithms and merging-aware fine-tuning methods.

cs.CL cs.LG