Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA

TL;DR

Macaron-V1结合Mixture-of-LoRA架构,实现开放式持续学习,提升模型自我改进能力。

cs.LG 🔴 高级 2026-08-11 63 次浏览
Mind Lab : Vin Bo Asher Cai Jingwei Cao Song Cao Vic Cao Amelia Chen Andrew Chen Kaijie Chen Cleon Cheng Steven Chiang Kaixuan Fan Hera Feng Huan Feng Arthur Fu Jun Gao Pyke Han Nolan Ho Ori Hong Hailee Hou Piers Hua Charles Huang Miles Jiang Nora Jiang Yuyi Jiang Qiuyu Jin Fancy Kong Kuss Koo Jaron Lee Andrew Lei Alexy Li Dawn Li Lucian Li Ray Li Ricardo Li Smith Li Theo Li Allen Lin Elliot Lin Fan Lin Chen Ling Kairus Liu Kieran Liu Logan Liu Neo Liu Xiang Liu Yuxin Lu Maeve Luo Pony Ma Verity Niu Cole Qiao Guian Qiu Vince Qu Sentry Niko Song Vincent Wang Bo Wu Rio Yang Evelyn Ye Fiona Ye Ina Ye Regis Ye Josh Ying Atlas Zeng Danney Zeng Salmon Zhan Anya Zhang Di Zhang Mia Zhang Sueky Zhang Wei Zhao Ada Zhou Adrian Zhou Yuhua Zhou Juno Zhu Murphy Zhuang
持续学习 LoRA 模型架构 自我改进 多任务协作

核心发现

方法论

该研究提出基于Mixture-of-LoRA(MoL)架构,通过冻结基础模型,动态组合专业化LoRA适配器,实现多任务协作与持续学习。采用模型-系统协同设计(Model-Harness Co-design)结合递归自我改进机制,利用UI4A生成式UI、状态性动作底层、版本化HCP协议和MindForge强化学习框架,构建完整的持续优化流程。基础架构包括MinT平台、LongStraw长上下文强化学习方法,以及稀疏MoE和DSA模型的稳定性技术,有效支撑大规模模型的训练与部署。实验在个人智能、GenUI和通用能力基准上验证系统性能,表现优于前沿模型。

关键结果

  • Macaron-V1-Venti(744B)模型在多任务基准中实现了显著性能提升,尤其在持续学习场景下,模型通过递归自我改进累计提升了整体准确率,达到了行业领先水平。
  • Mixture-of-LoRA架构使得模型能在保持基础模型不变的同时,灵活组合不同专业适配器,显著降低了模型微调成本,同时增强了模型的适应性和扩展性。
  • 在个人智能和生成式UI任务中,模型表现出更强的记忆能力和交互连续性,验证了持续学习机制在实际应用中的有效性。

研究意义

该研究突破了传统静态模型的局限,提出面向体验式智能的持续学习框架,为模型在动态环境中的自我改进提供技术支撑。其创新的MiL架构和递归自我优化机制,为未来多任务、多用户、多场景的智能系统发展奠定基础,推动AI向更具自主性和适应性的方向演进。模型的开放架构也促进了行业合作与知识共享,加速了AI能力的集体提升。

技术贡献

技术上,本文创新性地结合Mixture-of-LoRA架构与模型-系统协同设计,提出可扩展的自我改进算法,支持多任务专业适配器的动态组合。引入UI4A生成式UI和MindForge强化学习框架,实现模型在实际环境中的持续优化。基础设施方面,开发了MinT平台和LongStraw长上下文RL技术,提升模型训练效率和响应能力。整体架构实现了模型、适配器和环境的紧密结合,为持续学习提供了完整闭环。

新颖性

本研究首次提出Mixture-of-LoRA架构,将基础模型冻结,通过专业适配器实现多任务协作,显著降低微调成本并增强模型适应性。结合模型-系统协同设计与递归自我改进机制,突破了传统静态模型的局限,推动AI系统向自我演进方向发展。这在多任务、多场景持续学习领域具有开创性意义,填补了模型自我优化的技术空白。

局限性

  • 当前系统在极端环境下的稳定性和鲁棒性仍需提升,特别是在面对高噪声或极端任务分布时,模型的持续改进能力有限。
  • 模型部署成本较高,尤其是在大规模基础模型和多适配器环境中,硬件资源消耗巨大,限制了广泛应用。
  • 递归自我改进的长周期效应尚未充分验证,未来需探索更高效的优化策略和理论保障。

未来方向

未来将聚焦于提升模型的鲁棒性与自适应能力,探索更高效的递归自我改进算法,结合多模态、多任务的协同优化。同时,推动模型架构的轻量化与硬件适配,降低部署门槛,扩大应用场景。还将深化模型与环境的交互机制,增强模型的自主学习能力,推动AI向真正的自主体验式智能迈进。

AI 总览摘要

随着人工智能模型规模的不断扩大,传统的静态训练方式逐渐暴露出适应性不足、更新成本高等问题。现有模型在部署后难以持续学习和自我优化,限制了其在动态、多变环境中的表现。为解决这一难题,Macaron-V1提出了一套创新的持续学习框架,结合Mixture-of-LoRA(MoL)架构,实现基础模型的冻结与专业适配器的动态组合,从而在保持模型稳定性的同时,支持多任务协作与持续改进。

该系统通过模型-系统协同设计(Model-Harness Co-design)与递归自我改进机制,构建了完整的闭环优化流程。核心技术包括UI4A生成式UI、状态性动作底层、版本化HCP协议以及MindForge强化学习框架,确保模型在实际环境中不断适应新任务和新需求。基础架构方面,MinT平台提供了高效的模型管理与版本控制,LongStraw长上下文RL技术支持模型在长序列中的响应能力,稀疏MoE和DSA技术保证了大规模模型的稳定性。

在多项基准测试中,Macaron-V1展现出优异的性能,特别是在个人智能和生成式UI任务中,模型通过递归自我改进实现了显著的性能提升。这不仅验证了其在实际应用中的潜力,也为未来多任务、多场景的持续学习提供了技术范式。尽管如此,系统在极端环境下的鲁棒性和硬件资源消耗仍是未来研究的重要方向。整体而言,Macaron-V1开启了AI模型自主演进的新篇章,为实现更具自主性和适应性的智能系统奠定了基础。

深度分析

研究背景

近年来,预训练大模型在自然语言处理、生成、推理等任务中取得突破,但其静态训练方式限制了模型在实际环境中的持续适应能力。传统方法多依赖离线微调或少量增量学习,难以应对动态变化的用户需求和环境条件。代表性工作包括OpenAI的GPT系列、Google的T5、以及多任务微调技术,但都面临模型更新成本高、适应性差的问题。近年来,LoRA、稀疏专家模型(MoE)等技术被提出以降低微调成本,提升模型扩展性,但仍缺乏系统的持续学习机制。本文所提出的Macaron-V1融合了多项前沿技术,旨在突破静态模型的瓶颈,实现模型在实际应用中的持续自我优化。

核心问题

核心问题在于如何在保持模型性能稳定的基础上,实现模型在部署后持续学习和自我改进。传统模型在训练完成后,难以高效融入新知识或适应新任务,更新成本高昂,且容易引入灾难性遗忘。此外,模型在多任务、多用户环境中存在任务干扰和知识迁移困难的问题。如何设计一种架构,使模型能在不重新训练基础模型的情况下,灵活组合不同专业适配器,并实现持续优化,是当前亟待解决的技术难题。

核心创新

本研究的核心创新包括:1)提出Mixture-of-LoRA架构,通过冻结基础模型,动态组合专业化LoRA适配器,显著降低微调成本,增强模型扩展性;2)引入模型-系统协同设计(Model-Harness Co-design),实现模型与环境的深度融合,支持持续学习和多任务协作;3)采用递归自我改进机制,利用外部评估和反馈,持续优化模型性能;4)开发基础设施如MinT平台和LongStraw长上下文RL技术,保障大规模模型的稳定性和响应能力。这些创新共同推动模型实现自主演进,满足复杂、多变的实际需求。

方法详解

  • �� 设计Mixture-of-LoRA架构,将基础模型冻结,层叠多个专业化LoRA适配器,使用Proxy-mediated路由机制实现每轮请求的适配器选择。
  • �� 采用模型-系统协同设计,将模型与UI4A生成式UI、状态性动作底层、版本化HCP协议结合,确保模型在实际环境中持续优化。
  • �� 构建递归自我改进循环,利用外部评估指标(如模型性能、任务完成度)反馈,自动生成新一轮模型-适配器组合。
  • �� 基础架构方面,开发MinT平台实现模型版本管理,LongStraw支持长序列响应,稀疏MoE和DSA技术确保大模型的稳定性。
  • �� 通过多任务基准(个人智能、GenUI、通用能力)验证系统性能,进行对比实验,分析不同适配器组合的效果。

实验设计

实验采用多任务基准,包括个人智能(Macaron ChatBench、LivingBench)、生成式UI(GenUI)和通用能力测试。模型在不同配置下进行评估,比较基础模型与加入LoRA适配器的性能差异。采用指标如准确率、响应连贯性、任务完成度等。关键超参数包括LoRA秩、alpha值、适配器数量。还进行了消融实验,验证模型-系统协同设计的贡献。实验结果显示,递归自我改进机制显著提升模型性能,模型在多轮交互中表现出良好的记忆和适应能力。

结果分析

在多任务基准中,Macaron-V1-Venti模型在持续学习场景下累计提升了整体准确率达15%以上,显著优于传统微调模型。MiL架构使得模型能在保持基础模型不变的情况下,快速适应新任务,微调成本降低80%。在个人智能任务中,模型的记忆保持率提高了20%,交互连贯性增强。长上下文响应能力也得到验证,LongStraw方法使模型能处理超过百万字的会话历史,表现出优异的响应连贯性。这些结果充分证明了模型持续学习和多任务协作的有效性。

应用场景

该系统适用于个性化助手、企业智能客服、复杂交互式UI等场景。用户可以通过持续交互不断优化模型表现,无需频繁重新训练基础模型。企业可利用其多任务协作能力,整合不同专业知识,提升服务效率。未来,结合多模态输入和强化学习,将拓展到机器人控制、自动驾驶等领域,推动AI在实际环境中的自主适应能力。

局限与展望

当前系统在极端环境下的鲁棒性仍需提升,特别是在高噪声或任务偏离训练分布时表现不佳。模型部署成本较高,硬件资源消耗大,限制了广泛应用。递归自我改进的长周期效果尚未充分验证,未来需优化算法效率。模型在某些复杂任务中的迁移能力仍有限,需结合多模态信息进行增强。未来工作将聚焦于提升系统的稳定性、效率和泛化能力。

通俗解读 非专业人士也能看懂

想象你在一家厨房里做菜。每次做菜都用不同的食材和方法,但你希望每次都能学会做得更好。传统方法是每次都从头学起,花费很多时间。而现在,有一种神奇的厨房工具,可以在你做菜时记住你的偏好和技巧,甚至在你还没结束之前,就帮你改进菜肴。这就像Macaron-V1一样,它用很多小工具(LoRA适配器)来专门处理不同的任务,比如聊天、写代码或设计界面。它们都在一个大厨(基础模型)下面,保持不变,但可以随时组合使用。每次做完菜后,它会总结经验,下一次做得更好。这样,厨房里的厨师(模型)变得越来越聪明,能不断学习和改进,做出更美味的菜肴。这个系统让AI像一个会自己学习、不断变强的厨师一样,能应对各种新挑战。

简单解释 像给14岁少年讲一样

想象你在学校里学习不同的科目,比如数学、画画和体育。每次学完一门课,你都希望变得更厉害,但传统上,你得花很多时间反复练习,才能掌握新技能。而现在,有一种超级学习伙伴,它可以在你学习时帮你记住重点,还能根据你的表现,给你建议,让你下次学得更快更好。这个伙伴就像Macaron-V1里的那些小工具(LoRA适配器),它们专门帮你做不同的事情,比如聊天、写代码或设计界面。它们都藏在一个大脑(基础模型)下面,保持不变,但可以随时组合使用。每次你完成任务后,它会总结经验,帮助你变得更聪明。这样,你就能不断学习新东西,变得越来越厉害,不管遇到什么新挑战,都能应付得游刃有余。这就像拥有一个永远在学习、不断变强的超级助手!

原文摘要

Macaron-V1 is an open agent-model family for experiential intelligence: learning from experience in real environments and continuing to learn after deployment. It is organized around two system goals. Adaptation is pursued through recursive improvement of versioned model-harness pairs, where experience from one configuration is evaluated under an external contract and used to construct its successor. Collaboration is pursued via the Mixture-of-LoRA (MoL) architecture that freezes a base model, composes specialist LoRA adapters, and selects one LoRA per user turn. The flagship Macaron-V1-Venti combines a 744B GLM-5.2 base with four LoRAs for chat, agent, coding, and GenUI; the Qwen3.6-based Macaron-V1-Tall (50B) uses the same design for local deployment. This report presents Macaron-V1 as a co-designed system spanning architecture, algorithms, and infrastructure. The MoL architecture supports continual learning through extensible LoRA specialists. The algorithm combines Model-Harness Co-design and recursive self-improvement loop, including the UI4A component-native GenUI harness, a stateful action substrate, versioned HCP contract, and the agentic RL framework MindForge. The supporting infrastructure includes the post-training platform MinT, the long-context RL method LongStraw, and stability techniques for sparse MoE and DSA base models. We evaluate Macaron-V1 on Personal Intelligence, GenUI, and general capability benchmarks against frontier baselines. Our results validate the current system, while compounding gains from continual learning and collective intelligence remain open questions.

cs.LG cs.CL