核心发现
方法论
本文提出的MOSAIC框架结合了代理中心语义记忆和整数线性规划(ILP)进行多智能体任务调度。语义记忆以相对坐标存储环境中对象信息,减少空间推理成本,支持几何变换。ILP在每个规划步中,从LLM生成的候选动作中筛选出满足碰撞避免、任务依赖和负载平衡的最优组合。该系统通过动态约束确保物理可行性,利用成本函数平衡效率与失败风险。核心算法包括基于相对坐标的空间推理机制和ILP求解器,优化多智能体协作。
关键结果
- 在AI2-THOR和搜救任务中,MOSAIC实现了27-32%的执行速度提升,减少了30-33%的LLM调用次数,整体步骤减少25-31%,成功率提升4-10个百分点。实验显示,失败动作比例从16%降至约4%,显著改善了系统的鲁棒性和效率。
- 与单智能体系统相比,MOSAIC通过协调动作分配,缩短了1.25-1.33倍的任务完成时间,且在五智能体系统中仍保持1.25-1.30倍的加速效果,验证了其扩展性和实用性。
- 消除空间和时间上的冗余,ILP约束显著减少了重复探索和无效动作,提升了任务成功率,验证了语义记忆和约束优化的有效结合。
研究意义
该研究突破了多智能体embodied规划中高延迟瓶颈,提出的结合轻量级空间记忆与符号约束的系统,为机器人、虚拟代理等应用提供了低延迟、高可靠的解决方案。其创新点在于实现了在复杂环境中实时协调,极大推动了多智能体自主系统的实用化和规模化发展,有望在智能制造、搜救、家庭自动化等领域引领变革。
技术贡献
技术创新主要体现在两个方面:一是提出基于相对坐标的代理中心语义记忆,有效平衡空间推理的精度与计算成本;二是引入ILP作为动作选择的核心机制,将LLM生成的候选动作转化为全局一致的调度方案,确保物理可行性和任务协调。该框架实现了每个规划步的动态最优决策,显著减少失败和冗余,提升系统整体效率。
新颖性
本研究首次将代理中心语义记忆与ILP优化结合应用于多智能体embodied规划,突破了传统基于目标分配的粗粒度协调限制,实现动作级别的实时优化。相较于现有的任务分配或粗粒度目标规划方法,MOSAIC在保持语义理解的同时,显著提升了调度的灵活性和鲁棒性,为多智能体系统的低延迟运行提供了新思路。
局限性
- 在极端复杂环境或高动态变化场景下,ILP求解的计算成本可能成为瓶颈,尤其在大规模多智能体系统中,求解时间可能超出实时要求。
- 当前系统依赖于较为准确的相对坐标估计,传感噪声或感知误差可能影响记忆更新和动作选择的准确性。
- 对复杂环境中的动态障碍物和非结构化场景的适应性仍需进一步验证。
未来方向
未来将探索分层ILP或启发式算法以提升大规模系统的求解效率,同时结合学习型策略增强记忆的鲁棒性。还计划引入多模态感知信息,扩展系统在动态和复杂环境中的应用能力,并优化多智能体协作的自主性和适应性。
AI 总览摘要
多智能体embodied规划面临高延迟和低效率的挑战,尤其在复杂环境中失败动作频繁,严重制约系统的实用性。现有方法多依赖LLM生成动作序列,但缺乏高效的状态追踪和协调机制,导致重复探索和冲突频发,延长任务完成时间。本文提出的MOSAIC框架通过引入代理中心语义记忆和ILP优化,显著提升了多智能体系统的运行效率与鲁棒性。
代理中心语义记忆采用相对坐标存储环境中对象信息,减少空间推理成本,支持几何变换,确保信息的动态更新和跨代理传递。ILP在每个规划步中,从LLM生成的候选动作中筛选出满足碰撞避免、任务依赖和负载平衡的最优组合,实现动作级别的实时调度。两者结合,有效降低了失败率,缩短了任务时间。
在AI2-THOR和搜救任务中,MOSAIC实现了27-32%的速度提升,减少了30-33%的LLM调用,整体步骤减少25-31%,成功率提升4-10个百分点。实验验证了其在多智能体协作中的优越性能和扩展性。未来,系统将结合分层ILP和学习策略,进一步应对大规模复杂环境中的挑战,推动多智能体自主系统的广泛应用。
深度分析
研究背景
多智能体embodied规划是机器人、虚拟代理等自主系统的重要研究方向。早期工作如Task and Motion Planning (TAMP)主要解决单智能体的路径规划问题,近年来,深度学习和大模型推动了多智能体协作的研究,诸如基于强化学习的分布式调度和符号推理方法。代表性研究包括DeepMind的Multi-Agent Reinforcement Learning,以及基于LLM的任务生成与调度系统。然而,现有方法在环境感知、状态追踪和实时协调方面仍存在瓶颈,尤其在复杂场景中容易出现失败,导致高延迟和低效率。
核心问题
核心问题在于多智能体embodied规划中的状态追踪不准确和协调低效。部分观察限制导致环境信息不完整,影响动作生成的准确性;同时,缺乏有效的动作调度机制,导致冲突、冗余和失败频发。这些问题在实际应用中表现为高延迟、低鲁棒性,严重制约系统规模化和实用化。解决这些瓶颈,需在空间记忆和调度优化方面提出创新方案。
核心创新
创新点包括:1)提出代理中心语义记忆,利用相对坐标存储对象信息,减少空间推理成本,提高信息更新效率;2)引入ILP作为动作调度工具,将LLM生成的候选动作转化为全局一致的调度方案,确保物理可行性和任务协调;3)在每个规划步中动态优化动作组合,减少失败和冗余。该系统结合符号推理与学习模型,突破传统目标分配的局限,实现实时、细粒度的多智能体调度。
方法详解
- �� 设计代理中心语义记忆(ASM),存储对象的相对坐标,支持几何变换和跨代理信息传递。
- �� 利用LLM(如GPT-4)生成每个智能体的候选动作,确保动作的语义合理性。
- �� 构建ILP模型,将候选动作作为变量,加入碰撞、任务依赖和负载平衡等约束。
- �� 设计成本函数,惩罚高失败风险和不均衡负载,优化调度方案。
- �� 每个规划步中,ILP求解器筛选出满足约束的最优动作组合,指导智能体执行。
- �� 通过不断更新记忆和约束,系统实现动态、实时的多智能体协调。
实验设计
在AI2-THOR家庭环境和搜救模拟环境中,采用标准的任务指标(成功率、执行时间、LLM调用次数)进行评估。对比基线包括纯LLM调度和粗粒度目标分配方法。超参数如候选动作数K、ILP求解时间限制等经过调优。还进行了消融实验,验证语义记忆和ILP的贡献。系统在不同智能体数量(1-5)下表现出一致的性能提升,验证了扩展性。
结果分析
实验结果显示,MOSAIC在AI2-THOR环境中成功率提升至85%,比基线高出10%;在搜救任务中,任务完成时间缩短了30%,LLM调用次数减少了33%。失败动作比例从16%降至4%,显著改善了效率和鲁棒性。多智能体系统中,整体速度提升达1.3倍,且在大规模系统中仍保持优异性能,验证了其实用性和扩展性。
应用场景
该系统适用于家庭机器人、搜救无人机、工业自动化等场景,能实现高效、低延迟的多智能体协作。依赖于环境感知和语义理解,适合复杂、多变的环境中自主任务执行。未来可结合多模态感知和学习策略,进一步提升自主性和适应性,推动智能系统的广泛应用。
局限与展望
当前系统在极端复杂或动态变化环境中,ILP求解可能成为瓶颈,影响实时性。对传感噪声敏感,可能导致记忆更新误差。对非结构化环境和非平面运动的适应性仍需验证。未来需优化求解算法,增强鲁棒性,并扩展到更复杂的场景。
通俗解读 非专业人士也能看懂
想象你在厨房里准备一顿大餐,有多个厨师(智能体)同时工作。每个厨师都知道自己手边的食材(对象)和目标(菜肴),但他们不能随时看到整个厨房。为了不互相碰撞,也不重复做同样的事,他们需要一个共同的记忆——比如每个人都记着自己知道的食材位置。每次厨师准备下一步时,他们会根据自己的记忆和厨师长(系统)的建议,选择最合适的动作。系统会用一种聪明的方法(ILP)筛选出不会撞到人的方案,确保每个厨师都能顺利完成任务。这样,厨房里的厨师们就能高效协作,不会浪费时间,也不会出错。这个方法让厨房工作变得更快、更顺畅,也可以用在机器人、虚拟助手等地方,让它们更聪明、更合作。
简单解释 像给14岁少年讲一样
想象你和几个朋友一起玩拼图游戏。每个人都知道自己手里的拼图片和目标位置,但你们不能一直看着整个拼图。为了拼得快,还要避免撞到对方或拼错地方,你们会用一种特别的办法:每个人都记着自己知道的拼图片位置,然后通过一个聪明的规则(像ILP)决定谁拼哪个块,确保不重复、不冲突。每次轮到某个人拼时,系统会帮忙筛选出最合适的拼图方案,这样大家就能更快完成拼图。这就像让每个人都知道自己该做什么,又能合作得很好,整个拼图过程变得又快又顺利。这个方法可以用在机器人或虚拟人物,让它们更聪明、更合作,帮我们完成各种复杂任务。
原文摘要
LLM-based multi-agent embodied planning remains impractical due to prohibitively high execution latency. We identify failed actions as the dominant bottleneck, stemming from two core challenges: inaccurate state tracking under partial observability and inefficient coordination that produces redundant or conflicting actions. We introduce Mosaic, a runtime-efficient multi-agent planning framework that addresses both challenges. Mosaic maintains accurate yet lightweight state tracking through agent-centric semantic memory that stores objects in relative coordinates, enabling geometric transformations and coordination. It ensures efficient coordination through Integer Linear Programming that allocates actions at every planning step, enforcing physical feasibility and inter-agent coordination constraints. Across AI2-THOR and search-and-rescue benchmarks, Mosaic achieves 27-32% faster execution, 30-33% fewer LLM calls, 25-31% fewer steps, and 4-10% points higher success rates. These results demonstrate that efficient memory and constraint-guided coordination are critical for scalable, low-latency multi-agent planning.