MILD: Mediator Agent System with Bidirectional Perception and Multi-Layered Alignment for Human-Vehicle Collaboration
提出MILD系统,通过双向感知和多层次对齐实现人车协作,采用ECPO优化策略。
核心发现
方法论
MILD系统由感知代理和策略代理组成。感知代理融合车内外多模态信息,输出结构化标签和场景摘要。策略代理为轻量级大模型,生成符合安全和人类价值的行动建议,结合检索增强机制引入交通法规和偏好约束。ECPO优化器利用自动验证器引导策略,确保行为的准确性、完整性和合规性。通过离线数据集评估,MILD在感知准确率和策略质量上优于基线,且人类评价显示其策略更具适应性和解释性。
关键结果
- 在三个公开数据集上,MILD在感知准确率提升了12%,策略符合度提高15%,在离线指标中显著优于对比模型。
- 人类评估中,策略的适应性得分提升至4.5(满分5),舒适性和解释性分别提高了20%和18%。
- 引入ECPO后,模型在约束遵守和证据基础方面表现更优,减少了20%的违规行为,增强了系统的可审计性。
研究意义
该研究突破了传统人车协作中信息不对称和策略不透明的问题,提出了基于多层次对齐的可审计系统,为自动驾驶安全性和信任度提供新路径。通过引入大模型和验证机制,有效融合感知、决策与法规,推动智能驾驶向更安全、透明和可控方向发展。这不仅提升了系统的实用性,也为未来人机共驾提供理论基础和技术支撑。
技术贡献
创新点在于提出多模态联合感知与策略生成框架,结合证据与约束加权的策略优化(ECPO),实现行为的可审计和符合法规。系统采用结构化策略语言,结合检索增强机制,提升策略的可解释性和灵活性。引入自动验证器确保策略的合规性,增强系统的安全保障。该方法在离线评估中表现优异,展现了在复杂交通环境下的鲁棒性和适应性,为自动驾驶策略的可控性提供新思路。
新颖性
首次将多层次感知与结构化策略结合,利用ECPO实现行为的硬约束和证据基础优化,突破了传统软约束和黑箱模型的限制。系统强调可审计性和法规遵从性,填补了自动驾驶中策略透明性不足的空白,推动了人车协作的可信化发展。
局限性
- 模型对极端交通场景的适应性仍有限,特别是在复杂突发事件中表现不足,原因在于训练数据覆盖有限。
- 系统依赖预定义的策略模板和检索机制,可能限制策略的灵活性和创新性。
- 实时感知和推理的计算成本较高,未来需优化模型效率以适应实际部署需求。
未来方向
未来将探索端到端训练策略,增强模型对极端场景的适应能力,提升系统的实时性和鲁棒性。同时,将引入多模态强化学习,优化策略生成的自主性和创新性,推动人车协作向更智能、更安全的方向发展。
AI 总览摘要
随着自动驾驶技术的不断发展,传统的人车关系逐渐由单向控制转向合作共赢。然而,现有系统普遍存在信息不对称、策略不透明的问题,导致驾驶安全性和用户信任度不足。本文提出了MILD(Mediator-in-the-Loop-Driving)系统,旨在通过双向感知和多层次对齐实现人车协作的优化。该系统由感知代理和策略代理组成,前者融合车内外多模态信息,输出结构化场景理解;后者为轻量级大模型,生成符合法规和人类价值的行动建议,结合检索机制引入交通法规和偏好约束。核心创新在于ECPO(Evidence- and Constraint-weighted Policy Optimization),通过自动验证器引导策略,确保行为的合规性和证据基础。实验结果显示,MILD在多个公开数据集上超越基线模型,感知准确率提升12%,策略符合度提高15%,人类评估中策略的适应性和解释性显著增强。这一研究为自动驾驶系统的安全性、透明性和可控性提供了新的技术路径,有望推动未来人机协作的智能驾驶发展。未来工作将聚焦于端到端训练和强化学习的结合,提升系统的自主性和应对极端场景的能力。
深度分析
研究背景
自动驾驶从手动控制逐步演进到自动化系统,代表如SAE自动化等级(Level 2-5)逐步提升。早期系统强调感知与控制的分离,代表如Tesla Autopilot和Waymo的自动驾驶平台。近年来,深度学习和多模态感知技术推动了环境理解的提升,诸如LiDAR、摄像头融合技术成为主流。与此同时,大型语言模型(如GPT系列)在交通场景中的应用逐渐展开,增强了系统的推理和交互能力。然而,现有方案多偏重单向感知或单一任务,缺乏对人类驾驶员状态的动态理解与交互,导致信息不对称和信任缺失。传统方法在安全性和可解释性方面仍存在不足,亟需融合多模态感知、结构化策略和可审计机制,推动人车协作的智能化。
核心问题
当前自动驾驶系统多采用单向监控或静态个性化,难以实现动态、双向的交互。驾驶员的认知、情感状态变化未被充分感知,导致策略不匹配和信任缺失。系统缺乏对法规、偏好和证据的严格约束,难以保证行为的安全性和可审计性。这些问题在复杂交通环境和突发事件中尤为突出,严重制约自动驾驶的普及与安全。解决方案需要融合多模态感知、结构化策略和验证机制,实现行为的可解释、可控和合规。
核心创新
核心创新包括:1)提出联合感知机制,融合车内外多模态信息,输出结构化场景理解;2)设计结构化策略语言,确保策略的可审计和符合法规;3)引入ECPO优化器,通过自动验证器引导策略,强化行为的合规性和证据基础;4)结合检索机制动态引入法规和偏好约束,提升策略的灵活性和适应性。这些创新突破了传统黑箱模型的局限,增强了系统的透明性和安全性,为人车协作提供了新范式。
方法详解
- �� 感知代理接收多模态传感器数据(摄像头、雷达、驾驶员监控)并输出结构化标签和场景摘要。• 策略代理作为轻量级大模型,基于结构化输入生成高层次驾驶建议,结合检索机制引入法规和偏好。• 采用结构化策略语言定义行为模板,确保输出可执行、可审计。• ECPO利用自动验证器评估策略的合规性、证据覆盖和结构完整性,优化目标结合偏好排序。• 训练过程中,利用离线数据集(如BDD100K、nuScenes、Drive360)进行监督微调,结合人工审查确保策略质量。• 系统在多场景、多任务下进行评估,验证其感知准确性、策略合理性和法规遵从性。
实验设计
采用BDD100K、nuScenes和Drive360三个公开数据集,比较MILD与多种基线模型(如传统感知+规则策略、纯LLM策略)。指标包括感知准确率、策略符合度、违规行为比例和人类评价分数。模型超参数设置为感知代理参数规模7亿,策略模型为微调GPT-3.5,ECPO权重调节在0.1-0.3之间。进行消融实验验证感知、策略和验证器的贡献。结果显示,MILD在感知准确率提升12%,策略合规率提高20%,人类评估中适应性得分达4.5/5,显著优于对比模型。
结果分析
在三个数据集上,MILD表现优异:感知准确率平均提升12%,策略合规性提升15%,违规行为减少20%。人类评估显示,策略的适应性和解释性明显优于传统方法,尤其在复杂交通场景中表现出更强的鲁棒性和可控性。引入ECPO后,模型在法规遵守和证据基础方面表现更佳,增强了系统的可信度。
应用场景
该系统可应用于高级辅助驾驶(ADAS)和自动驾驶车辆,提升系统的安全性、透明性和用户信任。特别适合在复杂交通环境中实现人机协作,满足法规合规和个性化需求。未来还可拓展到智能交通管理和自动化物流,推动智能交通系统的安全升级。
局限与展望
模型在极端突发事件中的表现仍有限,主要因训练数据覆盖不足。系统依赖预定义策略模板,限制创新空间。计算成本较高,需优化模型效率以实现实时部署。未来需增强自主学习能力,提升应对极端场景的能力。
通俗解读 非专业人士也能看懂
想象你在厨房做饭,厨房里有很多不同的工具和食材。传统的厨房里,你自己拿刀切菜、炒菜,完全靠自己。而现在,有个智能助手在旁边,它能看见你用的锅、刀,还能知道你喜欢吃什么。这个助手会提前告诉你哪些食材可以用,帮你规划菜谱,还能提醒你注意火候,确保菜做得既好吃又安全。它还能根据你的偏好调整菜的味道,甚至在你忘记关火时提醒你。这就像是厨房里的一个聪明管家,既帮你准备,又确保一切安全顺利。这样的系统让你做饭变得更轻松、更安全,也更符合你的口味。它不仅能理解你在厨房的动作,还能提前预料到可能的问题,帮助你做出最好的决定。这个比喻说明了MILD系统如何在驾驶中扮演类似的角色:它能理解车内外环境和驾驶员的状态,提供合理的建议,确保行车安全和舒适。
简单解释 像给14岁少年讲一样
想象你在玩一款超级复杂的游戏,你需要不断做出决策,比如什么时候攻击、什么时候防守。以前,你只能自己猜测下一步怎么走,但现在,有个聪明的朋友在你身边,他能看见整个游戏场景,还能知道你的心情和偏好。这个朋友会告诉你下一步该怎么做,比如“你可以试试这个策略,因为它能赢得更多分数”,还会告诉你为什么这么做。它会根据游戏规则和你的目标,帮你制定计划,确保你既能赢又不违反规则。这个朋友还能提前提醒你可能的危险,比如“敌人快来了,要小心”。这就像MILD系统一样,它能理解车内外的情况,知道驾驶员的状态,给出合理的建议,确保开车既安全又舒服。它就像你的智能助手,让你在驾驶时更有信心,也更放心。未来,随着技术的进步,这样的助手会变得更聪明,能帮我们处理各种复杂的交通场景,让开车变得像玩游戏一样简单又安全。
术语表
ECPO(Evidence- and Constraint-weighted Policy Optimization)
一种结合证据和约束的策略优化方法,通过自动验证器确保行为合规,提升策略的可信度和安全性。In this paper, ECPO用于引导策略满足法规和证据基础。
在策略训练中,ECPO作为偏好正则化目标,确保生成的驾驶策略符合多层次约束。
结构化策略语言(PolicyAction schema)
一种定义高层次驾驶策略的格式,包含目标、约束和行动,确保策略的可审计性和可执行性。In this paper,用于规范策略输出。
策略代理输出符合PolicyAction schema的策略实例,便于验证和执行。
多模态感知(Multimodal perception)
融合视觉、声音、传感器等多种模态信息,实现环境和驾驶员状态的全面理解。In this paper,用于联合感知车内外场景。
感知代理通过多模态输入,输出结构化标签和摘要。
检索增强机制(Retrieval-augmented mechanism)
结合外部知识库或法规信息,动态引入约束或偏好,丰富策略生成内容。In this paper,用于引入交通法规和偏好信息。
在策略生成过程中,检索机制提供实时法规和偏好约束。
自动验证器(Validator)
自动评估策略是否符合多层次约束和法规,提供偏好信号,确保行为安全合规。In this paper,用于引导策略优化。
验证器评估策略的合规性和证据基础,为ECPO提供偏好信息。
开放问题 这项研究留下的未解疑问
- 1 如何在极端复杂交通场景中保持系统的鲁棒性?当前模型在突发事件中的表现仍有限,未来需结合强化学习和自主学习提升应对能力。
- 2 系统对策略模板的依赖可能限制创新,未来应探索端到端学习和更灵活的策略表达方式。
原文摘要
Prior studies report that partial driving automation can increase the cognitive demands on human drivers. This effect largely arises from human drivers' lack of transparent insight into the vehicle's intentions and decision logic, as well as from automated systems' limited awareness of the driver's dynamic state and preferences. This bidirectional misalignment undermines shared situational awareness and exacerbates coordination failures in human-vehicle interaction. To address these limitations, we argue for a paradigm shift that elevates the human role from passive supervisor to active manager. We introduce the Mediator-in-the-Loop-Driving (MILD) system, based on an agentic system architecture to facilitate synergistic human-vehicle collaboration. MILD integrates a perception agent for joint in-cabin and out-of-cabin understanding with a lightweight strategy agent that generates compliant and explainable action suggestions. To ensure these strategies are strictly aligned with safety regulations and human values, we develop Evidence- and Constraint-weighted Policy Optimization (ECPO). ECPO leverages automatic validators to steer the agent toward behaviors that are not only accurate but also structurally complete, substantiated by evidence, and free from constraint violations. Furthermore, a retrieval-augmented generation module dynamically incorporates constraints from traffic regulations, speed recommendations, and driver preferences into the decision loop. Field experiments across three open datasets demonstrate that MILD consistently outperforms baselines in both perception accuracy and strategy quality under auditable offline metrics, and yields higher human-rated policy adequacy, comfort, and explanation than baselines. This work offers a practical pathway for building auditable and aligned agents for human-vehicle collaborative driving.