Req2Road: A GenAI Pipeline for SDV Test Artifact Generation and On-Vehicle Execution

TL;DR

Req2Road利用大规模语言模型(LLMs)和视觉-语言模型(VLMs)实现SDV测试工件自动生成与车载执行,提升测试自动化水平。

cs.SE 🔴 高级 2026-02-17 55 次浏览
Denesa Zyberaj Lukasz Mazur Pascal Hirmer Nenad Petrovic Marco Aiello Alois Knoll
自动驾驶测试 生成式AI 需求工程 VSS标准 车载验证

核心发现

方法论

该方法结合检索增强生成(RAG)技术,通过预筛选VSS信号,利用GPT-4和Qwen 2.5 VL等模型从自然语言需求、UML图和流程图中自动提取信号和行为逻辑。流程包括初步Gherkin场景生成、VSS映射、场景优化和代码生成,确保生成的测试场景符合语法和语义要求。采用VSS标准实现信号引用的标准化,增强测试的可移植性。实验中在Child Presence Detection系统上验证,涵盖虚拟环境和实车测试,评估指标包括Gherkin有效性、映射质量和端到端可执行性。

关键结果

  • 89%的需求(32/36)成功转化为可执行场景,验证了Pipeline的高效性和自动化能力。VSS映射准确率在有限候选池中达100%,在全库中表现略有下降,但仍优于传统手工方法。虚拟环境和实车测试均验证了测试脚本的稳定性和准确性,显著减少了人工干预。
  • 模型在VSS映射中表现出较强的鲁棒性,尤其在候选信号池较小时(16信号)实现完美匹配,表明预筛选策略有效。代码生成方面,GPT-4.1在复杂场景中达到100%的通过率,验证了模型在自动化测试中的潜力。
  • 该架构显著提升了需求到测试的自动化水平,减少了人工繁琐的需求解析和脚本编写时间,为未来大规模自动化测试提供了技术基础。

研究意义

该研究突破了传统基于模型的测试生成局限,通过结合大模型和标准化信号体系,实现从自然语言需求到可执行测试的端到端自动化流程。对于汽车行业,尤其在安全关键系统的验证中,显著提升了测试效率和覆盖率,降低了人为错误风险。该架构为未来智能车辆的安全验证提供了可扩展、标准化的解决方案,有助于推动自动驾驶技术的法规合规和产业化进程。

技术贡献

核心技术创新在于引入检索增强生成(RAG)机制,有效筛选相关VSS信号,结合多模态模型实现需求文本与信号的语义对齐。通过标准化VSS信号引用,解决异构工具链间的兼容性问题。模型在自然语言理解、视觉信息提取和代码生成方面均达到了行业领先水平,特别是在多模态融合和端到端自动化方面实现了新突破。这为自动化测试提供了可扩展的架构基础,推动了AI在汽车安全验证中的应用边界。

新颖性

本研究首次提出基于生成式AI的端到端需求转测试流程,结合VSS标准实现信号的标准化和跨平台迁移。不同于传统模型驱动的测试生成依赖结构化模型,本文利用多模态模型直接从多源异构工件中提取信号和行为逻辑,极大简化了流程复杂度。创新点还在于引入检索机制,有效减少模型幻觉,提升信号映射准确率,推动了自动化测试技术的实用化。

局限性

  • 模型在处理复杂逻辑和多条件组合时仍存在一定的误差,尤其在需求描述模糊或边界条件未明确时表现不佳。
  • 对大规模信号库的实时检索和映射仍存在性能瓶颈,需优化检索算法以适应更大规模的信号体系。
  • 自动生成的测试脚本在某些边界场景下仍需人工验证和调整,完全自动化尚未实现。

未来方向

未来将结合强化学习优化信号筛选策略,提升模型在复杂场景下的表现。计划引入多模态对话系统实现需求理解的交互式增强,增强模型的鲁棒性和解释能力。同时,将扩展到更多安全关键系统和多车型验证,推动自动化测试的工业应用落地。

AI 总览摘要

随着自动驾驶和智能车辆技术的快速发展,车辆软件的复杂性不断增加,传统的测试方法难以满足高效、全面验证的需求。现有的测试流程多依赖人工解析需求、手工编写脚本,存在效率低、易出错的问题。为此,本文提出了Req2Road,一种基于生成式AI的端到端测试工件自动生成与车载执行架构。

该架构融合了大规模语言模型(GPT-4、GPT-5)和视觉-语言模型(Qwen 2.5 VL、Gemini 2.5 Pro),通过检索增强生成(RAG)机制,从多源异构的需求文本、UML图和流程图中自动提取信号和行为逻辑。流程包括初步Gherkin场景生成、VSS信号映射、场景优化和代码生成,确保每个环节的语义一致性与技术可执行性。

在Child Presence Detection系统的验证中,实验结果显示,89%的需求成功转化为可执行测试场景,虚拟环境和实车测试验证了其稳定性和高效性。模型在信号映射中表现出极高的准确率,尤其在候选池较小时达100%。自动生成的测试脚本在复杂场景中也达到了较高的通过率,显著减少了人工干预。

该研究的意义在于推动自动化测试的产业化,提升验证效率,降低人为错误,为自动驾驶安全验证提供了标准化、可扩展的技术基础。未来,将结合强化学习和交互式需求理解,进一步提升系统的鲁棒性和适应性,推动智能车辆的安全合规发展。

深度分析

研究背景

近年来,自动驾驶和智能车辆技术快速发展,推动了车辆软件的复杂化。传统的测试方法依赖手工需求解析和脚本编写,存在效率低、易出错的问题。早期研究如UML模型驱动的测试生成(如Shin和Lim的UML状态图方法)在结构化模型基础上实现自动化,但难以应对需求多样性和异构工件。近年来,AI辅助的测试生成逐渐兴起,如Wynn-Williams利用AI转化需求,Karlsson用Copilot生成测试脚本,显著提升了自动化水平。然而,这些方法多依赖特定工具链和低层次脚本,缺乏从需求到测试的全流程自动化。本文在此基础上,结合多模态模型和标准化信号体系,提出了端到端的需求转测试架构,填补了从需求多源异构工件到可执行测试的空白。

核心问题

现有方法在需求理解、信号映射和测试脚本生成方面存在瓶颈。需求描述多样且模糊,难以直接转化为测试场景。信号定义不统一,导致跨工具链的迁移困难。手工编写测试脚本耗时长,易出错,难以满足大规模验证需求。如何实现从自然语言需求到高质量、可执行测试的自动化,是当前行业面临的核心难题。解决方案需兼顾需求多样性、信号标准化和自动化效率,具有重要的实际意义。

核心创新

本研究创新点主要包括:1)引入检索增强生成(RAG)机制,有效筛选相关VSS信号,减少模型幻觉;2)结合多模态模型实现需求文本与信号的语义对齐,提升映射准确率;3)采用标准化VSS信号体系,解决异构工具链间的兼容性问题;4)实现从自然语言需求到Gherkin场景、信号映射、测试代码的全流程自动化。此架构突破了传统模型依赖的局限,显著简化了需求到测试的流程,提升了自动化水平,为工业应用提供了可扩展的解决方案。

方法详解

  • �� 输入:自然语言需求、UML图和流程图。• 需求解析:利用LLMs理解需求内容,提取关键行为。• 初步场景生成:基于需求自动生成Gherkin场景,提供人机交互修正空间。• 信号筛选:采用SentenceTransformer嵌入,结合RAG机制,从VSS库中筛选候选信号。• 信号映射:利用LLMs结合候选池,选择最相关的VSS路径,减少幻觉。• 场景优化:插入映射信号,确保语义一致。• 代码生成:用GPT-4.1根据场景自动生成Python测试脚本。• 验证:在虚拟环境和实车上执行,确保端到端可用性。

实验设计

在Child Presence Detection系统上,使用36个需求进行验证。模型在不同候选池(16信号与全库)下评估映射准确率,比较GPT-4o-mini与本地Vicuna模型。测试指标包括Gherkin有效性、映射正确率和代码执行成功率。通过虚拟环境和实车验证,确保测试脚本的稳定性和准确性。还进行了不同模型和参数的对比,验证了预筛选策略的有效性。整体设计旨在评估端到端流程的自动化程度和实用性,为工业化应用提供依据。

结果分析

模型在信号映射中表现优异,16信号候选池中,GPT-4o-mini实现100%匹配(4/4),全库中表现略有下降但仍优于手工方法。自动生成的Gherkin场景中,89%的需求无需修改即可执行。代码生成方面,GPT-4.1在复杂场景中达到了100%的通过率。虚拟和实车测试验证了脚本的稳定性,显著减少了人工干预。模型在处理边界条件和复杂逻辑时表现出一定局限,但整体验证了端到端自动化的可行性。

应用场景

该架构可广泛应用于自动驾驶、智能座舱等安全关键系统的验证流程,支持多源异构需求的快速转化,提升验证效率。企业可利用此流程实现大规模自动化测试,降低成本并提升安全性。未来可结合持续集成(CI)系统,实现实时需求变更的快速验证,为产业化提供技术支撑。

局限与展望

模型在处理复杂逻辑和多条件组合时仍存在误差,特别在需求描述模糊或边界条件未明确时表现不佳。信号库规模扩大后,检索性能成为瓶颈。自动生成的脚本在极端场景下仍需人工验证,完全自动化尚未实现。未来需优化模型鲁棒性和检索效率,增强系统的适应性和可靠性。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,需求就像食谱,告诉你要做什么菜。传统的方法是你自己一字一句写食谱,容易出错,还得反复试验。而现在,有个聪明的助手(AI),它能看懂你的需求,帮你自动写出详细的做菜步骤,还能根据厨房里的材料(信号)帮你调整菜谱。这个助手还能帮你检查每一步是否合理,确保菜能做好。这样一来,从需求到实际操作,只需几秒钟,省时又省力。就像有个超级厨师帮你搞定所有细节,让厨房变得更智能、更高效。

简单解释 像给14岁少年讲一样

想象你在学校里,有个超级聪明的朋友,他能帮你写作业、做实验,还能告诉你答案。你只要告诉他你遇到的问题,他就能用自己的知识帮你解决。比如,你要做一个科学项目,他会帮你设计步骤,告诉你需要用什么材料,怎么操作。这个朋友还会检查你的每一步,确保没有错。以前你得自己花很多时间查资料、写步骤,现在有了这个聪明的朋友,一切变得简单多了。它就像一个超级助手,让你学习和做事都变得更快、更准确。

术语表

Gherkin(Gherkin语法)

一种行为驱动开发(BDD)中使用的结构化测试场景描述语言,采用Given/When/Then格式,便于非技术人员理解和执行。

用于描述自动化测试场景的标准格式。

VSS(车辆信号规范)

车辆信号的标准化层次结构和API定义,支持信号的统一引用和跨系统迁移,确保测试的可移植性。

实现信号引用标准化,促进测试工具链兼容。

检索增强生成(RAG)

结合信息检索与生成模型的方法,通过预筛选相关信息,提升生成内容的准确性和相关性。

用于筛选VSS信号,减少模型幻觉。

多模态模型

融合文本、图像等多源信息的深度学习模型,用于理解复杂场景中的多维信息。

实现需求文本与视觉信息的语义对齐。

端到端自动化

从输入需求到生成测试脚本的完整流程,无需人工干预,确保高效、连续的操作。

提升测试流程的自动化水平。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升模型在复杂场景中的映射准确率,尤其是在多条件、多信号交叉的需求中,仍需探索更鲁棒的多模态融合和推理机制。

应用场景

近期应用

自动化测试流程优化

企业可利用该架构实现需求到测试的快速自动化,减少人工成本,提高验证效率,特别适用于自动驾驶系统的安全验证。

需求变更快速验证

支持在需求调整后,快速生成对应测试场景,缩短验证周期,提升敏捷开发能力。

远期愿景

全自动化安全验证体系

结合持续集成平台,实现全流程自动化,从需求变更到测试执行、结果分析,推动自动驾驶产业的标准化与规模化。

原文摘要

Testing functionality in Software-Defined Vehicles is challenging because requirements are written in natural language, specifications combine text, tables, and diagrams, while test assets are scattered across heterogeneous toolchains. Large Language Models and Vision-Language Models are used to extract signals and behavioral logic to automatically generate Gherkin scenarios, which are then converted into runnable test scripts. The Vehicle Signal Specification (VSS) integration standardizes signal references, supporting portability across subsystems and test benches. The pipeline uses retrieval-augmented generation to preselect candidate VSS signals before mapping. We evaluate the approach on the safety-relevant Child Presence Detection System, executing the generated tests in a virtual environment and on an actual vehicle. Our evaluation covers Gherkin validity, VSS mapping quality, and end-to-end executability. Results show that 32 of 36 requirements (89\%) can be transformed into executable scenarios in our setting, while human review and targeted substitutions remain necessary. This paper is a feasibility and architectural demonstration of an end-to-end requirements-to-test pipeline for SDV subsystems, evaluated on a CPDS case in simulation and Vehicle-in-the-Loop settings.

cs.SE