CrossTraffic: An Open-Source Framework for Reproducible and Executable Transportation Analysis and Knowledge Management

TL;DR

CrossTraffic以知识图谱约束LLM执行,MAE<0.50、无效输入F1=1.0。

cs.CY 🔴 高级 2026-02-09 27 次浏览
Rei Tamaru Bin Ran
知识图谱 交通工程 大语言模型 可复现计算 语义验证

核心发现

方法论

CrossTraffic将交通规范转化为可执行软件基础设施:Rust Transportations Library负责权威计算,PyO3和WebAssembly提供跨平台接口,知识图谱G=(V,E)编码参数、条件、规则与出处。Semantic Validator依次完成语义映射、上下文解析、谓词评估和执行拒绝;MCP把函数作为LLM工具,RAG仅负责检索说明,数值必须调用已验证核心。

关键结果

  • 在River Falls Bypass的WIS 35/WIS 65五路段案例中,WASM Web Calculator与MCP-LLM接口均得到总体LOS C;总体跟随密度分别为5.09和5.05 fol/mi,差异主要来自浮点舍入。
  • 跨多个LLM的知识图谱约束执行将数值误差降至近零,MAE<0.50,相比仅依赖上下文的方法误差降低超过94%,说明结构化规则改善了计算和方法忠实度。
  • 边界值与组合冲突生成器构造1000个测试向量,含12.01 ft车道、负尺寸及高速—小半径组合;TP=740、TN=260、FN=0,F1=1.00。

研究意义

论文回应了HCM、AASHTO知识分散在PDF和专有软件中的长期问题。它把规范、计算、审计和自然语言访问连接起来,使交通分析从一次性工具转向可维护、可复核、可部署的公共基础设施。对研究者而言,统一核心有利于复现实验和比较模型;对机构而言,规则可追溯、接口可共享,降低跨部门协作与软件迁移成本。

技术贡献

核心贡献是把规范性语义验证置于计算执行之前,而不是把输入检查写成孤立的if语句。Ontology中的Parameter、DesignRule、Condition和Provenance通过VALIDATES、REQUIRES、AFFECTS、CITED_IN关联;Algorithm 1按上下文筛选ActiveRules,失败时返回带引用的SemanticException。Rust强类型、TDD、CI回归测试、PyO3/WASM及MCP共同形成从规则到执行的可审计链。

新颖性

多数RAG或LLM交通系统只检索文档、生成解释,不能保证程序步骤和数值合法。CrossTraffic的新颖点在于可执行监管本体:知识图谱不仅描述交通概念,还决定哪些规则被激活、何时拒绝请求,并把规则出处连接到真实计算核心。

局限性

  • 实验主要围绕HCM第七版、AASHTO约束和两车道公路示例,尚不足以证明对城市路网、信号控制或其他手册的普适性。
  • 论文给出总体精度和压力测试结果,但对不同LLM、提示词、RAG检索质量及运行成本的逐项消融仍有限;规则编码错误也可能成为共同失效源。

未来方向

后续可扩展更多HCM章节、AASHTO规范和研究模型,建立社区审查与版本治理;同时应评估大规模KG查询、复杂多模式网络、实时数字孪生和更多LLM,并完善不确定性表达、规则冲突处理及独立第三方验证。

AI 总览摘要

交通工程长期依赖HCM等手册和计算软件,但关键公式常封装在黑箱工具中,规范更新难以同步,PDF知识也难以被机器验证。这使同一设计在不同平台上可能得到不同结果,并限制机构间复用与协作。

CrossTraffic提出一种开放框架,把交通方法视为可持续部署的软件基础设施。Rust Transportations Library保存权威方程,PyO3和WebAssembly支持Python、浏览器与桌面端;知识图谱记录Parameter、DesignRule、Condition和Provenance,并在计算前执行语义验证。MCP服务器再以结构化工具调用连接LLM,RAG负责解释和检索,不能直接替代计算核心。

结果显示,River Falls Bypass五路段分析中,WASM计算器与LLM接口均给出总体LOS C。跨多个LLM的知识图谱约束执行达到MAE<0.50,误差较上下文方法降低超过94%;1000个含边界攻击和物理冲突的测试向量得到F1=1.00,FN=0。该系统因此把自然语言便利性与工程可审计性结合起来。不过,当前验证集中于两车道公路和有限规则,未来仍需扩展规范、城市场景、实时仿真与社区治理。

深度分析

研究背景

交通知识由HCM经验方程、AASHTO设计规范、机构数据和仿真工具共同构成。既有Transportation Knowledge Networks改善了文档共享,RAG和LLM改善了自然语言访问,Ontology-based Knowledge Management则支持RDF/OWL式机器表示。然而,大多数系统仍交换数据或文本,未把规范直接连接到可执行分析。CrossTraffic针对这一缺口构建开放、可审计的计算与知识管理基础设施。

核心问题

传统工具把车道宽度、坡度和设计速度当作普通浮点数,无法识别上下文条件、类别冲突或速度—半径物理不相容。LLM虽能解释HCM,却可能遗漏步骤、幻觉规则或生成程序上无效的输入。问题不是单纯算术精度,而是如何在执行前验证语义、法规来源和方法流程,并在不同平台保持同一结果。

核心创新

  • ��可执行监管本体:把HCM第七版和AASHTO约束编码为图规则,而非静态文本。

  • ��分层架构:Rust核心负责唯一计算真值,PyO3/WASM负责迁移,Web、桌面、Python和SUMO共享实现。

  • ��语义闸门:Algorithm 1先映射参数、解析Condition、筛选ActiveRules,再评估谓词;失败则返回带来源引用的400错误。

  • ��受控智能体:MCP将计算函数暴露给LLM,RAG提供说明但不生成最终数值。

方法详解

  • ��输入:JSON设计向量I;过程:FindParameterNode把键映射到KG Parameter,未知参数立即标记。

  • ��上下文:GetActiveRules依据FacilityType等Condition构造Ractive,避免评估无关规则。

  • ��规则:检查SF-001车道宽9–12 ft、SF-002路肩0–8 ft、SF-003水平类别0–5、SF-004超车类型,以及SF-005的R≥Rmin(Vdesign)。

  • ��执行:Evaluate失败即TraverseSource追溯HCM章节或AASHTO Green Book出处,返回SemanticException;全部通过后序列化为Rust结构并运行核心。

  • ��验证:TDD单元测试、CI回归测试、WASM/Python接口和SUMO TraCI协同仿真检验跨环境一致性。

实验设计

研究包含四类验证:计算真值与跨界面一致性、逻辑鲁棒性、数字孪生式协同仿真和LLM可靠性。真实案例为Wisconsin River Falls Bypass的WIS 35/WIS 65,按HCM Chapter 15分析五个连续路段。压力测试使用边界值与随机组合生成器,N=1000,包含12.01 ft车道、高速小半径、负尺寸和过大坡度。论文还比较WASM计算器与MCP-LLM接口,并以MAE、LOS、混淆矩阵和F1衡量性能。

结果分析

五路段中,两种接口均得到总体LOS C;WASM总体AS为5.09、LLM为5.05,路段结果虽有差异但服务等级一致。知识图谱约束使多个LLM的MAE低于0.50,较context-only方法减少超过94%的计算误差。1000个压力样本中TP=740、TN=260、FN=0,F1=1.00,说明测试范围内没有非法设计被放行,也没有有效流程被错误阻断。

应用场景

交通机构可用HCM Calculator进行可追溯的道路设计与服务水平分析;研究者可通过Python复用Rust核心,避免重复实现公式。WASM适合浏览器和桌面部署,SUMO导出与TraCI支持微观仿真联动,MCP则让工程师用自然语言查询规则和调用计算。前提是规则来源明确、KG维护及时,并由工程人员复核关键决策。

局限与展望

当前证据集中于两车道公路、有限HCM/AASHTO规则和一个案例;不能直接推断城市信号、公交、行人或大规模网络性能。论文尚未充分报告每个LLM、提示词、检索器和规则模块的消融,也未量化KG查询及实时仿真成本。更重要的是,若规范被错误编码,强验证器可能稳定地产生错误拒绝,因此需要版本审计、冲突规则处理和独立专家验证。

通俗解读 非专业人士也能看懂

把CrossTraffic想成一家管理道路设计的智能厨房。传统做法像厨师各自保存食谱:有人看PDF,有人使用不透明的外卖软件,同一道菜可能做出不同味道。CrossTraffic先建立一份公开食谱库,写清每种材料、适用场景、来源和制作步骤。

顾客可以用普通话点菜,但服务员不会凭记忆乱做。它先检查“车道宽度”是否在允许范围、道路类型是否匹配,以及高速公路弯道是否太急;如果不合适,就说明哪条食谱规定不允许,并指出出处。只有检查通过,真正的厨房机器才开始计算。

厨房的核心设备用Rust制作,网页、电脑和Python只是不同窗口,因此同一订单不会因换设备而改变结果。系统还能把结果送到SUMO这样的交通模拟厨房,观察车辆实际如何运行。实验中,五段道路在网页和聊天窗口都得到LOS C;1000次故意刁难测试中,错误输入全部被拦住。这种设计让语言助手负责沟通,却不负责偷偷改食谱。

简单解释 像给14岁少年讲一样

想象你在赛车游戏里设计一条公路。你告诉AI:“车速很高,弯道半径很小,帮我算一下表现。”普通聊天机器人可能很自信地给答案,却没发现这条路现实中可能危险。CrossTraffic像游戏里的超级裁判:它不只听懂你的话,还会检查规则。

它有一个公开规则库,里面记录车道宽度、路肩、道路类别和弯道安全条件,还写着每条规则来自HCM或AASHTO哪里。AI可以帮你找到说明、解释术语,但真正的数字计算必须交给经过测试的计算引擎。就像游戏里玩家可以提议动作,裁判决定动作是否合法。

这个系统还能在网页、电脑、Python程序和聊天软件中工作,因为大家都使用同一个核心。研究人员用River Falls Bypass道路测试,网页和聊天方式都给出总体LOS C。它还接受了1000次故意捣乱的测试,包括太宽的车道和高速急弯,所有危险输入都被识别。很酷吧?不过它目前主要懂两车道公路,未来还要学习城市路口、公交和更多规则。

术语表

Knowledge Graph(知识图谱)

用节点和关系表示对象、条件、规则及来源的机器可读结构。它让系统能够进行上下文相关的规则查询,而不只是搜索文字。

CrossTraffic用G=(V,E)编码交通参数和监管约束。

Semantic Validator(语义验证器)

在计算前检查输入是否符合工程含义、适用条件和规范规则的组件。它区别于只检查数据类型或数值格式的普通验证。

它执行语义映射、上下文解析、谓词评估和拒绝。

MCP(模型上下文协议)

一种让LLM以结构化方式调用外部工具和数据的接口协议。它把语言理解与确定性计算分开。

MCP服务器向Claude等智能体暴露Transportations Library函数。

RAG(检索增强生成)

先从文档库检索相关片段,再辅助模型生成回答的方法。RAG适合解释和引用,但本身不保证计算程序合法。

HCM文档被嵌入ChromaDB供语义检索。

WASM(WebAssembly)

可在浏览器和多种运行环境执行的便携式编译格式。它使网页端能够运行与服务器相同的Rust二进制逻辑。

CrossTraffic用WASM部署浏览器计算器。

LOS(服务水平)

描述交通运行质量的等级指标,论文案例中总体结果为C。它把速度、跟随密度等分析结果归纳为可解释等级。

用于比较WASM和LLM接口的五路段分析。

开放问题 这项研究留下的未解疑问

  • 1 如何把本体规则扩展到城市信号、公交、行人和多模式网络,同时保持规则之间无冲突,论文尚未验证。
  • 2 错误规范编码会造成系统性错误;需要社区审查、版本化证据链和独立工程认证来评估长期安全性。

应用场景

近期应用

可追溯HCM计算器

州交通部门或咨询公司可部署WASM网页端和桌面端,统一执行HCM第15章分析。工程师输入道路参数后获得计算结果、规则检查和来源引用,减少不同软件版本造成的差异。

LLM工程助手

研究团队可通过MCP连接聊天智能体,让用户用自然语言查询HCM术语、解释参数并调用Rust计算。部署前需要维护KG、配置文档检索库,并由专业人员审核关键设计。

远期愿景

开放交通科学基础设施

社区可持续加入新的HCM章节、AASHTO规范、研究模型和仿真器,使交通知识像开源软件一样版本化、可测试、可审计,并支持跨机构协作和数字孪生。

原文摘要

Transportation engineering often relies on technical manuals and analytical tools for planning, design, and operations. However, the dissemination and management of these methodologies, such as those defined in the Highway Capacity Manual (HCM), remain fragmented. Computational procedures are often embedded within proprietary tools, updates are inconsistently propagated across platforms, and knowledge transfer is limited. These challenges hinder reproducibility, interoperability, and collaborative advancement in transportation analysis. This paper introduces CrossTraffic, an open-source framework that treats transportation methodologies and regulatory knowledge as continuously deployable and verifiable software infrastructure. CrossTraffic provides an executable computational core for transportation analysis with cross-platform access through standardized interfaces. An ontology-driven knowledge graph encodes engineering rules and provenance and serves as a semantic validation layer for analytical workflows. A conversational interface further connects large language models to this validated execution environment through structured tool invocation, enabling natural-language access while preventing procedurally invalid analyses. Experimental results show that knowledge-graph-constrained execution substantially improves numerical accuracy and methodological fidelity compared with context-only approaches, achieving near-zero numerical error (MAE<0.50) across multiple large language models and perfect detection of invalid analytical inputs in stress testing (F1~=~1.0). Its modular architecture supports the integration of additional transportation manuals and research models, providing a foundation for an open and collaborative transportation science ecosystem with a reproducible computational core. The system implementation is publicly available at https://github.com/crosstraffic.

cs.CY cs.IR