STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision

TL;DR

STAR-VLM以nuScenes雷达监督训练VLM,速度MAE降至1.20 m/s,运动准确率达0.94。

cs.CV 🔴 高级 2026-08-03 24 次浏览
Pou-Chun Kung Aryaman Rao Utkrisht Sahai Hemanth Murali Yi Liu Rui-Yu Lin Katherine A. Skinner
视觉语言模型 汽车雷达 时空推理 速度估计 自动驾驶

核心发现

方法论

STAR-VLM以4B Qwen3-VL为基座,通过监督微调学习雷达径向速度、运动状态和自车速度。系统将雷达点投影到图像,使用坐标与红色箭头双重视觉提示,并采用STAR-Bench-radar构造问答数据;训练目标是文本token交叉熵,而非专门回归损失。

关键结果

  • 在STAR-Bench上,STAR-VLM的运动分类准确率达到0.80(人工标注)和0.94(雷达标注),显著高于Qwen3-VL 8B的0.54和0.62。
  • 径向速度MAE为1.94 m/s(人工标注)和1.37 m/s(雷达标注);联合自车速度训练后分别达到1.89和1.20 m/s,优于Any4D的2.31和3.60 m/s。
  • 在公共TADBench上,STAR-VLM取得0.81 VQA和0.72 MCQ;消融实验显示,仅联合运动与径向速度会退化,而加入自车速度后准确率恢复至0.80。

研究意义

论文证明低成本、普遍部署的汽车雷达不仅能作为推理时传感器,也能作为VLM训练教师。其Doppler测量提供真实世界速度尺度,缓解了视频VLM能描述运动却不会定量估速的问题。对学术界而言,它连接了跨模态监督、语言推理和物理度量学习;对工业界而言,雷达可减少人工标注与合成数据依赖,为自动标注和端到端驾驶提供可扩展方案。

技术贡献

技术核心包括三点:第一,将雷达距离与Doppler径向速度转为像素级问答监督;第二,提出坐标加视觉箭头的联合定位提示,改善查询点 grounding;第三,引入径向速度、运动分类和自车速度的跨任务SFT。模型不改架构,仅使用next-token prediction和交叉熵,即可获得度量时空能力,并在运动与速度两类任务上超过SegAnyMo、Any4D等专用模型。

新颖性

相较DepthLM主要学习度量深度,STAR-VLM首次将汽车雷达Doppler监督系统性用于VLM的度量时间推理,直接学习物体径向速度。其新颖性不在新增复杂网络,而在把自然存在的传感器信号转化为可扩展语言监督,并用自车速度帮助模型分离自车运动与目标运动。

局限性

  • 雷达主要提供径向速度,无法直接观测完整切向速度;遮挡、稀疏回波和多径效应仍会造成错误标签。
  • 实验以nuScenes前视图和4B Qwen3-VL为主,训练规模约34K图像,跨摄像头、天气、城市及更大模型的泛化仍未充分验证。
  • 文本输出速度依赖提示和格式,连续数值精度可能受语言生成误差影响。

未来方向

未来可融合多视角雷达、相机与LiDAR,学习完整三维速度而非径向分量;进一步研究不确定性估计、在线适应和更大规模跨城市验证。也可将雷达监督扩展到跟踪、场景流、规划及视觉语言动作模型,并探索更稳健的数值解码和物理约束。

AI 总览摘要

自动驾驶VLM已经能够描述道路场景,却常常无法回答一个关键问题:目标究竟以每秒多少米运动?现有时空方法依赖人工标注、复杂预处理或合成数据;DepthLM改善了度量深度,却没有解决时间维度。STAR-VLM提出以汽车雷达作为训练教师,让VLM从真实车辆的距离和Doppler信号中学习运动。

研究者基于nuScenes构建STAR-Bench,使用约34K训练图像和约900K雷达点。雷达点投影到图像后,模型通过“像素坐标+红色箭头”定位目标,并以问答形式预测运动/静止、径向速度和自车速度。模型基于4B Qwen3-VL,采用标准监督微调,不改动网络结构;自车速度任务帮助模型区分“车辆在动”和“相机在动”。

结果显示,STAR-VLM在人工标注和雷达标注上的运动准确率分别为0.80和0.94,径向速度MAE分别为1.94和1.37 m/s;加入自车速度联合训练后,MAE达到1.89和1.20 m/s。在TADBench上,VQA和MCQ准确率为0.81和0.72,超过通用VLM、Cosmos-Reason及专用SegAnyMo、Any4D。该工作说明,廉价雷达可以把语言模型从“看懂运动”推进到“用物理单位测量运动”,但完整三维速度、跨域泛化和雷达噪声仍是后续挑战。

深度分析

研究背景

VLM已从静态图像理解发展到DriveLM、DriveVLM、DriveMLM等驾驶推理系统;STSBench和TADBench进一步评估视频时空理解。SpatialVLM强调空间 grounding,DepthLM利用LiDAR改善深度,但动态场景的度量速度仍薄弱。汽车雷达低成本、全天候,并同时提供距离与Doppler,因此适合作为真实世界监督源。

核心问题

模型需要判断目标相对相机是运动还是静止,并估计以m/s表示的径向速度,同时排除自车运动影响。纯视觉存在尺度歧义,人工速度标注昂贵,合成监督有sim-to-real风险;雷达又稀疏、可能穿透遮挡,直接投影会产生错误标签。

核心创新

  • �� 用雷达点的距离、运动状态和Doppler速度生成STAR-Bench-radar。
  • �� 用人工3D框生成STAR-Bench-anno,作为对照。
  • �� 对雷达点采用N=30像素、深度差τ=0.3 m的遮挡过滤。
  • �� 联合文字坐标与红色箭头强化像素定位。
  • �� 联合训练径向速度、运动分类和ego-velocity,使模型学习自车补偿。

方法详解

  • �� 输入:nuScenes前视相机、雷达点和自车位姿。
  • �� 投影:将雷达点映射至图像;近处表面在30像素邻域内且深度近0.3 m以上时,删除后方点。
  • �� 查询:在目标像素绘制箭头,并在问题中同时给出(x,y)。
  • �� 输出:生成“The point has motion state X”或“radial velocity Y m/s”,速度保留两位小数。
  • �� 训练:以4B Qwen3-VL为基础,使用SFT、next-token prediction和交叉熵;联合ego-velocity问答增强度量与去自车运动能力。
  • �� 评估:比较Qwen2.5-VL、Qwen3-VL、Cosmos-Reason、DepthLM、SegAnyMo和Any4D。

实验设计

训练使用nuScenes trainval非mini部分,约34K图像、约900K雷达点;mini split约400张图像用于测试。模型在4张A100上训练12–30小时。指标为运动分类准确率、径向速度MAE,以及TADBench的VQA和MCQ准确率。实验包含人工标注/雷达标注对比、不同提示形式和跨任务消融。

结果分析

STAR-VLM在人工标注上的运动准确率为0.80、雷达标注为0.94;Qwen3-VL 8B仅为0.54和0.62。速度MAE为1.94和1.37 m/s,优于Any4D的2.31和3.60。TADBench达到0.81 VQA、0.72 MCQ。联合运动与径向速度会使性能降至0.62/0.81;加入ego-velocity后回升至0.80/0.94,并改善速度误差。

应用场景

可用于自动驾驶数据自动标注:从前视图直接生成目标运动状态和速度标签,减少人工框选与速度测量。雷达监督也适合车辆跟踪、风险评估和VLA系统训练。部署前提是相机—雷达标定、同步、自车位姿估计及目标查询机制;推理阶段不一定需要雷达。

局限与展望

雷达只观测径向分量,不能单独恢复完整三维速度;遮挡过滤仍可能误删有效回波或保留多径噪声。数据集中于nuScenes前视驾驶,尚未证明恶劣天气、不同传感器和跨地域稳定性。4B模型训练仍需4张A100,语言生成的数值格式也可能造成误差。未来应融合多视角和切向运动监督,并加入不确定性与物理约束。

通俗解读 非专业人士也能看懂

把VLM想成一位只看窗外视频的学徒司机。它能说“那辆车在动”,却未必知道车速是每秒3米还是10米,就像只看录像很难判断真实距离。STAR-VLM给这位学徒配了一位便宜的雷达教练:雷达会告诉它某个回波离车多远,以及目标是在靠近还是远离。

训练时,研究者把雷达信息贴回相机画面,在目标位置画一个红箭头,再提问“箭头处的物体速度是多少?”模型必须用文字回答。它还学习汽车自身的速度,因为相机和车一起移动时,画面里的变化不一定来自别的车辆。

结果像考试成绩:运动判断最高达到94%,速度平均误差降到1.20 m/s,优于专门做运动图和三维变化的工具。也就是说,它不只是看见变化,还能把变化换算成现实单位。不过雷达只擅长判断朝向自己的速度,横向速度、遮挡和噪声仍需要其他传感器帮助。

简单解释 像给14岁少年讲一样

想象你在玩赛车游戏。你看屏幕,能判断前面的车在移动,但如果游戏没有速度表,你很难凭画面准确说出它每秒跑几米。汽车摄像头也有类似问题:它看到的是图片变化,却不天然知道真实距离和速度。

STAR-VLM给AI配了一个像“蝙蝠回声定位”的雷达朋友。雷达发出信号,测量物体离车多远、正在靠近还是远离。研究者把雷达读数对准图片中的位置,再画一个红箭头,要求AI回答:“这里的东西是动还是不动?速度是多少?”

AI还要知道自己的车是否正在前进。否则,前方车辆看起来位置变化,可能只是摄影机跟着车移动。加入“我自己的车多快”这个问题后,AI更能分清谁真的在动。

在测试中,STAR-VLM判断运动的准确率最高达到94%,速度平均误差约1.20米/秒。很厉害吧!但它仍像只会看“朝向自己的速度”的小助手,不能独立准确知道横向移动;雨雪、遮挡和雷达杂波也可能让它判断失误。

术语表

Vision-Language Model (视觉语言模型)

能同时处理图像和文字、并以文字进行推理或回答的模型。本文使用Qwen3-VL作为基础模型。

STAR-VLM在不改变模型架构的情况下,通过监督微调学习时空度量任务。

Doppler velocity(多普勒速度)

由雷达回波频移推断的目标相对传感器速度,通常是径向分量。正负可表示远离或接近方向。

论文将其作为无需人工标注的速度监督。

Radial velocity(径向速度)

目标速度在传感器视线方向上的投影,不等于完整三维速度。其误差以MAE衡量。

STAR-VLM在STAR-Bench-radar上的MAE为1.37 m/s。

Ego-velocity(自车速度)

搭载传感器的平台自身的运动速度。它用于把相机观察到的变化与目标真实运动区分开。

联合训练后速度和运动分类均得到改善。

STAR-Bench

基于nuScenes构建的时空问答基准,包含雷达监督版和人工标注版。任务包括运动分类与速度估计。

训练主要使用radar版本,mini split用于评估。

Supervised Fine-Tuning(监督微调)

利用输入—答案样本继续训练预训练模型,使其学习特定任务。本文使用文本token交叉熵,而非专门回归头。

模型通过问答格式输出状态和数值速度。

开放问题 这项研究留下的未解疑问

  • 1 雷达主要提供径向速度,如何结合视觉光流或多视角信息稳定恢复完整三维速度,仍缺乏统一方案。
  • 2 STAR-VLM主要在nuScenes上验证;不同城市、天气、摄像头和雷达供应商之间的泛化能力尚不清楚。
  • 3 语言生成数值可能受格式和提示影响,如何建立可校准的不确定性与物理一致性输出值得研究。

应用场景

近期应用

自动驾驶数据自动标注

数据工程团队可用相机、雷达和自车位姿生成运动状态与径向速度问答标签,减少人工速度标注。需要可靠标定、时间同步和遮挡过滤,可服务车辆跟踪、风险分析与模型训练。

驾驶场景运动问答

在驾驶监控或调试系统中,STAR-VLM可根据指定图像位置回答目标是否运动及其相对速度。推理时可主要依赖相机,适合生成可读的自动标注和工程诊断信息。

远期愿景

度量感知的驾驶VLA

未来可把雷达监督得到的速度理解接入视觉语言动作模型,使规划系统不仅描述车辆关系,还能依据距离、速度和自车运动制定更安全的决策。关键障碍是完整三维运动和跨域可靠性。

原文摘要

Vision-language models (VLMs) are emerging as a key component of embodied intelligence, with growing applications in auto-labeling and end-to-end autonomous driving. However, existing approaches for improving spatiotemporal reasoning in VLMs often rely on complex preprocessing pipelines, expensive human annotations, or synthetic data, which limit scalability and introduce potential sim-to-real gaps. Moreover, although these methods have improved spatiotemporal understanding, they still lack strong metric reasoning capabilities for dynamic scenes, such as estimating object motion in real-world units. Prior work has explored LiDAR-based metric depth supervision to enhance spatial perception, but it does not directly address temporal reasoning. We introduce STAR-VLM, an automotive radar-supervised framework that enhances spatiotemporal VLMs with motion reasoning and metric velocity estimation for autonomous driving. Automotive radar is a low-cost and widely deployed sensor that provides complementary spatiotemporal supervision through range and Doppler measurements. By leveraging these measurements as label-free ground truth during training, STAR-VLM improves the metric spatiotemporal reasoning ability of VLMs. Through experiments on driving scenarios, we show that STAR-VLM achieves state-of-the-art performance on both motion classification and metric velocity estimation, outperforming even task-specific methods designed for each task. These results highlight automotive radar as a scalable and cost-effective source of supervision for building metric-aware spatiotemporal VLMs for real-world autonomous driving.

cs.CV cs.RO