What Matters, When? Diagnosing and Improving Conditional Visual Grounding in Visuomotor Imitation Policies
使用ACT方法,研究视觉干扰对模仿策略的影响,显著提高了UR3e的鲁棒性。
Vivek Chavan, Pengtao Xie, Yahuan Shi 等
使用ACT方法,研究视觉干扰对模仿策略的影响,显著提高了UR3e的鲁棒性。
Vivek Chavan, Pengtao Xie, Yahuan Shi 等
提出一种神经符号框架,结合VLA控制与任务图,实现长时间视觉-语言-动作操作。
Vivek Chavan, Yahuan Shi, Oliver Heimann 等
开发了一种多模态人机交互的仿人机器人原型,手势识别准确率达96%。
Thang Tran Viet, Thanh Nguyen Canh, Huy Uong Gia 等
行为树在机器人系统中的适应性不足,需增强以应对动态环境。
Mehran Rostamnia, Gianluca Filippone, Ricardo Caldas 等
FIRE-LIVWO通过毫米波雷达增强,实现鲁棒的LiDAR-惯性-视觉-轮式里程计,平均定位误差5.677米。
Kun Hu, Menggang Li, Kaidi Wu 等
RoboSPA通过527K轨迹评估VLA模型在复杂场景和长时间任务中的表现。
Zhenxuan Fan, Bo Zhang, Yutong Lin 等
H2INT通过两阶段Transformer提高机器人在密集人群中的导航安全性和鲁棒性。
Ao Shen, Kaixi Chen, Shiwei Liu 等
结合VLA模型和顺应控制器,提升机器人到人类的双手交接效率。
Pasquale Marra, Stefano Berti, Gabriele Mario Caddeo 等
MulDP结合视觉与本体感知,通过扩散模型实现复杂地形的自主四足机器人穿越。
Kangmai Hu, Yueqi Zhang, Peng Zhai 等
采用语义分割与摄影测量结合的工件焊缝快速定位方法,误差约4.2mm。
Augustin Raju, Abilash Madavath, Chandra Yuvesh Aubeeluck 等
提出R2S-Eval,通过真实到模拟校准结合视觉-语言模型偏好评估,实现机器人行为的稳定评价。
Yidi Wang, Feixiang Ruan, Ruoqu Chen 等
提出TRACE架构,实现自主机器人决策的可追溯性,达98.6%的证据追溯率。
Cagri Temel
SG-AMP结合深度完成、场景图推理与语义感知运动规划,提升辣椒植物感知与主动视角选择。
Rohit Menon, Shiva Rudra Lolla, Niklas Mueller-Goldingen 等
基于行为树和环境模板的机器人自主 loco-manipulation 系统,实现快速、鲁棒、可调节的 humanoid 行为。
Duncan Calvert, Luigi Penco, Dexton Anderson 等
通过ParcelStow平台,比较专家与模仿学习策略在不同执行速度下的成功率,发现模仿学习在速度变化时性能下降明显。
Clinton Enwerem, John S. Baras, Calin Belta
提出DroneCATS-Agent,基于多模态大语言模型实现无人机自主控制,涵盖命令、追踪、搜索,验证模型在四项核心能力中的表现。
Jaewoo Park, Minyoung Lee, Sukmin Seo 等
扩展Rao-Blackwell化在线POMDP框架,结合混合连续离散信念表示,提升高维环境下的决策效率。
Jiho Lee, Nisar Ahmed, Kyle Hollins Wray 等
LightNav-0利用预训练VLM的空间推理能力,通过统一的点指令和残差量化轨迹,实现多任务通用机器人导航。
Shaoan Wang, Aocheng Luo, Fei Huang 等
Zeva通过在上下文中学习因果关系,实现机器人无需参数更新的自我演化,提升操控成功率。
Fu Chen, Xin Ding, Bingjia Huang 等
EMERGE-Policy通过多角色子代理协作,实现机器人系统的系统级策略,无需单一模型。
Zhirui Fang, Qingchi Yu, Ziyang Chen 等