Teaching Vision-Language-Action Models What to See and Where to Look
DriveTeach-VLA通过DVD和2D-TGP优化视觉语言行动模型,Navsim上PDMS达90.4。
Yuguang Yang, Canyu Chen, Zhewen Tan 等
DriveTeach-VLA通过DVD和2D-TGP优化视觉语言行动模型,Navsim上PDMS达90.4。
Yuguang Yang, Canyu Chen, Zhewen Tan 等
提出AgenticDataBench,基于多领域真实数据和技能层级的端到端数据智能评测平台。
Zhaoyan Sun, Shan Zhong, Daizhou Wen 等
C3RL校准置信度,CAS按置信度扩展推理,最多节省12.33倍预算。
Xuqing Yang, Yi Yuan, Shanzhe Lei 等
VLAFlow通过联合训练和未来潜在对齐实现视觉-语言-动作模型的稳定迁移。
Guoyang Xia, Fengfa Li, Hongjin Ji 等
MVFusion-GS通过运动-方差引导的时间注意力提升动态高质量高斯点云重建。
Jianwei Hu, Tingxuan Huang, Hengyu Zhou 等
提出O3-D数据集,通过深度排序任务评估视觉-语言模型的深度理解能力,深度识别准确率仅47-56%。
Yiqian Liu, Iuliia Kotseruba, John K. Tsotsos
提出PMD方法,通过跨集记忆提升语言模型性能,实验结果提升3.8-13.6%。
Ye Liu, Srijan Bansal, Bo Pang 等
CreativityNeuro通过对比权重调整提升发散性思维,DAT表现提升14个百分点。
Samuel Schapiro, Core Francisco Park, Felix Sosa 等
提出H-Tac数据集和TTP预训练系统,实现机器人细粒度操控的跨模态迁移。
Chi Zhang, Penglin Cai, Ziheng Xi 等
RoboWorld结合STEP FORCING与视频世界模型,实现高效、可靠的机器人策略评估,相关性达0.989。
Byeongguk Jeon, Seonghyeon Ye, JaeHyeok Doo 等
引入行为基础的LLM评估器,通过QRI卡提升搜索相关性与用户偏好一致性。
Ali Vardasbi, Gustavo Penha, Enrico Palumbo 等
本研究评估四种基于运动的AI视频检测器,揭示偏差和短路学习,发现频率方法更具泛化性。
Joren Michels, Lode Jorissen, Nick Michiels
本文首次比较语音模型(SLM)与条件流匹配(CFM)在情感引导中的几何特性,发现SLM具有低维、可组合的情感子空间。
Siyi Wang, James Bailey, Ting Dang
DeWorldSG通过深度引导过滤生成稳健的3D语义场景图,提升了77.4%的三元组召回率。
Seok-Young Kim, Abdelrahman Elskhawy, Taewook Ha 等
本论文提出世界模型与动作模型的统一框架,强调预测与决策的结合。
Xiaoxiong Zhang, Xiong Zeng, Wei Zhang
提出基于函数一致预测的距离场安全保障,利用低秩、时间不变的残差场实现高效、场级别的安全界限。
Jaeuk Shin, Yoonseok Ra, Insoon Yang
SoftMoR通过递归增强视觉Transformer,SR-ViT在ImageNet-1K上提升准确率至82.48%。
Sang In Lee, Jihun Park
提出ISPA,通过参数吸收将KV缓存压缩50%,保持几乎无损视觉质量。
Xiaomeng Fu, Jia Li, Yiming Hu 等
Style-conditioned UVFA结合Cat-RAC,让智能体可实时切换风格;HFW评估覆盖57,000场战斗。
Roberto Capobianco, Harm van Seijen, Nolan D. Bard 等
提出Caption Bottleneck Models(CaBM),通过自然语言描述实现无泄漏、可解释的图像识别,达成与传统方法相当的准确率。
Seref Baris Cagliyan, Umut Ozdemir, Merve Tapli 等