VISA: VLM-Guided Instance Semantic Auditing for 3D Occupancy World Models
VISA利用离线VLM审计提升3D语义占据模型mIoU,显著改进稀有类别表现。
Ruiqi Xian, Yuehan Xian, Jing Liang 等
VISA利用离线VLM审计提升3D语义占据模型mIoU,显著改进稀有类别表现。
Ruiqi Xian, Yuehan Xian, Jing Liang 等
提出LocFac-RL,使用离散扩散模型提升视觉-文本推理效率,减少26.9%计算量。
Yoonjeon Kim, Yuhta Takida, Chieh-Hsin Lai 等
VLADriveBench结合观察指标与干预协议,评估VLA模型中CoT与动作的因果关系。
Thach Nguyen, Danhua Guo, Tom Lampo 等
VLGA引入密集3D几何专家,通过LiDAR监督实现 dense pointmap 重建,显著提升自动驾驶安全性和精度。
Jin Yao, Dhruva Dixith Kurra, Tom Lampo 等
提出Turbo-Inference策略,通过迭代利用检测与分割的互补信息,显著提升COCO、Cityscapes等数据集的检测和分割性能。
Zhen Zhao, Gang Zhang, Xiaolin Hu 等
ExtremeWhenBench基准测试表明,长视频的自然语言时间定位是一个搜索问题,检索-定位混合方法性能提升6.7倍。
Sukmin Seo, Geewook Kim
AGRA通过对齐视频特征与语义表示,提升机器人操作模型的动作准确性,ID成功率80%。
Lu Qiu, Yizhuo Li, Yi Chen 等
提出ISAP-3D,通过显式身份槽对齐实现稳定的3D部件生成,显著提升结构一致性。
Junlin Hao, Haoshuai Fu, Xibin Song 等
本论文提出基于元数据感知的多提示推理框架,用于零样本监控视频事故理解,显著提升CVPR基准的综合评分。
Tarandeep Singh, Soumyanetra Pal, Soham Biswas 等
BACON方法在最激进预算下提高多模态KV缓存压缩7.5%,最高达30.9%。
Tianhao Chen, Yuheng Wu, Kelu Yao 等
SG-PVR模型通过时空场景图提升文本到视频生成的语义对齐。
Hyomin Kim, Junghye Kim, Joanie Hayoun Chung 等
UniReason-Med通过共享推理接口提升2D到3D医学VQA性能。
Mengzhuo Chen, Yan Shu, Chi Liu 等
提出Next Forcing多块预测框架,提升高帧率视频生成的训练速度和准确性,达成94.1% RoboTwin成功率。
Gangwei Xu, Qihang Zhang, Jiaming Zhou 等
提出AMNet实现低光视频增强的模态无关推理,支持缺失模态,性能优于现有方法。
Hangfeng Liang, Yutao Hu, Yanhan Hu 等
提出Data2Story多智能体框架,将数据转化为可验证的多模态新闻,强调证据追溯和互动性。
Kevin Qinghong Lin, Batu EI, Yuhong Shi 等
提出MOFA-VTON,通过用户草图实现细粒度虚拟试衣,超越传统布局限制。
Xiaoyu Han, Chenyang Wang, Jing Wang 等
Pose-ICL通过3D感知的上下文学习实现姿态可控的主体定制,显著提高姿态准确性和身份一致性。
Xuan Han, Yihao Zhao, Mingyu You
GUI-AC方法通过自适应优势和动态剪辑提升GUI代理的持续学习能力。
Can Lin, Tao Feng, Hangjie Yuan 等
iSAGE框架通过稀疏点监督实现遥感语义分割,恢复97.2%的密集监督性能。
Osmar Luiz Ferreira de Carvalho, Osmar Abilio de Carvalho Junior, Anesmar Olino de Albuquerque 等
POTATR为一款29M参数的轻量级图像到图结构模型,显著提升页面级表格提取的效率与准确率。
Brandon Smock, Libin Liang, Max Sokolov 等