Repurposing 3D Generative Model for Autoregressive Layout Generation
LaviGen框架利用3D生成模型实现自回归布局生成,在LayoutVLM基准上物理合理性提高19%。
Haoran Feng, Yifan Niu, Zehuan Huang 等
LaviGen框架利用3D生成模型实现自回归布局生成,在LayoutVLM基准上物理合理性提高19%。
Haoran Feng, Yifan Niu, Zehuan Huang 等
CrossMath基准揭示视觉-语言模型在视觉推理中的局限,文本推理表现优于视觉。
Yige Xu, Yongjie Wang, Zizhuo Wu 等
本研究系统评估了多种视觉语言模型在国家级图像地理定位中的表现,揭示了其在捕捉细粒度地理线索方面的局限性。
Siddhant Bharadwaj, Ashish Vashist, Fahimul Aleem 等
CollideNet通过分解时序模式实现多尺度视频表示学习,显著提升碰撞时间预测精度。
Nishq Poorav Desai, Ali Etemad, Michael Greenspan
提出了一种基于YOLOv8n和RexNet-150的两阶段深度学习框架,实现了95%的作弊检测准确率。
Van-Truong Le, Le-Khanh Nguyen, Trong-Doanh Nguyen
SENSE利用立体视觉和视觉语言模型提升开放词汇语义分割,在PhraseStereo上提高2.9%精度。
Thomas Campagnolo, Ezio Malis, Philippe Martinet 等
提出OVRSISBenchV2基准和Pi-Seg,扩展至95K图像,增强遥感开放词汇分割性能。
Bingyu Li, Tao Huo, Haocheng Dong 等
AdaDINO通过任务自适应架构搜索提升边缘设备视觉模型效率,准确率提升7.9%,FLOPs降低74.9%。
Yiwei Zhao, Yi Zheng, Huapeng Su 等
提出基于一维有序Token的图像生成搜索方法,提升测试时推理效率。
Zhitong Gao, Parham Rezaei, Ali Cy 等
Bi-CMPStereo框架在事件-帧非对称立体匹配中显著提高了准确性和泛化性。
Ninghui Xu, Fabio Tosi, Lihui Wang 等
MM-WebAgent通过分层规划和自反思生成一致的多模态网页,提升了布局和风格一致性。
Yan Li, Zezi Zeng, Yifan Yang 等
RAD-2通过生成器-判别器框架将强化学习扩展到自动驾驶中,降低56%碰撞率。
Hao Gao, Shaoyu Chen, Yifan Zhu 等
提出多阶段上下文丰富策略,改善视觉语言模型在人类情感识别中的表现。
Madhav Agarwal, Sotirios A. Tsaftaris, Laura Sevilla-Lara 等
SegWithU利用扰动能量进行单次前向传递的不确定性建模,实现医学图像分割的风险感知。
Tianhao Fu, Austin Wang, Charles Chen 等
提出多视角先验的可控视频插入框架,提升对象身份一致性与融合效果。
Qi Xia, Peishan Cong, Yichen Yao 等
提出基于几何上下文Transformer的流式3D重建模型LingBot-Map,实时性能达20FPS。
Lin-Zhuo Chen, Jian Gao, Yihang Chen 等
提出ACPO方法,显著减少音频视觉语言模型中的音频幻觉。
Ami Baid, Zihui Xue, Kristen Grauman
UI-Zoomer通过不确定性驱动的自适应放大提升GUI定位,提升精度达13.4%。
Fei Tang, Bofan Chen, Zhengxi Lu 等
提出BVE框架,通过3D遮罩和自构数据实现高质量3D编辑,显著提升编辑效果。
Yizhao Xu, Hongyuan Zhu, Caiyun Liu 等
提出CAMFusion多视角变换器,有效融合多视点vision-language描述,提升3D语义分类性能。
Tomas Berriel Martins, Martin R. Oswald, Javier Civera