Towards Effective Waste Segmentation for Automated Waste Recycling in Cluttered Background
提出一种结合空间和频域的EWSegNet,用于复杂背景下的废弃物分割,显著提升效率和精度。
Mamoona Javaid, Mubashir Noman, Abdul Hannan 等
提出一种结合空间和频域的EWSegNet,用于复杂背景下的废弃物分割,显著提升效率和精度。
Mamoona Javaid, Mubashir Noman, Abdul Hannan 等
VLGA引入密集3D几何专家,通过LiDAR监督实现 dense pointmap 重建,显著提升自动驾驶安全性和精度。
Jin Yao, Dhruva Dixith Kurra, Tom Lampo 等
提出Turbo-Inference策略,通过迭代利用检测与分割的互补信息,显著提升COCO、Cityscapes等数据集的检测和分割性能。
Zhen Zhao, Gang Zhang, Xiaolin Hu 等
本论文提出基于元数据感知的多提示推理框架,用于零样本监控视频事故理解,显著提升CVPR基准的综合评分。
Tarandeep Singh, Soumyanetra Pal, Soham Biswas 等
提出Next Forcing多块预测框架,提升高帧率视频生成的训练速度和准确性,达成94.1% RoboTwin成功率。
Gangwei Xu, Qihang Zhang, Jiaming Zhou 等
提出AMNet实现低光视频增强的模态无关推理,支持缺失模态,性能优于现有方法。
Hangfeng Liang, Yutao Hu, Yanhan Hu 等
提出Data2Story多智能体框架,将数据转化为可验证的多模态新闻,强调证据追溯和互动性。
Kevin Qinghong Lin, Batu EI, Yuhong Shi 等
提出MOFA-VTON,通过用户草图实现细粒度虚拟试衣,超越传统布局限制。
Xiaoyu Han, Chenyang Wang, Jing Wang 等
POTATR为一款29M参数的轻量级图像到图结构模型,显著提升页面级表格提取的效率与准确率。
Brandon Smock, Libin Liang, Max Sokolov 等
TEVI利用稀疏自编码器,通过文本条件筛选图像特征,显著提升CLIP模型的视觉-语言对齐和检索性能。
Sweta Mahajan, Sukrut Rao, Jiahao Xie 等
本论文提出以“观看、记忆、推理”为核心能力的多模态大模型视频理解框架,显著提升长视频的理解能力。
Jiahao Meng, Yue Tan, Qi Xu 等
PAR3D提出基于部件感知的3D多模态大模型,利用ScenePart数据集显著提升细粒度场景理解能力。
Shaohui Dai, Yansong Qu, You Shen 等
提出复杂度平衡扩散切分(CBS),通过Dirichlet能量和轨迹加速度估算局部复杂度,有效提升生成质量约35%。
Noam Issachar, Dani Lischinski, Raanan Fattal
提出Astra框架结合RL训练的VLM策略与Bagel基础世界模拟器,实现基于想象的空间推理,提升MMSI-Bench从45.1到49.5。
Chenming Zhu, Jingli Lin, Yilin Long 等
提出基于实体感知的影像比对框架MedReCo,利用690,000+图像实现临床相似病例检索与变化生成。
Tengfei Zhang, Ziheng Zhao, Lisong Dai 等
HomeWorld提出基于大规模真实住宅平面图的层级式生成框架,实现可控、密集交互的全屋场景,利用LLM和图像模型生成高多样性布局。
Wenbo Li, Xiaoliang Ju, Zipeng Qin 等
提出基于视觉常识的知识优化框架,提升场景图生成的准确性,三大基准上实现显著性能提升。
Maëlic Neau, Salim Baloch, Jakob Suchan 等
GMBFormer结合NDVI引导的全球记忆库与Transformer,有效提升城市绿地提取精度,平均mIoU达89.25%。
Hao Lei, Xi Cheng, Chenlu Shu 等
提出PhaseLock,无需训练,通过两步推理提取运动先验,提升视频物理一致性平均6.2分。
Woojung Han, Seil Kang, Youngjun Jun 等
提出SEIG框架,利用预训练视觉-语言模型(VLM)实现单图反向图形,逐步细化几何、材质、布局和光照,生成可编辑的Blender程序。
Guangzhao He, Rundong Luo, Wei-Chiu Ma 等