V-Nutri: Dish-Level Nutrition Estimation from Egocentric Cooking Videos
V-Nutri融合成品帧与烹饪关键帧,探索视频线索提升营养估计。
Chengkun Yue, Chuanzhi Xu, Jiangpeng He
V-Nutri融合成品帧与烹饪关键帧,探索视频线索提升营养估计。
Chengkun Yue, Chuanzhi Xu, Jiangpeng He
提出PLOVIS,通过Open-Vocabulary图像分割生成伪标签,有效缓解3D点云语义分割的数据不足。
Takahiko Furuya
提出能量导向扩散桥(E-Bridge),通过短轨迹优化提升图像修复效率和质量。
Jinhui Hou, Zhiyu Zhu, Junhui Hou
DeepShapeMatchingKit通过矢量化重构实现33倍加速,解决3D形状匹配瓶颈。
Yizheng Xie, Lennart Bastian, Congyue Deng 等
SMFormer结合基础模型和数据增强,实现自监督立体匹配的突破。
Yun Wang, Zhengjie Yang, Jiahao Zheng 等
提出GREATEN框架,结合表面法线增强鲁棒性,实现跨域零样本立体匹配,误差降低30%。
Jiahao Li, Xinhong Chen, Zhengmin Jiang 等
VLA-World结合预测与反思,提升自动驾驶场景中的未来推理与安全性。
Guoqing Wang, Pin Tang, Xiangxuan Ren 等
OV-Stitcher利用全局注意机制,无需训练,实现高效开源语义分割,mIoU提升至50.7。
Seungjae Moon, Seunghyun Oh, Youngmin Ro
提出无需logits优化的直接分割方法,基于分布差异分析实现零训练开集语义分割。
Jiahao Li, Yang Lu, Yachao Zhang 等
提出PAMELA数据集与个性化奖励模型,提升文本到图像生成的个人偏好预测。
Anne-Sofie Maerten, Juliane Verwiebe, Shyamgopal Karthik 等
PhyEdit利用显式几何模拟实现3D感知图像编辑,显著提升空间控制精度。
Ruihang Xu, Dewei Zhou, Xiaolong Shen 等
ModuSeg通过解耦目标发现与语义检索,实现无需训练的弱监督分割,性能优越。
Qingze He, Fagui Liu, Dengke Zhang 等
提出DOC-GS框架,通过深度引导Dropout与暗通道先验提升稀疏视角3D高斯点云重建可靠性。
Hantang Li, Qiang Zhu, Xiandong Meng 等
本文系统回顾视频生成技术,从GAN到扩散模型,再到自回归和多模态方法,分析其核心原理与创新。
Teng Hu, Jiangning Zhang, Hongrui Huang 等
SymphoMotion通过联合控制相机轨迹与物体动态,实现高一致性视频生成。
Guiyu Zhang, Yabo Chen, Xunzhi Xiang 等
VERTIGO通过视觉偏好优化,减少角色离屏率至0%,提升镜头质量。
Mengtian Li, Yuwei Lu, Feifei Li 等
RebusBench评估LVLMs的认知视觉推理,性能低于10%精确匹配。
Seyed Amir Kasaei, Arash Marioriyad, Mahbod Khaleti 等
提出SteerFlow,通过固定点求解与轨迹插值实现高保真逆向图像编辑,提升源图保持性。
Thinh Dao, Zhen Wang, Kien T. Pham 等
ReFlow通过自我校正机制实现单目动态场景的高质量4D重建,避免外部运动引导。
Yanzhe Liang, Ruijie Zhu, Hanzhi Chang 等
提出基于粒状球计算的方形超像素生成方法,支持端到端深度学习优化。
Shuyin Xia, Meng Yang, Dawei Dai 等