MSP-Net: Manifold-Guided Spectral Prompt Network for Hyperspectral Object Tracking
MSP-Net通过流形引导的光谱提示网络,在HOT2020和HOT2023数据集上实现AUC>0.80和精度>0.96。
Juliu Li, Hanlin Qin, Shuowen Yang 等
MSP-Net通过流形引导的光谱提示网络,在HOT2020和HOT2023数据集上实现AUC>0.80和精度>0.96。
Juliu Li, Hanlin Qin, Shuowen Yang 等
RecoverFly为无人机视觉-语言导航引入基于故障感知的强化学习后训练框架,提升成功率3.12-8.37个百分点。
Boxiong Wang, Hui Kang, Geng Sun 等
提出视角自适应神经渲染框架,有效解决单图3D重建中的视角不一致问题。
U-Chae Jun, Jaeeun Ko, Jiwoo Kang
AeroReformer2采用双边网络结合边界保持与跨模态注意力,实现遥感图像语音引导像素级分割,达62.09% mIoU。
Rui Li, Chenxi Duan, Haoyang Yang
FiRe通过固定噪声层次实现高效、局部化的视觉反事实解释,提升速度和质量。
Yan Zeng, Changlu Guo, Oskar Kristoffersen 等
RenderMatte通过全参数微调和组相对对齐,实现精确的图像抠图,达成最优性能。
Zecheng Ren, Yafei Hu, Jianing Zhao 等
SUMI模型通过扩散增强模块提升点云细节恢复,CD指标提升16.1%。
Yanlong Li, Kanchana Thilakarathna
PhyS框架通过物理先验提高流媒体世界模型的物理一致性,提升了PhysicsIQ等基准的表现。
Liangliang Zhao, Junying Wang, Danni Yang 等
FlexSplat为无校准、多视角对象重建提出基于深度引导的3D高斯点云方法,省略点云对应。
Amir Sabbaghziarani, Hanting Ye, Maria Gorlatova 等
提出ICQ任务,结合视频与参考图像进行身份匹配,构建ISYV数据集与模型,显著提升长时序和跨域识别能力。
Shibo Gao, Chongxiao Wang, Chenglong Huang 等
UniJEPA结合图像和视频预测任务,采用单一端到端模型,训练无崩溃正则,达成任务无关的世界建模,提升效率与泛化能力。
An Lanji, Dawei Liu, Jin Li 等
GeoDistill-Refine采用多提示融合和签名距离场,提升空间目标无标注分割性能,IoU提升4.56%、Boundary F1提升13.80%。
Yonglong Zhang, Zongwu Xie, Yang Liu
CANIS通过图像-语义桥接生成辅助,实现类别无关的3D对象语义化标准化,提升分类和分割性能。
Kendong Liu, Yuxin Yao, Junhui Hou
DCMPC-Net以跨模态提示补偿提升多天气图像复原,但文中未提供具体数值。
Wanshu Fan, Yunzhe Zhang, Yue Shen 等
提出HSMLA结合多尺度线性注意与选择性softmax,提升高分辨率视觉变换器效率与精度。
Dong Liu, Yanxuan Yu, Renata Borovica-Gajic 等
提出Gated Hindsight Distillation(GHD),利用下一截图作为训练中的特权信息,显著提升移动GUI代理的任务成功率。
Weiwei Li, Junzhuo Liu, Tong Chu 等
Robust-WAM通过语义预见对齐提升WAM的视觉鲁棒性,提高了多种基线的成功率。
Haodong Yan, Junfeng Li, Junjie He 等
Vorch-Director以噪声匹配残差稳定长时音视频生成,但文中未报告具体数值。
Lisai Zhang, Yidi Wu, Qi Liu 等
提出了一种迭代混合离散-连续视点规划方法,提高无人机摄影测量的重建精度和完整性。
Alan Grech, Daniel Pisani, Andre Grima 等
Vorch-Streamer通过混合Teacher Forcing与Diffusion Forcing,结合长距离自我引导,实现27.12 FPS的实时长视频生成。
Menglin Han, Yang Ding, Yulei Lu 等