Personalize Your Gaussian: Consistent 3D Scene Personalization from a Single Image
提出CP-GS框架,通过逐步扩展单视角参考图像,实现多视角一致的3D高斯点云个性化,显著优于现有方法。
Yuxuan Wang, Xuanyu Yi, Qingshan Xu 等
提出CP-GS框架,通过逐步扩展单视角参考图像,实现多视角一致的3D高斯点云个性化,显著优于现有方法。
Yuxuan Wang, Xuanyu Yi, Qingshan Xu 等
LLINBO结合LLM和GP在贝叶斯优化中提高可靠性,特别适用于3D打印。
Chih-Yu Chang, Milad Azvar, Chinedum Okwudire 等
Sparc3D结合稀疏变形Marching Cubes与稀疏卷积VAE,实现高分辨率3D模型重建。
Zhihao Li, Yufei Wang, Heliang Zheng 等
提出了一种自适应估计方法,用于控制马尔可夫链的转移密度估计。
Imon Banerjee, Vinayak Rao, Harsha Honnappa
UniVG-R1结合推理和强化学习,提升多模态视觉定位,性能提升9.1%。
Sule Bai, Mingxing Li, Yong Liu 等
提出ADASAP算法,利用近似随机核预处理实现大规模高斯过程推断,超越现有方法。
Pratik Rathore, Zachary Frangella, Sachin Garg 等
提出MeanFlow模型,基于平均速度实现单步生成,FID达3.43,显著优于现有方法。
Zhengyang Geng, Mingyang Deng, Xingjian Bai 等
提出Pensieve两阶段训练策略,无需标定参数,实现高质量新视角合成。
Ruoyu Wang, Yi Ma, Shenghua Gao
MM-PRM以MCTS生成70万级步骤监督,使多模态数学准确率最高提升12.06个百分点。
Lingxiao Du, Fanqing Meng, Zongkai Liu 等
提出SAKURA基准,评估大音频-语言模型的多跳推理能力,发现模型在音频信息整合方面存在显著不足。
Chih-Kai Yang, Neo Ho, Yen-Ting Piao 等
CoSeP利用类别可分性空间进行剪枝,通过聚类自动确定层级剪枝比例,提升模型效率。
David Levin, Gonen Singer
PI-VAD通过多模态增强RGB特征,在三大数据集上实现视频异常检测的最先进精度。
Snehashis Majhi, Giacomo D'Amicantonio, Antitza Dantcheva 等
Fractured Sampling方法在推理时节省大量token,提升Pass@k精度。
Baohao Liao, Hanze Dong, Yuhui Xu 等
Text2midi-InferAlign通过推理时对齐提升符号音乐生成,显著提高文本-音频一致性。
Abhinaba Roy, Geeta Puri, Dorien Herremans
BusterX利用MLLM进行视频伪造检测,采用200K高质量数据集和强化学习,显著提升检测准确率和解释能力。
Haiquan Wen, Yiwei He, Zhenglin Huang 等
提出基于自我演化强化学习的GUI视觉定位方法,利用7B参数模型在3K样本下达成47.3%准确率。
Xinbin Yuan, Jian Zhang, Kaixin Li 等
通过混合对抗性扩散预测实现自动驾驶的稳健规划,提升安全性。
Albert Zhao, Stefano Soatto
提出半监督模型对齐方法,基于条件流匹配,通过跨模态桥成本实现低监督下的分布映射。
Ali Gholamzadeh, Noor Sajid
LogicOCR通过自动生成多样化图像,评估LMM在文本丰富图像中的逻辑推理能力,达成73%的生成成功率。
Maoyuan Ye, Haibin He, Qihuang Zhong 等
提出Iterative Preference Learning(IPL)优化移动代理思考流程,显著提升GUI任务表现。
Kun Huang, Weikai Xu, Yuxuan Liu 等