GAN-Diff : Coupling Pretrained WGAN-GP Features with Conditional Diffusion U-Nets
GAN-Diff结合预训练WGAN-GP特征与条件扩散U-Net,实现图像去噪和超分辨率提升,PSNR分别提高4.40dB和3.70dB。
Saif Ahmed, Asadullah Hil Galib, S. M. Riaz Rahman Antu 等
GAN-Diff结合预训练WGAN-GP特征与条件扩散U-Net,实现图像去噪和超分辨率提升,PSNR分别提高4.40dB和3.70dB。
Saif Ahmed, Asadullah Hil Galib, S. M. Riaz Rahman Antu 等
提出K-DCT模型加速DDPM采样,捕获自然图像非对角相关,提升生成质量。
Rui Xia, Ayan Das, Artem Artemev 等
GuardPaint通过推测解码框架在扩散过程中修复不安全内容,显著降低攻击成功率并保持图像质量。
Shreyash Dhoot, Paras Dhiman, Arsh Abbas Naqvi 等
DefaultShift方法量化加速文本到图像模型的语义默认偏移,减少10.3%-35.1%的人为偏移。
Xuanhua Yin, Chuanzhi Xu, Shunqi Mao 等
提出OmniAssistBench,基于逆向工程构建多轮交互视频数据集,评估Omni-LLMs的多模态交互能力。
Xianyun Sun, Chaoyou Fu, Zhengye Zhang 等
Re3Cap利用多模态检索引导RL优化图像描述,提升8.64%的关系推理性能。
Haonan Jia, Shichao Dong, Zenghui Sun 等
本研究系统分析MedSAM微调策略对OOD泛化的影响,发现编码器LoRA增强鲁棒性,代表漂移与解码器层变化相关。
Marko Haralović, Sounic Akkaraju, Carlo Baretta 等
提出难度校准的条件流匹配(DC-FM),基于模型测量的学习难度调整插值路径,提升样本质量。
Airin Akter Tania, Md Raihan Khan
WildFin利用深度学习模型进行海底鱼类行为识别,基于2百万帧标注数据,揭示模型在复杂环境中的性能差距。
Abigail G. Grassick, Jerome Tze-Hou Hsu, Ethan Lin 等
提出基于少量目标样本微调的跨作物杂草检测迁移策略,优于无监督域适应,提升检测性能。
Nikhilesh Prabhakar, Pranuthi Tenali, Wilfredo Abudeye Fernandez 等
提出一种新的扩散变压器架构,使用静态文本锚点实现高效的多参考图像编辑,速度提升3.92倍。
Yangshuai Liu, Zheming Li, Jiaao Li 等
AESR框架通过全局提示增强与局部语义修复,有效实现身份保持的视频生成。
Jiayi Gao, Changcheng Hua, Jiaqi Tang 等
ArtiMo利用大模型实现零样本文字引导的关节网格动画,结合URDF约束与因果推理。
Chunyu Zou, Peng Dai, Yi-Hua Huang 等
提出TopoSurfel,通过可微等值面提取和网格引导,融合高精度高效的高斯Surfels与连续网格,改善表面重建。
Chuanjin Fan, Wenjie Chang, Bohao Liao 等
4DAnyone利用单目视频,通过RCP和TCR实现高质量4D人体重建。
Yudong Jin, Tao Xie, Qihang Zhang 等
Inter-X++基于混合运动捕捉,提供11,388高保真人际交互序列,构建统一评测平台。
Liang Xu, Chengqun Yang, Zili Lin 等
DreamHand利用预训练视频扩散模型作为几何编码器,实现鲁棒的双手3D轨迹重建,显著优于现有方法。
Yufei Liu, Xixi Wang, Hao Li 等
CalcSeg利用置信感知的半监督课程学习,结合3D潜在上下文实现单堆叠LGE-CMR心肌瘢痕自动分割。
Nivetha Jayakumar, Hannah Kim, Amit R. Patel 等
提出联合视觉-轨迹模型,预测手术场景与器械轨迹,提升长远预测性能。
Weiliang Huang, Huanrong Liu, Bob Zhang 等
FigmaTrace通过设计阶段转换方法提升VLM在设计任务中的表现。
Darshan Deshpande, Yoshinari Fujinuma, Martyna Markiewicz 等