Unlocking the Capabilities of Large Vision-Language Models for Generalizable and Explainable Deepfake Detection
提出基于知识引导的深度伪造检测框架,显著提升泛化能力,关键指标AUC达99.53%。
Peipeng Yu, Jianwei Fei, Hui Gao 等
提出基于知识引导的深度伪造检测框架,显著提升泛化能力,关键指标AUC达99.53%。
Peipeng Yu, Jianwei Fei, Hui Gao 等
提出Cosmos-Reason1模型,结合层级本体和多模态大语言模型,实现物理常识与具身推理,显著提升物理AI能力。
NVIDIA, :, Alisson Azzolini 等
提出协作自我游戏(CSP)框架,通过多智能体合作提升工具使用与不确定性表达能力。
Jacob Eisenstein, Reza Aghajani, Adam Fisch 等
DualToken通过分离高低层视觉词汇,实现视觉理解与生成的统一,提升ImageNet零样本准确率至82.0%。
Wei Song, Yuran Wang, Zijia Song 等
提出Concat-ID,利用VAE和3D自注意力实现多场景身份保持视频生成。
Yong Zhong, Zhuoyi Yang, Jiayan Teng 等
提出多输出符合预测(M-R2CCP、M-R2C2R)实现2D/3D解剖标志点的可靠不确定性量化。
Jef Jonkers, Frank Coopman, Luc Duchateau 等
HDLCoRe通过Prompt工程和检索增强,无需微调,显著降低LLM在HDL生成中的幻觉问题。
Heng Ping, Shixuan Li, Peiyu Zhang 等
FlexVLN以LLM规划器和指令跟随器协同,实现跨REVERIE、SOON、CVDN-target的零微调泛化。
Siqi Zhang, Yanyuan Qiao, Qunbo Wang 等
INPROVF结合LLMs与形式方法,提升机器人高层控制器在假设违反时的自动修复效率。
Qian Meng, Jin Peng Zhou, Kilian Q. Weinberger 等
提出CAVE模型,结合3D神经对象体积实现鲁棒性与可解释性,提升OOD数据表现。
Nhi Pham, Artur Jesslen, Bernt Schiele 等
提出一种名为On-the-Fly GS的渐进框架,实现近实时3DGS优化,每张图像优化仅需数秒。
Yiwei Xu, Yifei Yu, Wentian Gan 等
引入E值扩展了无分布假设的符合预测,支持批量、数据依赖覆盖和模糊标签场景。
Etienne Gauthier, Francis Bach, Michael I. Jordan
提出基于主动强化学习的在线示范策略迁移方法,显著提升成功率和样本效率。
Muhan Hou, Koen Hindriks, A. E. Eiben 等
MagicID通过混合偏好优化实现身份一致且动态丰富的视频定制,超越现有方法。
Hengjia Li, Lifan Jiang, Xi Xiao 等
LLMSeR通过LLM生成伪先验项,提升序列推荐系统的性能。
Yuqi Sun, Qidong Liu, Haiping Zhu 等
Reflect-DiT通过推理反思机制在推理时间提升文本到图像生成性能,基于参数1.6B模型实现+0.19分提升。
Shufan Li, Konstantinos Kallidromitis, Akash Gokul 等
提出多模态讽刺分析框架,评估12个LVLM在2409个样本上的表现。
Junjie Chen, Xuyang Liu, Subin Huang 等
基于SceneScript的多任务模型实现3D场景布局的全局预测与局部修正,显著提升局部修正性能。
Christopher Xie, Armen Avetisyan, Henry Howard-Jenkins 等
引入神经碰撞分类器的可微机器人渲染,避免静态和自碰撞。
Quanyuan Ruan, Jiabao Lei, Wenhao Yuan 等
基于偏微分方程的动态分布遍历方法,提升海上漂流目标搜索效率。
Luka Lanča, Karlo Jakac, Sylvain Calinon 等