Dataset Biases and Shortcut Learning in Motion-Based AI-Generated Video Detection
本研究评估四种基于运动的AI视频检测器,揭示偏差和短路学习,发现频率方法更具泛化性。
Joren Michels, Lode Jorissen, Nick Michiels
本研究评估四种基于运动的AI视频检测器,揭示偏差和短路学习,发现频率方法更具泛化性。
Joren Michels, Lode Jorissen, Nick Michiels
DeWorldSG通过深度引导过滤生成稳健的3D语义场景图,提升了77.4%的三元组召回率。
Seok-Young Kim, Abdelrahman Elskhawy, Taewook Ha 等
SoftMoR通过递归增强视觉Transformer,SR-ViT在ImageNet-1K上提升准确率至82.48%。
Sang In Lee, Jihun Park
提出ISPA,通过参数吸收将KV缓存压缩50%,保持几乎无损视觉质量。
Xiaomeng Fu, Jia Li, Yiming Hu 等
提出Caption Bottleneck Models(CaBM),通过自然语言描述实现无泄漏、可解释的图像识别,达成与传统方法相当的准确率。
Seref Baris Cagliyan, Umut Ozdemir, Merve Tapli 等
HOMER利用层级记忆结构和主动推理,有效理解长视频,提升性能达+10.8分。
Yixin Ji, Fanghua Ye, Juntao Li 等
AMVL框架通过双向校准目标解决训练推理不匹配,提升BLINK基准测试平均分+10.83。
Shijie Li, Yilin Gao, Siyuan Yang 等
DriveVer是一种轻量级轨迹验证器,在NAVSIM基准上提升规划模型性能。
Chong He, Yuechen Luo, Fang Li 等
提出基于Vitality的图像到3D形状Diffusion Transformer压缩方法,模型尺寸缩减66%,保持几何保真。
Jaeah Lee, Hyunjin Kim, Jaewoong Cho 等
提出MEPA:基于多尺度表示对齐的混合专家模型,显著提升图像生成效率与质量。
Nuoyan Zhou, Zhijun Tu, Lei Yu 等
CORGI利用CDOG、CA-3DGS和DCGR实现单图高精度3D犬模型重建,无需3D标注。
Yuxiao Wu, Weile Li, Boyi Zhu 等
PointSplat通过人本预测,直接从点集推断高效高质量的高斯原语,实现3D人体实时重建。
Yujie Guo, Yudong Jin, Lingteng Qiu 等
ERA提出基于熵引导的视觉Token剪枝,通过偏置校正解决注意力崩塌问题,显著提升多模态大模型推理效率。
Yuhao Wang, Mu Qiao, Haiwen Diao 等
InstanceControl方法无需实例标注,实现复杂图像生成,提升精度和控制力。
Xiaoyu Liu, Huan Wang, Fan Li 等
MemLearner通过学习查询机制增强视频世界模型的记忆能力,有效应对遮挡和动态场景。
Jiwen Yu, Jianxiong Gao, Jianhong Bai 等
提出WorldRoamBench,基于逐帧动作、视觉漂移、物理交互和记忆的长时程稳定性评估,涵盖600+场景。
Ting-Bing Xu, Jiacheng Sui, Zhe Gao 等
提出局部一致性预测(LCP)结合视觉-语言模型,利用非线性变换提升图像分类中的预测集效率。
Clément Fuchs, Tim Bary, Benoît Macq
MV-GEL利用多视角排序和VLM推理实现网格几何实体的自然语言定位,IoU最高达1.7倍。
Kartik Bali, Roland Aydin
SimpleSearch-VL通过FAR优化采样效率,结合证据验证提升可靠性,保持轻量工具接口,显著提升多模态搜索性能。
Ming Dai, Zhihong Lu, Jinjie Gu 等
通过失败学习:利用失败轨迹在推理时自我改进,成功率提升6.6个百分点。
Xueqiao Sun, Xiaohan Wang, Ludwig Schmidt 等