Decoupled Self-Forcing Distillation for Streaming Talking Head Generation
Motar方法通过低维运动空间融合条件,实现15.4 FPS的高保真流式说话人头生成。
Yanru An, Ruiyan Wang, Wenwu Wei 等
Motar方法通过低维运动空间融合条件,实现15.4 FPS的高保真流式说话人头生成。
Yanru An, Ruiyan Wang, Wenwu Wei 等
ScopeMamba-YOLO通过外部和内部扩展感知范围,在遥感图像中提升小目标检测精度,mAP50提升10.8个百分点。
Junjie Fan, Yijun Mai, Linduo Wei 等
SDT结合几何视觉、类别自适应融合与效价–唤醒先验,提升MELD/IEMOCAP的加权F1至75.93/74.11%。
Oriol Marín, Roger Marí, Gloria Haro 等
MotionBlind揭示Video-LLMs无法准确理解视频中的运动,Gemini3.1 Pro是唯一通过的模型。
Dhairya Bhatia, Bishoy Galoaa, Oliver Fritsche 等
VANTAGE-Bench评估视觉语言模型在基础设施AI中的差距,揭示模型在事件验证和时间定位任务上的不足。
Zaid Pervaiz Bhat, Nimra Nayyar, Arihant Jain 等
ActionSplice通过Counterfactual State Transport实现飞行中动作编辑,显著降低LPIPS误差,提升响应速度。
Pardis Taghavi, Tingyu Guo, Jonas Lossner 等
BrachistoneLR通过映射最速降线的垂直坐标优化学习率,在CIFAR-10上提升2.5个百分点。
Md. Sadekur Rahman Roni, Md. Jalal uddin Chowdhury, Moutusi Dash Nimi
FlexMoGen框架结合自然语言和风格参考生成高质量人类动作。
Kai Weixian Lan, Bodie Criswell, Briana Fedkiw 等
TRAIL利用条件随机场提升视觉位置识别性能,在稀缺视觉线索环境下提高8.3%。
Dominik A. Kloepfer, Patrick Wenzel
MyBuddy在BuddyVQA基准上通过多模态链式推理实现了显著性能提升。
Hangyu Qin, Junbin Xiao, Shenglang Zhang 等
GAN-Blot: 提供46K合成WB图像,提升蛋白质带结构和视觉风格控制。
Hao-Chiang Shao, Fong-Yi Lin, Te-An Chien 等
提出无训练的大规模场景网格生成框架,结合局部连续性和全局一致性,提升几何与外观质量。
SangEun Lee, Wonseok Chae, Hoyoung Yoo 等
提出MovieGrid,通过空间网格分解长视频,提升多镜头生成的连贯性与多样性。
Jiawei Mao, Haoqin Tu, Hardy Chen 等
尺度响应曲线显示:ImageNet-1K模型越准确,越能在更小图像尺度下保持性能(r=-0.890)。
Anish Monsley Kirupakaran
UniMate模型通过拓扑感知扩散变压器实现多骨架动画生成,优于现有方法。
Linzhan Mou, Jiahui Lei, Zhiyang Dou 等
CrossDepth通过几何约束注意力提高多视角深度估计的准确性和一致性。
Samer Abualhanud, Max Mehltretter
Ref-GeNVS方法无需训练,生成镜面场景的新视角,显著提升反射一致性。
GeonU Kim, Shin Dong-Yeon, Tae-Hyun Oh
提出H-BAC框架,结合量化和知识蒸馏,实现95.13%准确率和54.5倍模型压缩。
Mahadev Sunil Kumar, Bhavika Gondi, Desaisetty Venkata Satya Sai Swapnith 等
AdaGate-DF在低分辨率环境下实现高效深伪检测,Celeb-DF数据集AUC达0.9370。
Vaishnavi Sen, Cody Laurie, Rashida Hasan
Principia通过物理关系一致性评估视频模型的牛顿运动规律,涵盖8个物理现象。
Varun Varma Thozhiyoor, Shivam Tripathi, Venkatesh Babu Radhakrishnan 等