Out of Sight, Out of Mind? Evaluating State Evolution in Video World Models
STEVO-Bench评估视频世界模型在观察中断时的状态演化能力,揭示其局限性。
Ziqi Ma, Mengzhan Liufu, Georgia Gkioxari
STEVO-Bench评估视频世界模型在观察中断时的状态演化能力,揭示其局限性。
Ziqi Ma, Mengzhan Liufu, Georgia Gkioxari
InterEdit通过语义感知计划令牌对齐和交互感知频率令牌对齐,实现多人人体3D动作编辑。
Yebin Yang, Di Wen, Lei Qi 等
coDrawAgents框架通过多智能体协作显著提升文本到图像生成的组合性和属性一致性,在GenEval上达94%的整体得分。
Chunhan Li, Qifeng Wu, Jia-Hui Pan 等
OARS框架通过COMPASS奖励实现实时图像超分辨率,提升视觉感知和保真度。
Shijie Zhao, Xuanyu Zhang, Bin Chen 等
VGGT-World通过预测冻结GFM特征的时序演变,显著提升深度预测性能,参数仅0.43B,速度提升3.6-5倍。
Xiangyu Sun, Shijie Wang, Fengyi Zhang 等
提出交替梯度流效用(AGF),在ImageNet-1K上实现75%压缩时避免结构崩溃。
Tianhao Qian, Zhuoxuan Li, Jinde Cao 等
VQQA利用多智能体问答机制,通过语义梯度优化视频生成,提升质量达+11.57%。
Yiwen Song, Tomas Pfister, Yale Song
EVATok通过自适应长度视频标记化实现高效视觉自回归生成,平均节省24.4%标记。
Tianwei Xiong, Jun Hao Liew, Zilong Huang 等
MM-CondChain通过VPIR实现视觉深层组合推理,最强模型仅达53.33 Path F1。
Haozhan Shen, Shilin Yan, Hongwei Xue 等
OmniStream通过因果时空注意力和3D旋转位置嵌入实现视觉流的感知、重建和动作,跨29个数据集表现优异。
Yibin Yan, Jilan Xu, Shangzhe Di 等
DreamVideo-Omni通过潜在身份强化学习实现多主体视频定制,提升身份保真度和运动控制精度。
Yujie Wei, Xinyu Liu, Shiwei Zhang 等
AutoGaze通过自回归选择多尺度视频片段,减少冗余,提升效率,支持1K帧4K视频处理。
Baifeng Shi, Stephanie Fu, Long Lian 等
EndoCoT通过激活MLLMs的推理潜力,实现了92.1%的准确率,比基线高8.3%。
Xuanlang Dai, Yujie Zhou, Long Xing 等
BiGain通过频率分离实现加速扩散模型的生成和分类双重优化,提升分类准确率7.15%,FID提高0.34。
Jiacheng Liu, Shengkun Tang, Jiacheng Cui 等
RDNet通过动态自适应模块提高光学遥感图像中的显著目标检测精度。
Bin Wan, Runmin Cong, Xiaofei Zhou 等
FlashMotion采用三阶段训练,结合扩散与对抗,实现少步轨迹控制视频生成,速度提升47倍。
Quanhao Li, Zhen Xing, Rui Wang 等
O3N框架通过极坐标螺旋拓扑实现360°空间表示,在QuadOcc和Human360Occ基准上达到最先进性能。
Mengfei Duan, Hao Shi, Fei Teng 等
HATS通过硬度感知的轨迹合成,提升GUI代理在语义模糊交互中的泛化能力。
Rui Shao, Ruize Gao, Bin Xie 等
提出UniCAC基准,评估24种算法在不同光学像差条件下的表现。
Xiaolong Qian, Qi Jiang, Yao Gao 等
Node-RF结合Neural ODE与NeRF,实现连续时空场景动态预测与泛化。
Hiran Sarkar, Liming Kuang, Yordanka Velikova 等