Can 4D Foundation Models Remember?
PersistBench通过360°视频评估4D模型的视觉记忆,揭示其短期一致性问题。
Guangzhao He, Hadar Averbuch-Elor, Wei-Chiu Ma
PersistBench通过360°视频评估4D模型的视觉记忆,揭示其短期一致性问题。
Guangzhao He, Hadar Averbuch-Elor, Wei-Chiu Ma
SplashSplat方法通过多视角视频重建液体飞溅,提供更低训练成本和更高物理合理性。
Peiyu Liu, Dingxi Zhang, Federico Tombari 等
FAMOS模型通过稀疏点云集预测可动部件分割和关节参数,提升64.5%分割性能。
Kevin Qu, Tao Sun, Massimiliano Viola 等
Paint-Anything通过共享hex提示实现图像生成和编辑的任意颜色控制,ACBench-T2I提高85.3%。
Ji Xie, Dewei Zhou, Xinyu Huang 等
ERCPMP-Gx数据集结合内镜图像、组织病理学和基因组信息,用于结直肠息肉病的AI研究。
Zahra Ghaffari, Massih Bahar, Mojgan Forootan 等
FlowSGS通过分裂吉布斯采样和随机插值提高逆成像精度。
Tianao Li, Xinhui Qian, Emma Alexander
利用预测碎片化控制测试时自适应,显著减少有害接受面积。
Lili Wang, Jing Li, Xiaowen Sun 等
DocAttriBench通过MAPPET方法实现文档VQA中的答案定位,提供237k文档和296k问答对。
Luca De Grandis, Silvia Cappelletti, William Raccagni 等
VideoResearcher通过自动化工具设计提升长视频理解性能,准确率提升至74.5%。
Dingqiang Ye, Dongdi Zhao, Kaishen Wang 等
VideoXAgent实现长视频理解,使用50k上下文匹配复杂基准。
Sen Yang, Boqiang Duan, Jing Yang 等
使用卷积脉冲神经网络和时间增强技术进行行人过街意图分类,准确率达95.83%。
Henok Teklu, Mustafa Sakhai, Maciej Wielgosz 等
提出CFD框架,通过视觉需求路由优化长视频理解,减少视觉处理。
Weitong Cai, Hang Zhang, Yukai Huang 等
ReconPlusGen通过噪声反演和调制将重建先验注入多视图3D生成,显著提高重建精度。
Jiarui Liu, Heng Li, Weiyu Li 等
CamPilot利用多代理框架提升电影生成中的摄影控制和质量。
Yang Wu, Stefano Petrangeli, Ishita Dasgupta 等
提出Programmable World Model,通过状态演化与生成解耦,实现94%计数准确率和98%状态准确率。
Zheng-Hui Huang, Guixu Lin, Jiacheng Lin 等
Field Converter通过几何初始化和时间残差预测,将足球转播中的球员姿态估计误差从49cm降至10cm。
Simon Khan, Laurent Gajny, Jennyfer Lecompte 等
提出RBQE框架,通过主模型与独立训练的裁判模型的分割一致性评估息肉分割可靠性,ROC-AUC高达0.960。
Siddharth Gupta, Jitin Singla
PACE框架通过感知延迟优化对话服务,P95延迟从0.53秒降至0.29秒。
Lin Huang, Yujuan Tan, Weisheng Li 等
调查视频大语言模型(VideoLLMs)推理效率机制,分析帧采样、模态编码等方法对计算成本的减少。
Killian Steunou, Yannis Tevissen, Mounîm A. El Yacoubi
Motar方法通过低维运动空间融合条件,实现15.4 FPS的高保真流式说话人头生成。
Yanru An, Ruiyan Wang, Wenwu Wei 等