LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding
LongVideo-R1通过层级推理与目标导向导航,实现低成本长视频理解,提升效率与准确率。
Jihao Qiu, Lingxi Xie, Xinyue Huo 等
LongVideo-R1通过层级推理与目标导向导航,实现低成本长视频理解,提升效率与准确率。
Jihao Qiu, Lingxi Xie, Xinyue Huo 等
SibylSense通过记忆调优和对抗探测生成自适应评分标准,提升RL性能。
Yifei Xu, Guilherme Potje, Shivam Shandilya 等
提出基于平滑密度的波let方法进行条件最优传输的统计推断,证明渐近正态性。
Sirui Lin, Zijun Gao, Jose Blanchet 等
RB-VLA模型在长时任务中表现优异,成功率提高52.5%。
Vaidehi Bagaria, Bijo Sebastian, Nirav Kumar Patel
提出三层结构的编码上下文基础设施,支持大规模多智能体软件开发。
Aristidis Vasilopoulos
提出SimLBR,通过Latent Blending Regularization实现对真实图像的紧决策边界,显著提升跨生成器泛化能力。
Aayush Dhakal, Subash Khanal, Srikumar Sastry 等
提出平滑可微的接触流形生成框架,结合分析距离场与边缘边缘碰撞,显著提升速度与可微性。
Onur Beker, Andreas René Geist, Anselm Paulus 等
MeanFuser采用高斯混合噪声和MeanFlow实现端到端多模态轨迹生成,提升效率与鲁棒性。
Junli Wang, Yinan Zheng, Xueyi Liu 等
SongEcho利用实例自适应线性调制生成翻唱歌曲,参数减少70%。
Sifei Li, Yang Li, Zizhou Wang 等
提出VCDF框架,通过稳定性验证提升时间序列因果发现的鲁棒性,提升VAR-LiNGAM约0.1分。
Gene Yu, Ce Guo, Wayne Luk
通过区间反事实解释提高AI理解和信任,实验显示模型理解提升显著。
Tabea E. Röber, Paul Festor, Rob Goedhart 等
JavisDiT++通过MS-MoE和TA-RoPE实现高质量音视频生成,超越现有方法。
Kai Liu, Yanhao Zheng, Kai Wang 等
提出一种基于 primal-dual 算法的受约束扩散模型,有效模拟无机固体点缺陷结构,性能优于现有方法。
Jingyi Cui, Jacob K. Christopher, Ankita Biswas 等
SymPL框架通过符号化布局显著提升视觉语言模型的空间推理能力,尤其在allocentric视角下。
Jaeyun Jang, Seunghui Shin, Taeho Park 等
UniMatch通过粗到细的语言引导实现跨类别3D形状匹配,显著提升匹配精度。
Qinfeng Xiao, Guofeng Mei, Bo Yang 等
提出了一种基于表格的量词消除方法,提升SAT和ASP求解器性能。
Pierre Carbonnelle
Yor-Sarc是首个用于约鲁巴语讽刺检测的金标准数据集,包含436条标注实例,Fleiss' κ达0.766。
Toheeb Aduramomi Jimoh, Tabea De Wille, Nikola S. Nikolov
SafeDrive结合稀疏世界模型与细粒度安全推理,实现端到端驾驶的高安全性,PDMS达91.6%。
Jungho Kim, Jiyong Oh, Seunghoon Yu 等
通过随机策略评估任务复杂性,发现PIC和POIC指标存在矛盾。
Reabetswe M. Nkhumise, Mohamed S. Talamali, Aditya Gilra
L2G-Net通过Cauchy分解实现图谱的局部到全局谱变换,避免全特征分解,提升长距离依赖建模能力。
Samuel Fernández-Menduiña, Eduardo Pavez, Antonio Ortega