MVEB: Massive Video Embedding Benchmark
MVEB基准涵盖23任务,评估33模型,揭示多模态视频嵌入的多样性与局限。
Adnan El Assadi, Roman Solomatin, Isaac Chung 等
MVEB基准涵盖23任务,评估33模型,揭示多模态视频嵌入的多样性与局限。
Adnan El Assadi, Roman Solomatin, Isaac Chung 等
AC-GPT通过简单改造实现任意条件评估,保持左到右预测性能。
Yinhan Lu, Eric Elmoznino, Léo Gagnon 等
本研究发现VLM中的少数注意头(凝视头)通过追踪描述区域,提供可控的模型行为干预机制,利用漫画和自然图像验证其因果作用。
Rohit Gandikota, David Bau
提出OmniVideo-100K数据集,结合结构化脚本与证据链,提升音视频推理能力,模型性能提升达20.59%。
Xinyue Cai, Chaoyou Fu, Yi-Fan Zhang 等
提出RATS(寄存器注意力变换器),通过N个可学习寄存器实现无监督的部件结构发现,在五个分割任务中平均提升12个mIoU。
Timing Yang, Predrag Neskovic, Jansen Seheult 等
Instruct-Particulate利用大规模异构数据集和指令控制,结合神经网络实现3D关节结构的高效预测,显著提升泛化能力。
Ruining Li, Yuxin Yao, Matt Zhou 等
提出WorkflowView框架,利用大语言模型(LLMs)将低级行为序列抽象为高层次活动,在浏览器、MOOC和Word文档中实现高准确性(最高F1=0.90),实现跨域通用性。
Gaurav Verma, Scott Counts
本研究揭示自我验证机制在视觉-语言模型中的潜在风险,验证器质量与任务相关,可能导致模型退化。
Jianzhe Lin
提出一种衡量AI生成故事中文化本地化的模板识别方法,发现仅9-17%的词汇决定文化差异。
Shaily Bhatt, Supriti Vijay, Jeremiah Milbauer 等
提出MoE-RM-SRL框架,结合安全距离、奖励机与专家混合模型,实现高速公路自主驾驶的安全与高效。
Chufei Yan, Zhihao Cui, Yiyan Lv 等
VISTA方法通过多视图比较提升GUI定位准确性,显著提高Qwen3-VL模型性能。
Xinyu Qiu, Yunzhu Zhang, Heng Jia 等
StreamMemBench评估个人助理记忆在流式观察和交互中的未来导向能力,关键指标包括证据保持与复用。
Guanming Liu, Yuqi Ren, Hansu Gu 等
提出EM-NeSy,将NeSy学习转化为EM算法,实现符号推理的近似与精确结合。
Annegret Seibt, Luc De Raedt, Giuseppe Marra
提出弹性查询强化学习(EQRL),通过自我感知调度实现VLA模型的动态推理与执行,显著降低推理成本。
Ge Wang, Xinyu Tan, Xiang Li 等
Pano3D方法在ScanNet数据集上实现了3D全景分割的最先进性能。
Victor Barberteguy, Ahmet Iscen, Mathilde Caron 等
MeEvo结合自然演化与元认知演化,通过循环交替实现自动启发式设计,显著提升复杂问题的搜索效率和稳定性。
Zishang Qiu, Xinan Chen, Rong Qu 等
SkillMutator通过13种攻击类别提升LLM代理技能的安全性检测率至88.2%。
Youngduk Kim, Minkyoo Song, Seungwon Shin
WAM4D利用空间注册标记实现快速4D世界动作建模,提升空间一致性。
Ying Li, Xiaobao Wei, Jiajun Cao 等
AlignADV用DPO+行为指纹,训练步数最多省40.6%。
Yuewen Mei, Tong Nie, Jie Sun 等
RT-VLA通过多层次蒸馏,将SImLingo模型的驾驶与推理能力压缩成实时高效模型。
Xiangyu Huang, Zhenlin Hua, Han Zhou 等