VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding
提出VideoAgent,结合结构化记忆与多模态基础模型,提升长视频理解性能,平均在NExT-QA提升6.6%。
Yue Fan, Xiaojian Ma, Rujie Wu 等
提出VideoAgent,结合结构化记忆与多模态基础模型,提升长视频理解性能,平均在NExT-QA提升6.6%。
Yue Fan, Xiaojian Ma, Rujie Wu 等
ALDM-Grasping通过扩散模型实现机器人抓取的零样本Sim-to-Real转移,成功率达75%。
Yiwei Li, Zihao Wu, Huaqin Zhao 等
RebQ框架在缺失模态学习中提升平均精度从20.00到50.92,减少遗忘从75.95到8.56。
Shu Zhao, Xiaohan Zou, Tan Yu 等
DiffUIR采用选择性钟形映射策略,结合强条件引导和共享分布,显著提升多任务图像恢复性能,参数仅0.89M。
Dian Zheng, Xiao-Ming Wu, Shuzhou Yang 等
SEVLM模型通过VAD情感建模和对比学习提升视觉艺术情感理解能力,性能优于现有小模型。
Jing Zhang, Liang Zheng, Meng Wang 等
本研究对比数据增强与对比学习在序列推荐中的效果,发现某些数据增强策略可单独实现优异性能。
Peilin Zhou, You-Liang Huang, Yueqi Xie 等
提出伪点SPA算法,显著提高顶点搜索精度和速度。
Jiashun Jin, Zheng Tracy Ke, Gabriel Moryoussef 等
结合深度学习与核条件均值嵌入,提出高效可扩展的条件分布表示方法。
Eiki Shimizu, Kenji Fukumizu, Dino Sejdinovic
提出FedRoot与FedLGR,结合特征分离与生成回放,实现机器人社会行为的联邦持续学习,显著降低资源消耗。
Nikhil Churamani, Saksham Checker, Fethiye Irmak Dogan 等
VideoAgent利用大语言模型作为代理,通过多轮信息检索实现长视频理解,零样本准确率达54.1%。
Xiaohan Wang, Yuhui Zhang, Orr Zohar 等
提出SuperM2M,结合弱监督的混合训练提升语音增强的泛化能力,基于真实混合数据实现端到端优化。
Zhong-Qiu Wang
提出MultiGripperGrasp数据集,包含11类夹具345对象,30.4M抓取样本,支持跨夹具迁移。
Luis Felipe Casas, Ninad Khargonkar, Balakrishnan Prabhakaran 等
提出MM1,结合多模态预训练策略,利用图像编码器、视觉语言连接器和多样数据,达成SOTA性能。
Brandon McKinzie, Zhe Gan, Jean-Philippe Fauconnier 等
OpenGraph利用层级图结构结合视觉-语言模型实现大规模户外环境的开域3D语义理解。
Yinan Deng, Jiahui Wang, Jingyu Zhao 等
BEHAVIOR-1K:一个包含1000种日常活动的模拟基准,利用OMNIGIBSON实现逼真物理模拟。
Chengshu Li, Ruohan Zhang, Josiah Wong 等
CodeUltraFeedback通过LLM-as-a-Judge方法评估LLM与编码偏好的一致性,提升模型对编码偏好的对齐。
Martin Weyssow, Aton Kamanda, Xin Zhou 等
提出TRUMANS数据集与基于扩散的自回归模型,实现任意长度人-场景交互运动生成。
Nan Jiang, Zhiyuan Zhang, Hongjie Li 等
提出MoMa-LLM,通过动态场景图实现开放词汇的机器人互动搜索,显著提升效率。
Daniel Honerkamp, Martin Büchner, Fabien Despinoy 等
提出一种基于增量分解的信号时序逻辑(STL)规划方法,有效提升复杂任务的计算效率。
Parv Kapoor, Eunsuk Kang, Romulo Meira-Goes
提出TaskCLIP,结合大规模视觉-语言模型实现任务导向的目标检测,提升准确率3.5%,仅用一块RTX4090。
Hanning Chen, Wenjun Huang, Yang Ni 等