ImageNet3D: Towards General-Purpose Object-Level 3D Understanding
提出ImageNet3D数据集,结合200类物体的2D边界框、3D姿态与位置标注,推动通用对象级3D理解研究。
Wufei Ma, Guanning Zeng, Guofeng Zhang 等
提出ImageNet3D数据集,结合200类物体的2D边界框、3D姿态与位置标注,推动通用对象级3D理解研究。
Wufei Ma, Guanning Zeng, Guofeng Zhang 等
HOT3D数据集提供3D手和物体跟踪的多视角图像和注释,助力研究。
Prithviraj Banerjee, Sindi Shkodrani, Pierre Moulon 等
通过分析60,000个微调扩散模型的权重空间,提出weights2weights子空间,实现模型采样、编辑与反演。
Amil Dravid, Yossi Gandelsman, Kuan-Chieh Wang 等
Depth Anything V2通过合成图像、增强模型容量和大规模伪标签实现更精细鲁棒的单目深度估计。
Lihe Yang, Bingyi Kang, Zilong Huang 等
引入视觉草图板,结合多模态模型的线条、框等绘图工具,显著提升数学和视觉推理性能。
Yushi Hu, Weijia Shi, Xingyu Fu 等
Yo’LLaVA通过引入个性化潜在令牌,实现少样本学习,显著提升个性化视觉与语言理解能力。
Thao Nguyen, Haotian Liu, Yuheng Li 等
OmniTokenizer为图像视频联合编码器,采用空间-时间解耦架构,达成图像视频重建SOTA性能。
Junke Wang, Yi Jiang, Zehuan Yuan 等
提出LVNet框架,结合层级关键帧选择器(HKS)实现长视频问答,处理仅需12帧达最高准确率。
Jongwoo Park, Kanchana Ranasinghe, Kumara Kahatapitiya 等
提出动态oracle优化自回归训练,提升NER和摘要任务性能,基于精确和近似动态oracle算法。
Jianing Yang, Harshine Visvanathan, Yilin Wang 等
提出MLKV,通过跨层共享KV头,显著降低Transformer解码内存,KV缓存缩减至6倍,性能影响微小。
Zayd Muhammad Kawakibi Zuhri, Muhammad Farid Adilazuarda, Ayu Purwarianti 等
提出Softmax-DPO(S-DPO)优化推荐,利用多负样本强化排名信息,提升推荐性能。
Yuxin Chen, Junfei Tan, An Zhang 等
提出自适应槽注意力(AdaSlot),动态调整对象槽数,提升对象发现性能。
Ke Fan, Zechen Bai, Tianjun Xiao 等
提出以人类角色为核心的数字系统工程,涵盖主动、反应和被动交互,强调信任与法规合规。
Martina De Sanctis, Paola Inverardi, Patrizio Pelliccione
提出EgoExo-Fitness数据集,结合第一人称和第三人称视角,支持全身动作理解与解释。
Yuan-Ming Li, Wei-Jin Huang, An-Lan Wang 等
OmniH2O利用目标姿态模仿和多模态接口实现全身人形机器人远程操控与自主学习。
Tairan He, Zhengyi Luo, Xialin He 等
提出中心敏感核优化(CsKO)实现边缘设备低成本增量学习,提升38.08%准确率。
Dingwen Zhang, Yan Li, De Cheng 等
本文系统评估了多款高评级大语言模型(LLMs)在机器人中的偏见与安全风险,发现其在歧视和非法行为方面存在严重缺陷。
Andrew Hundt, Rumaisa Azeem, Masoumeh Mansouri 等
RVT-2通过多阶段虚拟视图和系统优化,实现在少量示范下的高精度多任务3D操控,训练速度提升6倍,成功率达82%。
Ankit Goyal, Valts Blukis, Jie Xu 等
Real2Code通过图像分割和LLM代码生成,能重建含多达10个关节的复杂关节物体。
Zhao Mandi, Yijia Weng, Dominik Bauer 等
GUIOdyssey数据集和OdysseyAgent模型提升跨应用导航性能。
Quanfeng Lu, Wenqi Shao, Zitao Liu 等