Attribute-Based Robotic Grasping with Data-Efficient Adaptation
使用属性学习和数据高效适应,机器人抓取成功率超81%
Yang Yang, Houjian Yu, Xibai Lou 等
使用属性学习和数据高效适应,机器人抓取成功率超81%
Yang Yang, Houjian Yu, Xibai Lou 等
AVTrustBench评估音视频LLM的可靠性,CAVPref提升30.19%。
Sanjoy Chowdhury, Sayan Nag, Subhrajyoti Dasgupta 等
提出BeliN语料库与MultiGen模型,结合类别、角度、情感特征提升孟加拉宗教新闻标题生成,BLEU达18.61。
Md Osama, Ashim Dey, Kawsar Ahmed 等
FlashInfer利用块稀疏格式和JIT优化,实现LLM注意力计算的高效定制化。
Zihao Ye, Lequn Chen, Ruihang Lai 等
引入多模态教科书数据集,提升视觉语言模型在知识推理任务中的表现。
Wenqi Zhang, Hang Zhang, Xin Li 等
VinT-6D数据集结合视觉、触觉和本体感受,提升机器人操作精度。
Zhaoliang Wan, Yonggen Ling, Senlin Yi 等
提出Sui Generis评分衡量LLM故事的剧情多样性,基于100个故事实验显示LLM生成内容缺乏创新性。
Weijia Xu, Nebojsa Jojic, Sudha Rao 等
本研究提出基于潜空间GAN的LS-GAN,用于高效人类动作合成,FID为0.482,计算量降低91%。
Avinash Amballa, Gayathri Akkinapalli, Vinitra Muralikrishnan
基于Bentkus和Pinelis技术,改进马尔可夫链的集中不等式,恢复缺失因子,接近最优。
Arun Kumar Kuchibhotla
综述视觉定位,分析新概念如基础预训练、多模态LLM等,提供全面研究方向。
Linhui Xiao, Xiaoshan Yang, Xiangyuan Lan 等
提出InfAlign框架,优化推理时模型胜率,提升3-8%。
Ananth Balashankar, Ziteng Sun, Jonathan Berant 等
OS-Genesis通过逆向任务合成,利用交互探索生成高质量GUI轨迹,显著提升训练效果。
Qiushi Sun, Kanzhi Cheng, Zichen Ding 等
BeSplat从单个模糊图像和事件流中恢复高质量的辐射场。
Gopi Raju Matta, Reddypalli Trisha, Kaushik Mitra
ETTA模型通过大规模实验优化文本到音频转换,提升了生成质量和速度。
Sang-gil Lee, Zhifeng Kong, Arushi Goel 等
TravelAgent利用生成代理模拟人类行为,分析1898步,任务完成率76%。
Ariel Noyman, Kai Hu, Kent Larson
DrivingGPT通过多模态自回归Transformer,将驾驶场景建模与路径规划统一为序列预测,显著优于基线。
Yuntao Chen, Yuqi Wang, Zhaoxiang Zhang
提出LongDocURL基准,结合理解、推理与定位,涵盖20个子任务,收集2,325对高质量问答,揭示模型性能差距。
Chao Deng, Jiale Yuan, Pi Bu 等
提出多模态链式推理协作的多机器人语义导航方法,显著提升探索效率。
Zhixuan Shen, Haonan Luo, Kexun Chen 等
VLABench基准评估语言条件机器人操作,涵盖100类长远推理任务,挑战VLAs的理解和泛化能力。
Shiduo Zhang, Zhe Xu, Peiju Liu 等
HSfM结合深度学习与SfM,能同时重建多个人体、场景点云与相机参数,精度显著提升。
Lea Müller, Hongsuk Choi, Anthony Zhang 等