Length Generalization in Arithmetic Transformers
使用相对位置嵌入和训练集引导实现算术变压器的长度泛化,准确率高达99.9%。
Samy Jelassi, Stéphane d'Ascoli, Carles Domingo-Enrich 等
使用相对位置嵌入和训练集引导实现算术变压器的长度泛化,准确率高达99.9%。
Samy Jelassi, Stéphane d'Ascoli, Carles Domingo-Enrich 等
Shikra模型实现多模态大模型的指称对话能力,提升定位任务表现。
Keqin Chen, Zhao Zhang, Weili Zeng 等
FunQA通过多轮对话提升VLM对反直觉视频的理解,数据集包含312K问答对。
Binzhu Xie, Sicheng Zhang, Zitang Zhou 等
InterCode:通过执行反馈标准化和基准化交互式编码,提升代码生成能力。
John Yang, Akshara Prabhakar, Karthik Narasimhan 等
RVT采用多视角Transformer,结合虚拟视图实现高效3D物体操作,训练快、成功率高。
Ankit Goyal, Jie Xu, Yijie Guo 等
KOSMOS-2为多模态大语言模型,具备对象定位和文本地面能力,显著提升视觉-语言任务表现。
Zhiliang Peng, Wenhui Wang, Li Dong 等
通过LRV-Instruction数据集和GAVIE方法减少多模态模型幻觉问题。
Fuxiao Liu, Kevin Lin, Linjie Li 等
RoboCook通过GNN和自监督学习实现复杂长时软体操控,每种工具仅需20分钟数据。
Haochen Shi, Huazhe Xu, Samuel Clarke 等
提出人机共进化(Human-AI Coevolution)概念,分析推荐系统中的反馈机制及其社会影响。
Dino Pedreschi, Luca Pappalardo, Emanuele Ferragina 等
提出GKD(泛化知识蒸馏),通过自我生成样本和反馈优化,显著提升T5模型在摘要、翻译和推理任务中的性能。
Rishabh Agarwal, Nino Vieillard, Yongchao Zhou 等
OpenMask3D实现零样本开放词汇3D实例分割,在ScanNet200长尾类上表现显著提升。
Ayça Takmaz, Elisabetta Fedele, Robert W. Sumner 等
Waymo通过多样化方法评估自动驾驶系统的安全性,强调事件级推理的重要性。
Francesca M. Favaro, Trent Victor, Henning Hohnhold 等
提出MME基准,评估30个多模态大模型的感知与认知能力,涵盖14个子任务。
Chaoyou Fu, Peixian Chen, Yunhang Shen 等
ToolQA通过自动化流程评估LLMs在外部工具使用中的能力,涵盖8个领域,实验显示增强模型显著优于纯内在知识模型。
Yuchen Zhuang, Yue Yu, Kuan Wang 等
提出黑盒LLM置信度估计框架,结合提示、采样与聚合,提升校准与失败预测性能。
Miao Xiong, Zhiyuan Hu, Xinyang Lu 等
提出PSF感知变换器(PART)用于极简高质全景成像,提升图像质量。
Qi Jiang, Shaohua Gao, Yao Gao 等
本文证明随机一阶算法在$d$维凸优化中存储与查询的权衡,切割平面法在资源上最优。
Xi Chen, Binghui Peng
LMFlow是一个轻量级工具包,支持大模型的高效微调和推理。
Shizhe Diao, Rui Pan, Hanze Dong 等
提出OBELICS数据集,结合网页多模态文档,训练80亿参数模型IDEFICS,性能优越。
Hugo Laurençon, Lucile Saulnier, Léo Tronchon 等
提出基于DIKW模型的多模态融合框架,结合特征选择、深度学习等实现智能医疗数据整合。
Thanveer Shaik, Xiaohui Tao, Lin Li 等