Visual Instruction Tuning
提出LLaVA:结合GPT-4生成多模态指令数据的端到端大模型,达成85.1%相对GPT-4性能,科学问答准确率突破92.53%。
Haotian Liu, Chunyuan Li, Qingyang Wu 等
提出LLaVA:结合GPT-4生成多模态指令数据的端到端大模型,达成85.1%相对GPT-4性能,科学问答准确率突破92.53%。
Haotian Liu, Chunyuan Li, Qingyang Wu 等
提出基于多视图Transformer的宽基线立体图像单帧新视角合成方法,显著提升稀疏观察下的重建质量。
Yilun Du, Cameron Smith, Ayush Tewari 等
VALOR模型通过MGA和MGC任务实现视觉、音频和语言的三模态学习。
Jing Liu, Sihan Chen, Xingjian He 等
API-Bank基准评估工具调用能力,涵盖73API,提升LLMs工具利用率。
Minghao Li, Yingxiu Zhao, Bowen Yu 等
本研究评估LLMs在任务导向对话中的表现,发现其在明确信念状态追踪方面表现不佳,但能引导对话成功,提升依赖真实信念状态和示例。
Vojtěch Hudeček, Ondřej Dušek
提出基于鲁棒UNet去噪器的零阶黑盒防御,提升高维数据性能,性能超越SOTA 35%。
Astha Verma, A V Subramanyam, Siddhesh Bangar 等
提出AGIEval基准,基于人类标准考试评估GPT-4等模型,GPT-4在SAT数学和中国高考英语中超越平均人类表现。
Wanjun Zhong, Ruixiang Cui, Yiduo Guo 等
InterGen利用扩散模型结合双人互动数据与文本指导,实现高质量多人体动作生成。
Han Liang, Wenqian Zhang, Wenxuan Li 等
评估ChatGPT在37种语言中的零样本学习表现,覆盖7项任务,发现其多语言能力仍有局限。
Viet Dac Lai, Nghia Trung Ngo, Amir Pouran Ben Veyseh 等
L3MVN利用大规模语言模型实现无监督视觉目标导航,显著提升成功率。
Bangguo Yu, Hamidreza Kasaei, Ming Cao
单门专家混合模型在效率和准确性上与复杂模型相当,且超越非混合基线。
Amelie Royer, Ilia Karmanov, Andrii Skliar 等
基于GPT-4的智能代理实现自主设计和执行复杂科学实验,成功完成催化交叉偶联反应。
Daniil A. Boiko, Robert MacKnight, Gabe Gomes
本综述系统总结深度图表示学习的架构、学习范式及应用,强调GNN创新与未来挑战。
Wei Ju, Zheng Fang, Yiyang Gu 等
StillFast为短期目标交互预测提出端到端架构,显著优于SOTA。
Francesco Ragusa, Giovanni Maria Farinella, Antonino Furnari
提出GeneRec,结合生成模型与用户指令,实现内容个性化生成,提升推荐多样性。
Wenjie Wang, Xinyu Lin, Fuli Feng 等
提出AMS-DRL算法,通过多阶段异步训练实现无人机在多追捕者环境中的安全避险。
Jiaping Xiao, Mir Feroskhan
基于大规模语言模型的生成代理架构,模拟可信人类行为,支持长时记忆与社会互动。
Joon Sung Park, Joseph C. O'Brien, Carrie J. Cai 等
基于动态平均场理论分析有限宽度神经网络的核和预测波动,揭示特征学习对方差的调控机制。
Blake Bordelon, Cengiz Pehlevan
结合Chinchilla缩放规则,训练从111M到13B参数的Cerebras-GPT,达成最优计算效率。
Nolan Dey, Gurpreet Gosal, Zhiming 等
提出基于GPT-3的零样本下一项推荐策略,利用三步提示显著提升推荐准确率。
Lei Wang, Ee-Peng Lim