Can Large Language Models Be an Alternative to Human Evaluations?
大语言模型(LLM)可替代人类评估,结果与人类专家一致。
Cheng-Han Chiang, Hung-yi Lee
大语言模型(LLM)可替代人类评估,结果与人类专家一致。
Cheng-Han Chiang, Hung-yi Lee
提出GeoLDM,结合几何自编码器和潜空间扩散模型,提升3D分子生成的有效性和控制性。
Minkai Xu, Alexander Powers, Ron Dror 等
采用FMCW毫米波雷达实现自主机器人运动估计与目标识别,性能优于传统传感器。
Kyle Harlow, Hyesu Jang, Timothy D. Barfoot 等
提出Prompt Diffusion,实现基于扩散模型的多任务视觉-语言上下文学习,训练覆盖六类任务。
Zhendong Wang, Yifan Jiang, Yadong Lu 等
提出CoMOT结合元最优传输预测公平随机重排序策略,显著提升速度与泛化能力。
Andrés Hoyos-Idrobo
mPLUG-Owl通过模块化学习提升大语言模型的多模态能力,显著提高指令理解和视觉理解能力。
Qinghao Ye, Haiyang Xu, Guohai Xu 等
引入DataComp基准,通过筛选和数据源创新,训练出在ImageNet零-shot准确率达79.2%的CLIP模型。
Samir Yitzhak Gadre, Gabriel Ilharco, Alex Fang 等
利用公民科学进行NLP标注,招募98志愿者完成1481条高质量注释。
Jan-Christoph Klie, Ji-Ung Lee, Kevin Stowe 等
提出Evol-Instruct方法,通过LLM自动生成多层次复杂指令,显著提升LLaMA模型性能。
Can Xu, Qingfeng Sun, Kai Zheng 等
提出TGNN框架,结合消息传递与图核,提升半监督图分类性能。
Wei Ju, Xiao Luo, Meng Qu 等
通过预测大型语言模型的记忆行为,减少敏感数据的记忆。
Stella Biderman, USVSN Sai Prashanth, Lintang Sutawika 等
利用自然逻辑中的中间特征,通过干预方法(Amnesic和Mnestic)分析大模型的因果关系,揭示高维表示中的潜在机制。
Julia Rozanova, Marco Valentino, Lucas Cordeiro 等
结合符号程序与神经网络的neurosymbolic模型,用于2D/3D形状及材质生成。
Daniel Ritchie, Paul Guerrero, R. Kenny Jones 等
提出评估生成式搜索引擎可验证性的方法,发现平均句子支持率仅51.5%。
Nelson F. Liu, Tianyi Zhang, Percy Liang
提出行为期望界限(BEB)框架,揭示大模型对抗性提示的固有限制。
Yotam Wolf, Noam Wies, Oshri Avnery 等
AMT通过双向像素相关性和多组流场实现高效的视频帧插值,提升了PSNR。
Zhen Li, Zuo-Liang Zhu, Ling-Hao Han 等
NeuralField-LDM结合层次扩散模型,成功生成复杂的真实世界3D场景,显著优于现有方法。
Seung Wook Kim, Bradley Brown, Kangxue Yin 等
提出行为检索方法,通过少量专家示范从离线大数据中筛选相关行为,提升机器人模仿学习效果。
Maximilian Du, Suraj Nair, Dorsa Sadigh 等
利用低秩张量分解和Radon变换估计联合概率分布,样本复杂度显著降低。
Pranava Singhal, Waqar Mirza, Ajit Rajwade 等
VRB利用人类视频学习视觉可供性,支持多种机器人任务和学习范式。
Shikhar Bahl, Russell Mendonca, Lili Chen 等