RnG-KBQA: Generation Augmented Iterative Ranking for Knowledge Base Question Answering
RnG-KBQA结合排序与生成,显著提升知识库问答的零-shot和泛化能力。
Xi Ye, Semih Yavuz, Kazuma Hashimoto 等
RnG-KBQA结合排序与生成,显著提升知识库问答的零-shot和泛化能力。
Xi Ye, Semih Yavuz, Kazuma Hashimoto 等
ActionCLIP通过视频文本匹配实现零-shot动作识别,Kinetics-400达83.8%准确率。
Mengmeng Wang, Jiazheng Xing, Yong Liu
ThriftyDAgger通过预算感知的新颖性和风险门控提高模仿学习效率,提升了58%的性能。
Ryan Hoque, Ashwin Balakrishna, Ellen Novoseller 等
HM3D是包含1000个大型真实室内场景的高保真3D数据集,显著优于现有数据集,提升AI导航性能。
Santhosh K. Ramakrishnan, Aaron Gokaslan, Erik Wijmans 等
DAQA结合符号和深度学习方法,实现可解释性和通用性。
Kwabena Nuamah
提出ObjectFolder,结合隐式神经表示实现视觉、听觉、触觉多模态对象建模,支持多任务识别与控制。
Ruohan Gao, Yen-Yu Chang, Shivani Mall 等
基于RAFT架构的多层递归场变换,提升立体匹配精度与实时性能。
Lahav Lipson, Zachary Teed, Jia Deng
本研究提出“主题-风格”提示结构的设计指南,分析5493次生成,优化文本提示以提升图像质量。
Vivian Liu, Lydia B. Chilton
研究表明,语言模型在无接地情况下能编码颜色感知结构,使用CIELAB色彩空间进行验证。
Mostafa Abdou, Artur Kulmizev, Daniel Hershcovich 等
本研究通过追踪神经语言模型(NLM)在不同训练阶段的表现,发现其学习语言现象具有一致的“发展”轨迹,揭示潜在的归纳偏差。
Leshem Choshen, Guy Hacohen, Daphna Weinshall 等
本研究分析Transformer在神经机器翻译中的注意力权重,发现其对词对齐存在偏差,但能解释模型预测。
Javier Ferrando, Marta R. Costa-jussà
提出多主题知识增强的艺术描述生成框架,结合ResNet、BERT和Wikipedia实现多角度详细描述。
Zechen Bai, Yuta Nakashima, Noa Garcia
提出vSLIP模型实现双向动态规划,支持大尺度双足机器人在高度受限环境中自主导航。
Zhongyu Li, Jun Zeng, Shuxiao Chen 等
提出无参数GOMEA及其改进CGOMEA,利用条件依赖提升链接信息提取,显著优于DSMGA-II。
Arkadiy Dushatskiy, Marco Virgolin, Anton Bouter 等
提出点调整(PA)评估协议过度高估TAD性能,建议采用新基线和协议。
Siwon Kim, Kukjin Choi, Hyun-Soo Choi 等
提出基于分支模型预测控制的多模态交互运动规划框架,有效应对不受控代理的多样反应行为。
Yuxiao Chen, Ugo Rosolia, Wyatt Ubellacker 等
PICARD通过增量解析限制预训练语言模型的自动回归解码,有效提升SQL生成的正确率。
Torsten Scholak, Nathan Schucher, Dzmitry Bahdanau
提出一种框架解决问答中的知识冲突,提升4%-7%泛化能力。
Shayne Longpre, Kartik Perisetla, Anthony Chen 等
提出块剪枝方法,结合运动剪枝实现Transformer模型的速度提升,达2.4倍加速和74%模型缩减。
François Lagunas, Ella Charlaix, Victor Sanh 等
提出NEAT,通过注意力映射实现端到端自主驾驶中的场景理解与路径预测。
Kashyap Chitta, Aditya Prakash, Andreas Geiger