Speculative Decoding: Exploiting Speculative Execution for Accelerating Seq2seq Generation
SpecDec利用推测执行加速序列生成,速度提升5倍,质量与beam search相当。
Heming Xia, Tao Ge, Peiyi Wang 等
SpecDec利用推测执行加速序列生成,速度提升5倍,质量与beam search相当。
Heming Xia, Tao Ge, Peiyi Wang 等
TubeDETR利用Transformer实现视频时空定位,提升VidSTG和HC-STVG基准性能。
Antoine Yang, Antoine Miech, Josef Sivic 等
提出基于阶梯函数的单变量直接采样方法,有效避免手动调参和拒绝采样。
Andrew M. Raim
构建多模态知识库OakInk,结合对象赋能和人类交互,包含5万手-物体交互实例,推动姿态估计与交互生成。
Lixin Yang, Kailin Li, Xinyu Zhan 等
提出基于原始对偶优化的核化多臂老虎机软约束算法,实现亚线性遗憾与约束违规。
Xingyu Zhou, Bo Ji
本研究提出训练计算最优的大型语言模型方法,发现模型规模与训练数据应同步扩展,成功训练出70B参数的Chinchilla模型。
Jordan Hoffmann, Sebastian Borgeaud, Arthur Mensch 等
提出对抗运动先验(AMP)替代复杂奖励,利用少量运动捕捉数据实现自然行为迁移。
Alejandro Escontrela, Xue Bin Peng, Wenhao Yu 等
OpenDet方法通过扩展低密度潜在区域提高开放集目标检测性能,减少25%-35%错误。
Jiaming Han, Yuqiang Ren, Jian Ding 等
MedMCQA是一个涵盖21个医学科目、超过19万题的多学科多选医学问答数据集,旨在推动医学AI研究。
Ankit Pal, Logesh Kumar Umapathi, Malaikannan Sankarasubbu
BARCOR:基于BART的对话推荐系统框架,在电影领域实现最先进性能。
Ting-Chun Wang, Shang-Yu Su, Yun-Nung Chen
提出了一种时空定位的音视频网络,在MUSIC-AVQA数据集上表现优异。
Guangyao Li, Yake Wei, Yapeng Tian 等
SolidGen:首个直接生成B-rep的自回归模型,可条件化控制
Pradeep Kumar Jayaraman, Joseph G. Lambourne, Nishkrit Desai 等
CODEGEN以多轮提示提升代码生成,在MTPB上16.1B模型达47.34%。
Erik Nijkamp, Bo Pang, Hiroaki Hayashi 等
UMT框架在视频片段检索和亮点检测上实现了显著提升,尤其在QVHighlights数据集上表现出色。
Ye Liu, Siyuan Li, Yang Wu 等
提出基于节律性精度调制的主动推理模型,增强机器人感知与行动的协同。
Ajith Anil Meera, Filip Novicky, Thomas Parr 等
VideoMAE采用极高掩码比例(90%-95%)的自监督预训练,显著提升视频识别性能。
Zhan Tong, Yibing Song, Jue Wang 等
本研究提出视觉提示调优(VPT),在保持预训练Transformer模型参数不变的情况下,仅引入不到1%的输入空间可训练参数,显著提升多任务视觉识别性能,超越全参数微调。
Menglin Jia, Luming Tang, Bor-Chun Chen 等
研究综述视觉-语言导航任务,方法与未来方向,强调数据集和评估指标。
Jing Gu, Eliana Stefani, Qi Wu 等
提出CREStereo,采用层级递归网络和自适应相关层,在中、深度学习基准中排名第一,显著提升细节还原能力。
Jiankun Li, Peisen Wang, Pengfei Xiong 等
提出两种方法(振荡抑制与逐步冻结)解决低比特量化中的权重振荡,提升MobileNetV2等模型准确率。
Markus Nagel, Marios Fournarakis, Yelysei Bondarenko 等