Taming Visually Guided Sound Generation
提出一种基于Transformer的模型,能快速生成高保真视觉引导声音。
Vladimir Iashin, Esa Rahtu
提出一种基于Transformer的模型,能快速生成高保真视觉引导声音。
Vladimir Iashin, Esa Rahtu
本研究分析高斯过程带宽攻击方法,提出白盒和黑盒攻击,成功引导算法偏向目标区域。
Eric Han, Jonathan Scarlett
通过多任务提示训练(T0),模型在零样本任务中表现优异,超越16倍模型规模的对比模型。
Victor Sanh, Albert Webson, Colin Raffel 等
提出BBQ偏见基准,利用手工模板检测问答模型中的社会偏见,发现模型在信息不足时易依赖刻板印象。
Alicia Parrish, Angelica Chen, Nikita Nangia 等
提出LSPE架构,通过可学习的结构与位置编码显著提升GNN性能, molecular数据提升至64.14%。
Vijay Prakash Dwivedi, Anh Tuan Luu, Thomas Laurent 等
NeRS通过神经表面表示实现稀疏视角下的真实场景3D重建,保证水密性并建模视角相关反射。
Jason Y. Zhang, Gengshan Yang, Shubham Tulsiani 等
P-Tuning v2通过深层连续提示实现参数效率,性能媲美微调,适用多模型规模与任务。
Xiao Liu, Kaixuan Ji, Yicheng Fu 等
Ego4D利用庞大自我视频数据集,提出多任务理解模型,推动第一人称视觉感知发展。
Kristen Grauman, Andrew Westbury, Eugene Byrne 等
提出近场波束成形的距离界限,基于模型分析,突破传统Fraunhofer距离限制。
Emil Björnson, Özlem Tugfe Demir, Luca Sanguinetti
提出基于蒸馏的紧凑多语种评估指标RemBERT,参数仅为原模型三分之一,性能达92.6%。
Amy Pu, Hyung Won Chung, Ankur P. Parikh 等
提出Crystal Diffusion Variational Autoencoder(CDVAE)模型,通过扩散过程生成稳定的周期性材料,显著优于以往方法。
Tian Xie, Xiang Fu, Octavian-Eugen Ganea 等
利用后继表示(SR)实现强化学习中的时间抽象,发现和组合选项以提升探索和规划。
Marlos C. Machado, Andre Barreto, Doina Precup 等
提出DuoRec,通过对比学习解决序列推荐中的表示退化问题,提升嵌入分布均匀性。
Ruihong Qiu, Zi Huang, Hongzhi Yin 等
通过精心架构和超参数调优,本文证明循环无模型强化学习在多类偏观测环境中表现优异,超越专用算法。
Tianwei Ni, Benjamin Eysenbach, Ruslan Salakhutdinov
ATISS用自回归Transformer生成室内布局,3D-FRONT上更真实且最快提速8倍。
Despoina Paschalidou, Amlan Kar, Maria Shugrina 等
提出一种混合直接-迭代算法,用于求解KKT线性系统,利用Cholesky稳定性,提升GPU性能。
Shaked Regev, Nai-Yuan Chiang, Eric Darve 等
提出CKL框架,通过INVARIANTLAMA、UPDATEDLAMA、NEWLAMA衡量知识保持、更新与获取,采用参数扩展方法提升效果。
Joel Jang, Seonghyeon Ye, Sohee Yang 等
提出高效的Sharpness-aware Minimizer(ESAM),通过随机扰动和敏感数据选择,降低计算成本,保持或提升模型泛化能力。
Jiawei Du, Hanshu Yan, Jiashi Feng 等
提出SE(3)等变图神经网络,结合几何与物理信息,显著提升分子与物理模拟任务性能。
Johannes Brandstetter, Rob Hesselink, Elise van der Pol 等
提出8位优化器,采用块状动态量化,保持32位性能,显存节省显著。
Tim Dettmers, Mike Lewis, Sam Shleifer 等