VAST: A Vision-Audio-Subtitle-Text Omni-Modality Foundation Model and Dataset
VAST模型利用VAST-27M数据集实现视觉、音频、字幕和文本的全模态视频理解,取得22项新SOTA。
Sihan Chen, Handong Li, Qunbo Wang 等
VAST模型利用VAST-27M数据集实现视觉、音频、字幕和文本的全模态视频理解,取得22项新SOTA。
Sihan Chen, Handong Li, Qunbo Wang 等
提出基于最近邻检索的测试时微调方法,显著提升20+任务性能。
Moritz Hardt, Yu Sun
通过校准框架解决大语言模型评估中的位置偏差,提升与人工一致性达14.3%。
Peiyi Wang, Lei Li, Liang Chen 等
LLM-QAT通过无数据蒸馏实现4-bit量化,提升大语言模型性能。
Zechun Liu, Barlas Oguz, Changsheng Zhao 等
本文提出多任务扩散模型(MTDiff),结合Transformer和提示学习,有效实现多任务离线强化学习的规划与数据合成。
Haoran He, Chenjia Bai, Kang Xu 等
AdaSketch-Newton以精确增广拉格朗日和随机草图求解KKT牛顿系统,实现几乎必然全局收敛及局部线性、超线性收敛。
Ilgee Hong, Sen Na, Michael W. Mahoney 等
提出GRIT,无消息传递,利用图归纳偏差实现最优性能,显著优于传统方法。
Liheng Ma, Chen Lin, Derek Lim 等
提出FactFormer,基于轴向因式核积分的可扩展Transformer,用于高维PDE代理建模。
Zijie Li, Dule Shu, Amir Barati Farimani
提出MeZO零阶优化器,能在相同内存下微调30亿参数模型,显著优于传统反向传播。
Sadhika Malladi, Tianyu Gao, Eshaan Nichani 等
LATM框架通过GPT-4生成可复用Python工具,显著降低推理成本。
Tianle Cai, Xuezhi Wang, Tengyu Ma 等
NavGPT利用大规模语言模型实现视觉导航中的高层次推理,展现零样本规划能力。
Gengze Zhou, Yicong Hong, Qi Wu
提出Supervised Attention多实例学习(SAMIL)用于多视角超声心动图心脏病检测,提升准确率。
Zhe Huang, Benjamin S. Wessler, Michael C. Hughes
Banana网络通过Banach不动点实现点云分割的部件间等变性,提升了分割准确度。
Congyue Deng, Jiahui Lei, Bokui Shen 等
提出DPOK,基于策略梯度的在线强化学习微调扩散模型,提升文本-图像对齐和图像质量。
Ying Fan, Olivia Watkins, Yuqing Du 等
提出端到端可微的Transformer Neural Processes用于元贝叶斯优化,结合强化学习提升样本效率。
Alexandre Maraval, Matthieu Zimmer, Antoine Grosnit 等
提出MeLoDy,基于扩散模型的高效神经音乐生成,采样速度提升95.7%或99.6%。
Max W. Y. Lam, Qiao Tian, Tang Li 等
提出塑性注入技术,提升深度RL网络的可塑性,改善性能和训练效率。
Evgenii Nikishin, Junhyuk Oh, Georg Ostrovski 等
提出Iter-RetGen,通过迭代检索与生成提升多任务问答表现,优于或匹配SOTA。
Zhihong Shao, Yeyun Gong, Yelong Shen 等
ViTMatte结合混合注意力机制与轻量卷积,提升图像抠图性能,超越SOTA。
Jingfeng Yao, Xinggang Wang, Shusheng Yang 等
SBMI方法通过神经网络推断模型组件和参数的联合概率分布。
Cornelius Schröder, Jakob H. Macke