Text-Visual Prompting for Efficient 2D Temporal Video Grounding
提出了一种文本-视觉提示框架(TVP),在Charades-STA数据集上提高了9.79%的性能。
Yimeng Zhang, Xin Chen, Jinghan Jia 等
提出了一种文本-视觉提示框架(TVP),在Charades-STA数据集上提高了9.79%的性能。
Yimeng Zhang, Xin Chen, Jinghan Jia 等
Visual ChatGPT结合视觉基础模型,实现图像与语言交互。
Chenfei Wu, Shengming Yin, Weizhen Qi 等
Magnushammer利用对比学习和Transformer提升命题选择,成功率达59.5%,参数少4倍。
Maciej Mikuła, Szymon Tworkowski, Szymon Antoniak 等
提出ElC-OIS,通过椭球聚类实现LiDAR开集实例分割,提升10%关联质量。
Wenbang Deng, Kaihong Huang, Qinghua Yu 等
TRACT方法通过传递闭包时间蒸馏,提升单步扩散模型的生成质量,FID达7.4。
David Berthelot, Arnaud Autef, Jierui Lin 等
提出S5模型改进,用于长序列强化学习,速度快且性能优异。
Chris Lu, Yannick Schroecker, Albert Gu 等
提出基于补丁的扩散模型(pDDPM)用于脑MRI无监督异常检测,提升25.1%准确率。
Finn Behrendt, Debayan Bhattacharya, Julia Krüger 等
Wizard-of-Oz研究20人、325个问题:文字助手提问更多且效率更高,满意度与信任度相当。
Emily Kuang, Ehsan Jahangirzadeh Soure, Mingming Fan 等
提出PaLM-E,将多模态感知与大语言模型结合,用于机器人任务和视觉问答。
Danny Driess, Fei Xia, Mehdi S. M. Sajjadi 等
DAS方法通过梯度下降和分布式表示,解决因果抽象的对齐问题,实验显示100% IIA。
Atticus Geiger, Zhengxuan Wu, Christopher Potts 等
FluidLab利用可微物理引擎支持复杂流体操控任务,结合强化学习与优化方法。
Zhou Xian, Bo Zhu, Zhenjia Xu 等
提出ORORA,基于GNC的鲁棒雷达里程计,显著提升噪声与干扰下的定位精度。
Hyungtae Lim, Kawon Han, Gunhee Shin 等
论文证明确定性算法空间下界为~Ω(nM/RT),并以差分隐私实现自适应鲁棒算法~O(n/(R√T))。
David P. Woodruff, Fred Zhang, Samson Zhou
提出一致性模型,支持单步生成,超越扩散模型的采样速度,达FID 3.55(CIFAR-10)和6.20(ImageNet 64x64)。
Yang Song, Prafulla Dhariwal, Mark Chen 等
基于扩散模型的多模态人类运动生成方法,采用序列、并行和模型融合实现长序列、多人互动和细粒度控制。
Yonatan Shafir, Guy Tevet, Roy Kapon 等
本研究评估气候科学中XAI方法的鲁棒性、忠实性等属性,比较Integrated Gradients等算法性能。
Philine Bommer, Marlene Kretschmer, Anna Hedström 等
提出HMT模型,将潜在的起始翻译时刻作为隐状态,显著提升SiMT性能。
Shaolei Zhang, Yang Feng
Almanac框架结合检索能力提升临床医学语言模型的准确性,事实性提高18%。
Cyril Zakka, Akash Chaurasia, Rohan Shad 等
提出基于Dafny的EVM形式语义,实现可验证的字节码推理框架。
Franck Cassez, Joanne Fuller, Milad K. Ghale 等
GEMBA基于GPT模型评估翻译质量,支持有无参考,达成WMT22最优准确率。
Tom Kocmi, Christian Federmann