Seeing What You Miss: Vision-Language Pre-training with Semantic Completion Learning
提出语义补全学习(SCL)提升全球-局部跨模态对齐,显著改善视觉-语言预训练性能。
Yatai Ji, Rongcheng Tu, Jie Jiang 等
提出语义补全学习(SCL)提升全球-局部跨模态对齐,显著改善视觉-语言预训练性能。
Yatai Ji, Rongcheng Tu, Jie Jiang 等
LaCAM是一种基于搜索的多智能体路径规划算法,能在短时间内解决数百个智能体的冲突避免问题。
Keisuke Okumura
提出LVDM,利用低维潜空间实现高保真长视频生成,超越Pixel空间模型。
Yingqing He, Tianyu Yang, Yong Zhang 等
提出无需训练的“插入式”扩散特征,用于文本引导的图像转换,保持语义布局。
Narek Tumanyan, Michal Geyer, Shai Bagon 等
EDICT通过耦合变换实现精确反演,显著提升真实图像重建误差比DDIM低一半。
Bram Wallace, Akash Gokul, Nikhil Naik
基于优化的运动控制方法,利用模型简化和接触处理实现动态四足机器人运动。
Patrick M. Wensing, Michael Posa, Yue Hu 等
InstructPix2Pix结合GPT-3与Stable Diffusion,生成数十万配对数据,实现基于指令的图像编辑。
Tim Brooks, Aleksander Holynski, Alexei A. Efros
提出Null-text反演技术,实现基于引导扩散模型的真实图像高保真编辑。
Ron Mokady, Amir Hertz, Kfir Aberman 等
提出PromptInject框架,分析GPT-3的目标劫持与提示泄露攻击,成功率达58.6%。
Fábio Perez, Ian Ribeiro
DexPoint通过点云和灵巧手实现跨对象的模拟到真实操控,成功率达80%。
Yuzhe Qin, Binghao Huang, Zhao-Heng Yin 等
提出TART,基于多任务指令调优的任务感知检索系统,在零样本和跨任务场景中表现优异。
Akari Asai, Timo Schick, Patrick Lewis 等
提出GO-UCB算法,利用参数化模型实现全局优化,T期望后缀误差为\~O(√T)。
Chong Liu, Yu-Xiang Wang
提出非紧致逆问题框架,利用谱正则化实现无限维线性算子学习。
Mattes Mollenhauer, Nicole Mücke, T. J. Sullivan
提出非平衡最优传输(UOT)结合熵正则化与Gromov-Wasserstein,提升高维数据匹配与鲁棒性。
Thibault Séjourné, Gabriel Peyré, François-Xavier Vialard
通过实体关联分析,揭示大规模语言模型在长尾知识学习中的依赖性,显示模型规模与知识掌握成指数关系。
Nikhil Kandpal, Haikang Deng, Adam Roberts 等
物理引导机器学习结合物理先验与数据,提高科学问题的模型性能。
Zhongkai Hao, Songming Liu, Yichi Zhang 等
基于人眼视觉模型的多区域差异渲染技术,显著提升VR场景渲染效率。
Lili Wang, Xuehuai Shi, Yi Liu
ROS 2基于DDS实现模块化、实时性和安全性,提升工业应用可靠性。
Steve Macenski, Tully Foote, Brian Gerkey 等
提出逻辑任务集以评估推理能力,揭示大规模模型在数学推理中的局限性。
Ippei Fujisawa, Ryota Kanai
提出Latent-NeRF结合形状引导与扩散模型,实现高效3D形状与纹理生成。
Gal Metzer, Elad Richardson, Or Patashnik 等