DiffusionCLIP: Text-Guided Diffusion Models for Robust Image Manipulation
DiffusionCLIP利用扩散模型实现文本引导的图像操控,提升ImageNet数据集上的表现。
Gwanghyun Kim, Taesung Kwon, Jong Chul Ye
DiffusionCLIP利用扩散模型实现文本引导的图像操控,提升ImageNet数据集上的表现。
Gwanghyun Kim, Taesung Kwon, Jong Chul Ye
提出异常Transformer,通过关联差异实现无监督时间序列异常检测,达成SOTA。
Jiehui Xu, Haixu Wu, Jianmin Wang 等
CLIP-Forge通过两阶段训练实现零样本文本生成3D形状,无需配对标签。
Aditya Sanghi, Hang Chu, Joseph G. Lambourne 等
提出基于语言条件的路径点预测模型,提升连续环境下指令导航成功率4%。
Jacob Krantz, Aaron Gokaslan, Dhruv Batra 等
采用统计物理方法分析城市、交通、金融、合作、网络等社会现象,揭示其复杂动力学。
Marko Jusup, Petter Holme, Kiyoshi Kanazawa 等
提出广义核稀释(Kernel Thinning)算法,提供无维度依赖的误差保证,改善高维概率分布压缩。
Raaz Dwivedi, Lester Mackey
提出一个统一稠密与稀疏检索的表示框架,核心在于逻辑评分模型和物理检索模型的分离。
Jimmy Lin
提出XR-Transformer,通过多分辨率微调极大缩短训练时间,Amazon-3M提升精度至54%。
Jiong Zhang, Wei-cheng Chang, Hsiang-fu Yu 等
提出基于深度学习的机器人情境感知架构,结合感知、理解与预测实现自主决策。
Hriday Bavle, Jose Luis Sanchez-Lopez, Claudio Cimarelli 等
CrossCLR通过引入样本影响性分析改善多模态视频-文本嵌入,显著提升检索和描述性能。
Mohammadreza Zolfaghari, Yi Zhu, Peter Gehler 等
基于ALIP和MPC的双足机器人步态控制器,提升复杂地形行走能力。
Grant Gibson, Oluwami Dosunmu-Ogunbi, Yukai Gong 等
提出ViPTL方法,通过视觉演示学习周期性任务,使用rDMP和贝叶斯优化实现。
Jingyun Yang, Junwu Zhang, Connor Settle 等
PDC-Net+通过概率模型实现精确的密集对应和置信度估计,提升几何匹配性能。
Prune Truong, Martin Danelljan, Radu Timofte 等
提出多尺度小波神经算子,压缩核函数实现高精度偏微分方程求解。
Gaurav Gupta, Xiongye Xiao, Paul Bogdan
提出验证误差作为机器遗忘的关键指标,结合SGD分析设计低验证误差的训练目标。
Anvith Thudi, Gabriel Deza, Varun Chandrasekaran 等
提出可控神经对话摘要框架,结合个人命名实体规划,提升摘要的多样性与一致性。
Zhengyuan Liu, Nancy F. Chen
MetaDrive通过程序生成和真实数据导入,支持多场景多任务的自主驾驶强化学习研究。
Quanyi Li, Zhenghao Peng, Lan Feng 等
线性策略足以实现双足机器人在复杂地形上的稳健行走,使用13个可学习参数。
Lokesh Krishna, Guillermo A. Castillo, Utkarsh A. Mishra 等
提出基于隐式神经表示的材料点方法模型降维,支持连续变形映射与动态网格变化。
Peter Yichen Chen, Maurizio M. Chiaramonte, Eitan Grinspun 等
提出多机器人系统弹性架构的正式分类,强调系统重配置、适应与增长的重要性。
Amanda Prorok, Matthew Malencia, Luca Carlone 等