HIVE: Harnessing Human Feedback for Instructional Visual Editing
HIVE通过人类反馈优化指令式视觉编辑,利用奖励模型提升编辑准确性。
Shu Zhang, Xinyi Yang, Yihao Feng 等
HIVE通过人类反馈优化指令式视觉编辑,利用奖励模型提升编辑准确性。
Shu Zhang, Xinyi Yang, Yihao Feng 等
提出Min-SNR-γ加权策略,提升扩散模型训练速度3.4倍,FID达2.06。
Tiankai Hang, Shuyang Gu, Chen Li 等
提出基于模型的概念漂移解释方法,利用空间特征变化识别漂移,增强模型可解释性。
Fabian Hinder, Valerie Vaquet, Johannes Brinkrolf 等
提出DIRE方法,通过Diffusion模型重建误差检测扩散生成图像,显著优于现有方法。
Zhendong Wang, Jianmin Bao, Wengang Zhou 等
提出MATH 401数据集,系统评估GPT-4、ChatGPT等在算术任务中的表现,发现GPT-4表现优异。
Zheng Yuan, Hongyi Yuan, Chuanqi Tan 等
ART框架利用冻结大模型自动生成多步推理程序,显著提升跨任务性能。
Bhargavi Paranjape, Scott Lundberg, Sameer Singh 等
SelfCheckGPT通过随机采样检测大模型的事实偏差,无需外部数据库。
Potsawee Manakul, Adian Liusie, Mark J. F. Gales
GPT-4为多模态Transformer模型,采用预训练+RLHF,达成人类水平,突破多项基准。
OpenAI, Josh Achiam, Steven Adler 等
ViperGPT利用Python代码生成实现视觉推理,无需训练,达成多任务零-shot最优。
Dídac Surís, Sachit Menon, Carl Vondrick
提出“调优镜头”方法,利用层间仿射变换提升Transformer预测解码的准确性。
Nora Belrose, Igor Ostrovsky, Lev McKinney 等
提出压缩域TSG框架TCSF,利用I帧、运动矢量和残差实现高效定位,性能优于SOTA。
Xiang Fang, Daizong Liu, Pan Zhou 等
MobileVOS结合对比学习与知识蒸馏,实现移动端实时视频目标分割,参数少且速度快。
Roy Miles, Mehmet Kerim Yucel, Bruno Manganelli 等
SR-init通过分析层参数随机重初始化引起的准确率变化,提出可解释的层剪枝策略,显著减少模型参数和计算量。
Hui Tang, Yao Lu, Qi Xuan
提出AVLMaps,融合音频、视觉、语言信息的3D地图,提升机器人多模态导航性能。
Chenguang Huang, Oier Mees, Andy Zeng 等
利用Flamingo模型作为成功检测器,将成功识别作为视觉问答任务,跨三大领域实现良好泛化。
Yuqing Du, Ksenia Konyushkova, Misha Denil 等
负熵FTRL在线性老虎机中实现三世界适应:对抗环境O(√dT logT log|D|T),随机环境O(d logT log|D|T/Δmin)。
Fang Kong, Canzhe Zhao, Shuai Li
提出Retinexformer,一阶Retinex框架结合Transformer,显著提升低光照图像质量。
Yuanhao Cai, Hao Bian, Jing Lin 等
VLOSS方法通过全监督数据提升开世界分割能力,在LVIS v1上超越MaskCLIP 2%。
Bowen Dong, Jiaxi Gu, Jianhua Han 等
本文提出LLM-GROP,结合大语言模型提取常识知识,优化多目标物体重排的任务与运动规划,显著提升成功率。
Yan Ding, Xiaohan Zhang, Chris Paxton 等
GigaGAN通过新架构实现文本到图像合成,生成512px图像仅需0.13秒。
Minguk Kang, Jun-Yan Zhu, Richard Zhang 等