DreamBooth3D: Subject-Driven Text-to-3D Generation
DreamBooth3D结合DreamBooth与DreamFusion,从少量图片实现个性化文本到3D生成,达成高质量、可编辑的3D模型。
Amit Raj, Srinivas Kaza, Ben Poole 等
DreamBooth3D结合DreamBooth与DreamFusion,从少量图片实现个性化文本到3D生成,达成高质量、可编辑的3D模型。
Amit Raj, Srinivas Kaza, Ben Poole 等
基于Stable Diffusion的零样本文本视频生成方法,利用运动编码和跨帧注意力实现时间一致性。
Levon Khachatryan, Andranik Movsisyan, Vahram Tadevosyan 等
提出基于域对齐和时空正则的知识迁移策略,有效提升SNN在事件数据上的泛化能力。
Xiang He, Dongcheng Zhao, Yang Li 等
早期GPT-4展现出跨领域通用智能,超越前代模型,具备数学、法律、医学等多任务能力。
Sébastien Bubeck, Varun Chandrasekaran, Ronen Eldan 等
本研究比较了在机器人进化中结合性/非结合性脑重组与达尔文/拉马克机制的效果,发现无性结合+拉马克最优。
Jie Luo, Carlo Longhi, Agoston E. Eiben
TextKG方法通过知识图谱增强视频字幕生成,YouCookII数据集CIDEr得分提升18.7%。
Xin Gu, Guang Chen, Yufei Wang 等
NUWA-XL通过“扩散上的扩散”生成超长视频,推理时间减少94.26%。
Shengming Yin, Chenfei Wu, Huan Yang 等
提出基于部件级隐式表示的级联扩散模型,实现高质量3D形状生成与无条件部分编辑。
Juil Koo, Seungwoo Yoo, Minh Hieu Nguyen 等
Text2Motion结合LLMs与几何规划,实现长远任务的机器人动作序列生成,成功率达82%。
Kevin Lin, Christopher Agia, Toki Migimatsu 等
提出CAT-Seg基于成本聚合的开放词汇语义分割方法,通过微调CLIP编码器实现对已知和未知类别的像素级识别,显著优于现有方法。
Seokju Cho, Heeseong Shin, Sunghwan Hong 等
采用E3Net架构的深度噪声抑制模型,提升信噪比和主讲人语音质量。
Harishchandra Dubey, Ashkan Aazami, Vishak Gopal 等
Text2Tex利用深度感知扩散模型,从文本提示逐步生成高质量3D纹理。
Dave Zhenyu Chen, Yawar Siddiqui, Hsin-Ying Lee 等
MM-REACT结合ChatGPT与视觉专家,实现多模态推理,突破现有模型限制。
Zhengyuan Yang, Linjie Li, Jianfeng Wang 等
Reflexion通过语言反馈强化LLMs,无需微调,显著提升代码和推理任务表现。
Noah Shinn, Federico Cassano, Edward Berman 等
Zero-1-to-3利用扩散模型实现单图3D视角变换与重建,零样本泛化能力强。
Ruoshi Liu, Rundi Wu, Basile Van Hoorick 等
通过意见提示和反事实演示提升大语言模型的上下文忠实度,显著减少记忆化比例。
Wenxuan Zhou, Sheng Zhang, Hoifung Poon 等
GPT-4在无专门调优下超越USMLE及多项医学基准,表现出优异的诊断推理能力。
Harsha Nori, Nicholas King, Scott Mayer McKinney 等
本研究提出基于StyleGAN的抽象素描到逼真图像的解耦训练框架,显著提升生成质量。
Subhadeep Koley, Ayan Kumar Bhunia, Aneeshan Sain 等
提出了一种前瞻性密集视觉可供性方法,提升了可变形物体操作的效率。
Ruihai Wu, Chuanruo Ning, Hao Dong
TextFlint评测六个GPT模型、21个数据集后发现:RLHF提升人类化表达,却未必提升NLU性能与鲁棒性。
Junjie Ye, Xuanting Chen, Nuo Xu 等