The Scene Language: Representing Scenes with Programs, Words, and Embeddings
提出Scene Language,通过程序、词汇和嵌入描述场景结构、语义和身份,实现无训练推断与高保真场景生成。
Yunzhi Zhang, Zizhang Li, Matt Zhou 等
提出Scene Language,通过程序、词汇和嵌入描述场景结构、语义和身份,实现无训练推断与高保真场景生成。
Yunzhi Zhang, Zizhang Li, Matt Zhou 等
TIPS结合空间感知,通过合成描述和自监督技术提升图像理解能力。
Kevis-Kokitsi Maninis, Kaifeng Chen, Soham Ghosh 等
DreamVideo-2实现零样本主体驱动视频定制,结合参考注意力与掩码引导运动,无需测试时微调。
Yujie Wei, Shiwei Zhang, Hangjie Yuan 等
提出多场景视觉定位基准MC-Bench,评估多模态大模型在多图环境中的实例定位能力。
Yunqiu Xu, Linchao Zhu, Yi Yang
SANA采用深度压缩自编码器与线性DiT,能在单GPU上高效生成4096×4096图像。
Enze Xie, Junsong Chen, Junyu Chen 等
Mono-InternVL通过嵌入视觉专家和端内视觉预训练,提升单一大模型的多模态能力,性能优于13个基准。
Gen Luo, Xue Yang, Wenhan Dou 等
提出SG-Nav,基于3D场景图的零样本目标导航,SR提升超10%。
Hang Yin, Xiuwei Xu, Zhenyu Wu 等
提出MinorityPrompt,通过在线提示优化提升低概率样本生成能力。
Soobin Um, Jong Chul Ye
IterComp通过多模型偏好采集和迭代反馈提升文本到图像的组合能力,显著优于SOTA方法。
Xinchen Zhang, Ling Yang, Guohao Li 等
ReinDiffuse结合强化学习与扩散模型,生成符合物理规律的人体动作,超越SOTA。
Gaoge Han, Mingjiang Liang, Jinglei Tang 等
DreamMesh4D结合网格与高斯点云,实现单目视频的高质量动态4D重建。
Zhiqi Li, Yiming Chen, Peidong Liu
基于扩散模型的3D目标生成与重建,利用噪声逆转实现高质量多样化输出。
Zhen Wang, Dongyuan Li, Yaozu Wu 等
提出ActiView基准,评估多模态大模型的主动感知能力,涵盖视图转移与缩放,实验显示模型差距明显。
Ziyue Wang, Chi Chen, Fuwen Luo 等
SparseVLM通过文本引导无训练成本地稀疏视觉Token,显著降低VLM计算负担。
Yuan Zhang, Chun-Kai Fan, Junpeng Ma 等
提出Sm机制增强多实例学习中的局部依赖建模,显著提升医学图像定位性能。
Francisco M. Castro-Macías, Pablo Morales-Álvarez, Yunan Wu 等
本研究发现动态稀疏训练(DST)在图像腐蚀鲁棒性方面优于密集训练,尤其在稀疏度10%-50%范围内。
Boqian Wu, Qiao Xiao, Shunxin Wang 等
自解释AI结合注意力机制提升医学图像分析透明度,覆盖200篇论文。
Junlin Hou, Sicen Liu, Yequan Bie 等
LS-HAR结合语言引导骨架和视觉特征,利用Salient Fusion提升施工现场人类动作识别准确率。
Mohammad Mahdavian, Mohammad Loni, Ted Samuelsson 等
Leopard模型解决多图像文本任务,超越Llama-3.2等,使用1.2M开源数据。
Mengzhao Jia, Wenhao Yu, Kaixin Ma 等
提出无训练的概率性猜测雅可比解码(SJD),在文本到图像生成中实现约2倍加速,保持图像质量。
Yao Teng, Han Shi, Xian Liu 等