JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation
JanusVLN利用双隐式神经记忆,分离空间几何与语义信息,提升视觉-语言导航性能。
Shuang Zeng, Dekang Qi, Xinyuan Chang 等
JanusVLN利用双隐式神经记忆,分离空间几何与语义信息,提升视觉-语言导航性能。
Shuang Zeng, Dekang Qi, Xinyuan Chang 等
提出多层次统一框架分析大模型幻觉,揭示数据偏差和机制影响。
Zhengyi Ho, Siyuan Liang, Dacheng Tao
引入视觉测试时刻缩放(VTTS)与迭代感知机制,提升多模态大模型推理能力,平均提升超5%。
Ziang Yan, Xinhao Li, Yinan He 等
Seedream 4.0采用高效扩散变换器与VAE,提升高分辨率多模态生成性能。
Team Seedream, :, Yunpeng Chen 等
UniPixel结合像素级感知与视觉理解,支持多任务像素推理,达成10项基准优异表现。
Ye Liu, Zongyang Ma, Junfu Pu 等
现代视频LLM需要听吗?通过LLaVA-OneVision,音频编码器提升了跨模态推理能力。
Geewook Kim, Minjoon Seo
SD-VLM通过MSMU数据集和深度位置编码提升VLM的空间理解能力,超越GPT-4o和Intern-VL3-78B。
Pingyi Chen, Yujing Lou, Shen Cao 等
SPFSplatV2实现了从稀疏视图中高效的无姿态3D高斯点云生成,达到最先进的性能。
Ranran Huang, Krystian Mikolajczyk
提出一种自监督深度估计方法,利用混合分布提高边界清晰度,边界清晰度提升35%。
Aurélien Cecille, Stefan Duffner, Franck Davoine 等
ScaleCUA利用跨平台数据训练大规模GUI理解模型,提升多系统操作能力。
Zhaoyang Liu, Jingjing Xie, Zichen Ding 等
提出GenExam,涵盖10学科的多学科文本到图像基准,结合细粒度评分与真实图像。
Zhaokai Wang, Penghao Yin, Xiangyu Zhao 等
UM-Depth结合运动和不确定性增强单目深度估计,KITTI数据集上表现优异。
Tae-Wook Um, Ki-Hyeon Kim, Hyun-Duck Choi 等
MagicMirror通过340K标注数据和GRPO训练的VLM实现细粒度图像伪影评估,显著提升模型缺陷检测能力。
Jia Wang, Jie Hu, Xiaoqi Ma 等
OnlineHOI框架在Core4D和OAKINK2数据集上实现了在线人-物交互生成与感知的最先进结果。
Yihong Ji, Yunze Liu, Yiyao Zhuo 等
InterAct通过统一优化框架提升3D人-物交互数据质量,数据集扩展至30.70小时。
Sirui Xu, Dongting Li, Yucheng Zhang 等
Dark-ISP通过直接处理Bayer RAW图像提升低光物体检测性能,实验结果优于现有方法。
Jiasheng Guo, Xin Gao, Yuxiang Yan 等
RewardDance通过奖励规模化实现视觉生成模型的性能提升,参数规模达26亿,显著优于SOTA。
Jie Wu, Yu Gao, Zilyu Ye 等
VIRAL方法通过对齐视觉表示提升多模态大模型在视觉任务上的表现,平均提升9.4%。
Heeji Yoon, Jaewoo Jung, Junwan Kim 等
UFC方法通过少量样本实现扩散模型的空间控制,性能接近全监督基线。
Kiet T. Nguyen, Chanhyuk Lee, Donggyun Kim 等
FlowSeek结合深度基础模型与运动基,实现低资源高精度光流估计。
Matteo Poggi, Fabio Tosi