Matryoshka Gaussian Splatting
Matryoshka Gaussian Splatting (MGS) 提供连续细节层次控制,保持全容量渲染质量。
Zhilin Guo, Boqiao Zhang, Hakan Aktas 等
Matryoshka Gaussian Splatting (MGS) 提供连续细节层次控制,保持全容量渲染质量。
Zhilin Guo, Boqiao Zhang, Hakan Aktas 等
视觉-语言-动作模型的视觉路径主导行为生成,语言敏感性依赖任务结构。
Bryce Grant, Xijia Zhao, Peng Wang
MonoArt通过渐进结构推理实现单目3D重建,提升了PartNet-Mobility数据集上的重建精度和推理速度。
Haitian Li, Haozhe Xie, Junxiang Xu 等
NavTrust通过系统性地引入RGB、深度和指令的腐蚀,评估了具身导航的可靠性,揭示了现有模型的鲁棒性差距。
Huaide Jiang, Yash Chaudhary, Yuping Wang 等
MoTok方法在HumanML3D上将轨迹误差从0.72 cm降至0.08 cm,FID从0.083降至0.029。
Chenyang Gu, Mingyuan Zhang, Haozhe Xie 等
SAMA通过语义锚定和运动对齐实现指令引导的视频编辑,显著提升编辑精度和运动一致性。
Xinyao Zhang, Wenkai Dong, Yuxin Song 等
EffectErase通过逆向学习实现高质量视频对象移除与插入,基于VOR数据集。
Yang Fu, Yike Zheng, Ziyun Dai 等
F2LLM-v2通过两阶段训练和套娃学习,提供高效多语言嵌入,支持200多种语言。
Ziyin Zhang, Zihan Liao, Hang Yu 等
基于光谱特性的逐像素扩散噪声调度提高了低步数生成质量。
Carlos Esteves, Ameesh Makadia
提出了一种在排名反馈下进行在线学习的新算法,解决了传统数值反馈缺失的问题。
Mingyang Liu, Yongshan Chen, Zhiyuan Fan 等
Nemotron-Cascade 2通过级联RL和多域策略蒸馏在30B MoE模型中实现了顶级推理能力。
Zhuolin Yang, Zihan Liu, Yang Chen 等
DriveTok通过3D可变形交叉注意力实现多视角重建和理解,在nuScenes数据集上表现出色。
Dong Zhuo, Wenzhao Zheng, Sicheng Zuo 等
DreamPartGen通过协同潜在去噪实现语义基础的部分级3D生成,几何保真度提高53%。
Tianjiao Yu, Xinzhuo Li, Muntasir Wahed 等
研究发现状态空间模型(SSM)作为视觉编码器在VLM中表现优于视觉变压器(ViT),尤其在VQA和定位任务中。
Shang-Jui Ray Kuo, Paola Cascante-Bonilla
通过成本感知的规避框架研究钓鱼检测中的鲁棒性,最小规避成本为2,80%以上的攻击集中在三个低成本特征上。
Julian Allagan, Mohamed Elbakary, Zohreh Safari 等
OmniVTA结合预测接触建模与高频触觉反馈,实现接触丰富操控任务的突破。
Yuhang Zheng, Songen Gu, Weize Li 等
FASTER通过引入Horizon-Aware Schedule,显著减少反应延迟,提升VLA模型实时性。
Yuxiang Lu, Zhe Liu, Xianzhe Fan 等
研究探讨LLM在音频语言模型中的听觉知识编码,揭示文本训练对音频性能的影响。
Ke-Han Lu, Szu-Wei Fu, Chao-Han Huck Yang 等
OS-Themis框架在AndroidWorld上提升10.3%,通过多代理批判机制优化GUI奖励。
Zehao Li, Zhenyu Wu, Yibo Zhao 等
稀疏自编码器揭示VLA模型中的可解释和可操控特征,提升模型在LIBERO基准上的泛化能力。
Aiden Swann, Lachlain McGranahan, Hugo Buurmeijer 等