Task-Agnostic Noisy Label Detection via Standardized Loss Aggregation
提出标准化损失聚合(SLA)用于样本噪声检测,结合交叉验证损失,表现优于硬计数法。
Inhyuk Park, Doohyun Park
提出标准化损失聚合(SLA)用于样本噪声检测,结合交叉验证损失,表现优于硬计数法。
Inhyuk Park, Doohyun Park
DriveFuture通过条件未来潜在状态,提升自主驾驶轨迹规划性能,达成55.5 EPDMS。
Yufeng Hong, Xiaotian Zhou, Yingyan Li 等
提出Re-Prefill方法,通过二次注意引导改善VLM GUI定位,提升最大4.3%。
Jiaping Lin, Fei Shen, Junzhe Li 等
提出“360°想象”框架,利用概率空间生成空间先验,显著提升人形视觉搜索效率。
Jingdong Zhang, Yizhou Wang, Zhengzhong Tu 等
HyRo通过超几何旋转优化嵌入角度,实现开放词汇语义分割的层次与语义对齐。
Hoang M. Truong, Hai Nguyen-Truong, Dang Huynh
ZAYA1-VL-8B结合LoRA适配器和双向注意机制,提升视觉-语言模型性能。
Hassan Shapourian, Kasra Hejazi, Olabode M. Sule 等
STARFlow2通过结合语言模型和归一化流,实现统一的多模态生成,表现优异。
Ying Shen, Tianrong Chen, Yuan Gao 等
通过距离变换增强单目深度预测,显著提升低纹理区域的性能。
Marwane Hariat, Antoine Manzanera, David Filliat
ForgeVLA通过联邦学习从分布式视觉-动作对中学习VLA模型,无需语言标注,显著提升性能。
Yuhao Zhou, Yunpeng Zhu, Yang Zhou 等
提出Residual Latent Action (RLA)方法,通过DINO残差学习世界模型,在多任务机器人操作中提升预测精度并减少计算开销。
Xinyu Zhang, Zhengtong Xu, Yutian Tao 等
SAFE挑战利用深度学习检测多源高质量合成视频,取得跨生成器泛化显著进展。
Kirill Trapeznikov, Gabriel Mancino-Ball, Jonathan Li 等
HumanNet视频集通过Qwen模型实现人类视频与机器人数据的替代,提升学习效率。
Yufan Deng, Daquan Zhou
Prologue通过生成专用引导令牌,缩小重建与生成差距,提升ImageNet 256×256的gFID从21.01降至10.75。
Bowen Zheng, Weijian Luo, Guang Yang 等
提出InfoCoordiBridge,结合多传感器信息协调与符号推理,提升自主驾驶场景理解的可靠性。
Shuo Liu, Lei Shi, Haowen Liu 等
提出FSTM,通过两阶段训练实现室内场景几何与语义高效重建,速度提升2.3倍。
Remi Chierchia, Léo Lebrat, David Ahmedt-Aristizabal 等
提出CAFe-DINO,利用DINOv3实现无需RS微调的开域语义分割,性能超越现有方法。
Ryan Faulkenberry, Saurabh Prasad
Hyp2Former利用超弦空间学习层次语义结构,提升开放集全景分割性能。
Yao Lu, Rohit Mohan, Florian Drews 等
NTIRE 2026挑战提出RetinexFormerRefine等方法,在低光照图像增强中实现SSIM提升至0.5654,模型小于1MB。
Jiebin Yan, Chenyu Tu, Weixia Zhang 等
MeshReGen框架通过VecSet机制从2D图像和初始3D形状再生3D物体,提升细节一致性。
Geon Yeong Park, Roman Shapovalov, Rakesh Ranjan 等
提出DynamicGUIBench和DynamicUI,解决高动态环境下GUI代理的部分可观测问题,显著提升性能。
Enqi Liu, Liyuan Pan, Zhi Gao 等