PRISM: A Multi-View Multi-Capability Retail Video Dataset for Embodied Vision-Language Models
PRISM利用多视角视频和三维知识本体,提升零售环境中 embodied VLM的空间、物理和行动理解。
Amirreza Rouhi, Parikshit Sakurikar, Satya Sai Reddy 等
PRISM利用多视角视频和三维知识本体,提升零售环境中 embodied VLM的空间、物理和行动理解。
Amirreza Rouhi, Parikshit Sakurikar, Satya Sai Reddy 等
多层记忆框架提高LLM的长期上下文保留,成功率46.85%,六周期保留率56.90%。
Sunil Tiwari, Payal Fofadiya
LatentPilot通过未来观察训练学习动作条件下的视觉动态,实现场景感知导航,达成SOTA。
Haihong Hao, Lei Chen, Mingfei Han 等
SparseDriveV2通过密集静态词表和分解轨迹实现端到端自主驾驶,达92.0 PDMS。
Wenchao Sun, Xuewu Lin, Keyu Chen 等
MEDiC融合CLIP蒸馏与像素重建,ImageNet-1K达73.9% kNN、85.1%微调。
Konstantinos Georgiou, Maofeng Tang, Hairong Qi
FGOS-Net通过频率-几何解耦实现91.3% mIoU和97.1% clDice。
Jin Bai, Huiyao Zhang, Qi Wen 等
GEMS框架通过记忆和技能提升多模态生成,Z-Image-Turbo在GenEval2上超越Nano Banana 2。
Zefeng He, Siyuan Huang, Xiaoye Qu 等
提出跨尺度解码器,提升越野语义分割准确性,mIoU提高至89.97。
Seongkyu Choi Jhonghyun An
RINO通过RINONet实现旋转不变的非刚性匹配,显著提高3D形状对应精度。
Maolin Gao, Shao Jie Hu-Chen, Congyue Deng 等
Syn4Seg框架通过生成多样化的合成图像和伪标签改进GFSS性能,在PASCAL-5i和COCO-20i上实现显著提升。
Guohuan Xie, Xin He, Dingying Fan 等
SJD-VP通过预测验证提升自回归图像生成的加速效果和质量。
Bingqi Shan, Baoquan Zhang, Xiaochen Qi 等
DiReCT方法提升VideoPhy物理常识分数16.7%,不增加训练时间。
Abolfazl Meyarian, Amin Karimi Monsefi, Rajiv Ramnath 等
Fus3D利用预训练几何Transformer的中间特征,直接回归密集SDF,实现快速无摄像头校准的3D重建。
Laura Fink, Linus Franke, George Kopanas 等
GDPO-Listener通过自回归流匹配和群体奖励解耦策略优化生成高表达性头部动作。
Zhangyu Jin, Maksim Siniukov, Deuksin Kwon 等
AVControl基于LTX-2,通过LoRA实现多模态音视频控制,训练快速高效。
Matan Ben-Yosef, Tavi Halperin, Naomi Ken Korem 等
Latent-WAM通过空间感知和动态信息的潜在世界表示,实现高效的端到端自动驾驶,NAVSIM v2上得分89.3。
Linbo Wang, Yupeng Zheng, Qiang Chen 等
EndoVGGT通过DeGAT模块提升手术3D重建的深度估计,PSNR提高24.6%,SSIM提高9.1%。
Falong Fan, Yi Xie, Arnis Lektauers 等
VFIG利用视觉-语言模型将复杂图形转换为SVG,VLM-Judge得分0.829。
Qijia He, Xunmei Liu, Hammaad Memon 等
提出简洁稳定的流匹配生成模型,规模扩大两倍,FID提升两倍,结合分子嵌入实现未见分子模拟。
Charles Jones, Emmanuel Noutahi, Jason Hartford 等
MedObvious通过临床分诊揭示VLMs中的医疗Moravec悖论,提出1880项任务基准测试。
Ufaq Khan, Umair Nawaz, L D M S S Teja 等