Efficient Training with Foresight: Multi-Token Auxiliary Supervision for Autoregressive Image Generation
MTAR框架通过多令牌预测和语义丢弃在ImageNet上实现了高效的自回归图像生成,FID降低0.95。
Guo Niu, Xiongfei Yao, Teng Wang 等
MTAR框架通过多令牌预测和语义丢弃在ImageNet上实现了高效的自回归图像生成,FID降低0.95。
Guo Niu, Xiongfei Yao, Teng Wang 等
ProViP通过头部感知剪枝提高视觉语言模型推理效率,保留95.9%性能,提升1.62倍速度。
Chaofang Ma, Lin Jiang, Carol Jingyi Li 等
V-Link恢复Action DiT视觉信息,LIBERO-Plus提升31.2%,RoboTwin 2.0提升18.8%。
Yehao Lu, Jiarui Yang, Yuning Su 等
提出统一框架分析智能眼镜的感知、状态与行动循环,涵盖八大硬件能力轴。
Jiangning Zhang, Haojun Chen, Yong Liu
LAION-BVD为10百万小时开放视频数据集,支持多模态预训练,包含1.3B视频URL与55M剪辑。
Andreas Hochlehnert, Marianna Nezhurina, Mehdi Cherti 等
提出基于MoE的特征适配器,用于无提示的冠状动脉二值分割,显著提升跨数据集泛化能力。
Lin Xi, Yingliang Ma
基于卷积自编码器的潜在空间余弦相似度用于图像差异量化,达98.4%区分率。
Manish Sharma, Timothy Yim, Clifton Forlines
采用集成卷积神经网络(CNN)提升脑卒中预测准确率至99.52%。
Md Shahriar Sajid
X-MULTI利用预训练VLM引导图像因子解缠,提升新组合的生成质量。
Sonali Godavarthy, Matthias Neuwirth-Trapp, Tim-Felix Faasch 等
Luce通过高斯云实现单图像到3D资产生成,FID提升28%。
Mayank Singh, Michele Stoppa, Alvise Memo 等
GlanceWAM通过异步测试时想象,突破速度与成功的两难,达成72.2%成功率。
Linhan Wang, Zijian An, Mingyuan Zhang 等
CRISP通过DCO和OMP提升VSSD在遥感语义分割中的边界细节,参数约30M,显著改善性能。
Kangning Wang, Haopeng Zhang, Zhiguo Jiang
提出EG-ARSA:基于专家校准的低资源道路安全视觉模型,利用8亿参数的知识蒸馏实现高效评估。
Md Thamed Bin Zaman Chowdhury, Moazzem Hossain
RVM以速度场直接做奖励微调,较低成本达到或超过轨迹策略梯度方法;论文未报告具体数值。
Jaemoo Choi, Wei Guo, Yuchen Zhu 等
提出ActPair框架,结合动作对齐检索与pairwise多模态重排序,显著提升文本引导的人体异常行为检索性能。
Thanh-Khoi Nguyen, Thanh-Nhan Vo, Trong-Thuan Nguyen 等
GeoWAM通过预测场景几何演变,显著提升自主驾驶中的路径规划性能。
Yiren Lu, Xin Ye, Jiaming Liu 等
MomADv2引入选择性状态空间记忆与流匹配轨迹修正,提升长时域自主驾驶的稳定性和安全性。
Ziying Song, Shengkai Zhang, Lin Liu 等
JoyAI-Echo-1.5通过音视频记忆生成长视频和互动世界,提升一致性和视觉质量。
Nan Duan, Haoyang Huang, Weiyang Jin 等
EchoWM模型生成720p视频、环境音、音乐和语音,支持连续导航。
Songchun Zhang, Yaowei Li, Junhao Zhuang 等
AquaFlow通过单目高斯点云SLAM实现高效的水下流媒体重建,定位误差降低13.2%,PSNR提高4.74 dB。
Yingxiang Xu, Kerui Ren, Wenqi Guo 等