Edge-Constrained UAV Small-Object Detection with P2 Enhancement and Quantum-Inspired Lightweight Structure Search
结合P2增强和量子启发算法优化UAV小目标检测,提升AP小目标31.10%。
Wuming Lei, Yanbin Gao, Mingyan Sun 等
结合P2增强和量子启发算法优化UAV小目标检测,提升AP小目标31.10%。
Wuming Lei, Yanbin Gao, Mingyan Sun 等
提出ATM:一种用于诊断潜在世界模型中动作语义保持性的转移矩阵,显著提升模型评估速度。
Jiaheng Chen
Imagine-OPD通过自蒸馏框架在视觉推理中实现高效性和准确性。
Yishuo Cai, Jiahui Liu, Yuanxin Liu 等
BLUE方法通过轻量级门控机制提升自动驾驶中的视觉语言行动模型效率,成功率提升8.9%。
George Ling, Lijin Yang, Hao Yang 等
提出Streaming-Train-248K数据集与Streaming Harness系统,提升VLM在野外流视频中的主动交互、长时记忆与实时处理能力。
Dingyu Yao, Shuhuan Gu, Qingyi Si 等
测试时缩放在多模态基础模型中提升生成和推理性能,分类为采样、反馈和搜索策略。
Cong Wan, Ying He, Zhongzhan Huang 等
TEVI利用稀疏自编码器,通过文本条件筛选图像特征,显著提升CLIP模型的视觉-语言对齐和检索性能。
Sweta Mahajan, Sukrut Rao, Jiahao Xie 等
本论文提出以“观看、记忆、推理”为核心能力的多模态大模型视频理解框架,显著提升长视频的理解能力。
Jiahao Meng, Yue Tan, Qi Xu 等
AnchorWorld通过3D人体运动和视角锚点实现可定制的自我演化场景模拟。
Yu Li, Menghan Xia, Gongye Liu 等
GuideCAD利用前缀嵌入结合视觉文本信息,轻量化生成3D CAD模型,参数少且效率高。
Minseong Kim, Jinyeong Park, Sungho Park 等
PAR3D提出基于部件感知的3D多模态大模型,利用ScenePart数据集显著提升细粒度场景理解能力。
Shaohui Dai, Yansong Qu, You Shen 等
提出复杂度平衡扩散切分(CBS),通过Dirichlet能量和轨迹加速度估算局部复杂度,有效提升生成质量约35%。
Noam Issachar, Dani Lischinski, Raanan Fattal
提出Astra框架结合RL训练的VLM策略与Bagel基础世界模拟器,实现基于想象的空间推理,提升MMSI-Bench从45.1到49.5。
Chenming Zhu, Jingli Lin, Yilin Long 等
提出基于实体感知的影像比对框架MedReCo,利用690,000+图像实现临床相似病例检索与变化生成。
Tengfei Zhang, Ziheng Zhao, Lisong Dai 等
HomeWorld提出基于大规模真实住宅平面图的层级式生成框架,实现可控、密集交互的全屋场景,利用LLM和图像模型生成高多样性布局。
Wenbo Li, Xiaoliang Ju, Zipeng Qin 等
提出基于视觉常识的知识优化框架,提升场景图生成的准确性,三大基准上实现显著性能提升。
Maëlic Neau, Salim Baloch, Jakob Suchan 等
GMBFormer结合NDVI引导的全球记忆库与Transformer,有效提升城市绿地提取精度,平均mIoU达89.25%。
Hao Lei, Xi Cheng, Chenlu Shu 等
提出PhaseLock,无需训练,通过两步推理提取运动先验,提升视频物理一致性平均6.2分。
Woojung Han, Seil Kang, Youngjun Jun 等
提出Style-CCL,通过多阶段课程式持续学习,利用SC-DiT实现内容保持的风格迁移,显著提升风格相似度、内容一致性和美学质量。
Shiwen Zhang, Haoyuan Wang, Xianghao Zang 等
T-FunS3D通过任务驱动的层次结构实现开放词汇3D功能分割,提升速度与效率。
Jingkun Feng, Reza Sabzevari