Efficient Spatio-Temporal Grounding with Multimodal Large Models via Second-Level Tracking and RL Verification
通过秒级跟踪和强化学习验证实现高效时空定位,提升定位质量。
Tianshu Zhang, Yan Wang, Ji Qi 等
通过秒级跟踪和强化学习验证实现高效时空定位,提升定位质量。
Tianshu Zhang, Yan Wang, Ji Qi 等
EVLA结合多模态感知与电气状态,利用UCSE与ESRC实现能量优化决策。
Yuxin Liu, Zihan Chen, Haoyu Wang 等
提出DLGStream,通过双不透明度和变形场实现高效开放词汇自由视点流媒体,平均帧大小43KB。
Zhihui Ke, Yuyang Liu, Xiaobo Zhou 等
Ground4D结合VGGT几何初始化与动态高斯点云优化,实现单目视频的4D场景重建与高质量新视角合成。
Qing Zhao, Weijian Deng, Pengxu Wei 等
提出CoGS,基于分解的高斯点云方法,提升单目视频中人-物场景重建精度。
Jerrin Bright, John Zelek
Human2Any通过对象交互先验实现人类视频到机器人操作的跨形态迁移,无需真实机器人示范。
Shuo Cheng, Chuye Zhang, Alfred Cueva 等
提出KG4VD,基于多模态图的长距离视觉文档理解方法,提升多跳问答准确率至44.52%。
Yi-Cheng Wang, Chu-Song Chen
NEXT框架通过NEXT-8B模型实现视频推荐,提升观看时长+0.53%,视频多样性+0.51%。
Yuming Liu, Hongye Yang, Harrison Zhao 等
提出自监督定理发现算法,从公理和推理规则中自主生成数千个有意义的定理,提升形式系统证明能力。
Kazuki Ota, Takayuki Osa, Tatsuya Harada
COMPASS以共享令牌τc连接构图识别与生成,基于389031图像和约120万VQA实现可控构图迁移。
Ziqi Zhou, Weize Quan, Mining Tan 等
Obliviate方法在自回归图像生成中有效删除概念,RAB基准上裸露率从91.58%降至3.15%。
Hossein Shakibania, Jonas Henry Grebe, Tobias Braun 等
使用代理门控生成和基础模型嵌入进行贝叶斯材料设计,减少了90%的评估调用。
Sk Md Ahnaf Akif Alvi, Jan Janssen, Danny Perez 等
IMCBench通过图像支持的多轮对话评估多模态LLM,Claude Opus 4.6得分最高3.61。
Maria Xenochristou, Ashutosh Joshi, Korosh Vatanparvar 等
StructSplat是一种无需相机参数的端到端3D高斯重建框架,显著优于现有方法。
Jia-Chen Zhao, Beiqi Chen, Xinyang Chen 等
PEHT结合LoRA优化Transformer,利用城市交通与拥堵信息实现网络流量高精度预测。
Abdolazim Rezaei, Mehdi Sookhak, Mahboobeh Haghparast
COCOLogic-V2通过硬负样本评估视觉归纳推理,揭示模型在边界样本上的不足。
David Steinmann, Antonia Wüst, Kristian Kersting 等
PA-BiCoop框架在RLBench2任务中平均提升48%,在现实任务中提升50%。
Bai Qicheng, Wang Ziru, Ma Teli 等
提出LLawCo框架,通过反思失败提取行为规律,提升多智能体合作效率,成功率提升4.5%。
Qinhong Zhou, Chuang Gan, Anoop Cherian
提出MMAO:基于内源性资源调控的多智能体优化框架,适用于连续与离散问题。
Jinliang Xu, Liping Ma
CAPE用GPT-4o生成空间化文档布局的上下文解释,覆盖新闻与学术布局。
Wei Liu, John Wenskovitch, Chris North 等