Look-Back: Implicit Visual Re-focusing in MLLM Reasoning
提出Look-Back方法,通过模型自我引导在推理中隐式“回顾”视觉信息,显著提升多模态推理性能。
Shuo Yang, Yuwei Niu, Yuyang Liu 等
提出Look-Back方法,通过模型自我引导在推理中隐式“回顾”视觉信息,显著提升多模态推理性能。
Shuo Yang, Yuwei Niu, Yuyang Liu 等
HOI-Dyn框架通过轻量级Transformer模型提升人-物交互生成质量,显著减少物体运动不一致性。
Lin Wu, Zhixiang Chen, Jianglin Lan
提出REG,通过引入高层类别标记,显著提升扩散模型训练速度和生成质量。
Ge Wu, Shen Zhang, Ruijing Shi 等
EvRWKV框架通过连续交互提升低光图像,PSNR提升1.79 dB和1.85 dB。
Wenjie Cai, Qingguo Meng, Zhenyu Wang 等
本研究比较MLM与CLM预训练对文本表示的影响,发现MLM更优,但CLM更高效。
Hippolyte Gisserot-Boukhlef, Nicolas Boizard, Manuel Faysse 等
UniGlyph利用像素级文本分割和自适应引导,提升中英文视觉文本生成的精度与细节。
Yuanrui Wang, Cong Han, Yafei Li 等
本研究比较了手工、模式和大语言模型生成的能力性问题(CQ),发现LLMs虽能快速生成,但需后续优化。
Reham Alharbi, Valentina Tamma, Terry R. Payne 等
提出一种基于Transformer的全身抓取运动生成框架,在GRAB数据集上表现优异。
Edward Effendy, Kuan-Wei Tseng, Rei Kawakami
World4Drive通过意图感知的潜在世界模型实现端到端自主驾驶,无需感知标注,提升18.1%的L2误差, collision降低46.7%。
Yupeng Zheng, Pengxuan Yang, Zebin Xing 等
提出Inf-Bench框架评估视觉语言模型的空间变形推理能力,结果显示当前模型在3D任务上表现欠佳。
Jiahuan Zhang, Shunwen Bai, Tianheng Wang 等
提出一种高效的深度和空间变化图像模拟方法,提升了12MP真实场景的去模糊效果。
Xinge Yang, Chuong Nguyen, Wenbin Wang 等
MOVi-MC-AC以六视角视频提供580万实例,支持遮挡分割、内容补全与跨视角重识别。
Alexander Moore, Amar Saini, Kylie Cancilla 等
NavMorph利用自我演化世界模型,提升连续环境下视觉-语言导航的适应性与性能。
Xuan Yao, Junyu Gao, Changsheng Xu
OmniVCus利用多模态控制条件实现多主体视频定制,采用Diffusion Transformer架构。
Yuanhao Cai, He Zhang, Xi Chen 等
RoboTwin双臂操控挑战,结合SEM和AnchorDP3算法,达成97%以上成功率。
Tianxing Chen, Kaixuan Wang, Zhaohui Yang 等
VolumetricSMPL通过Neural Blend Weights实现10倍推理速度提升。
Marko Mihajlovic, Siwei Zhang, Gen Li 等
AlignEvoSkill通过知识标记和任务对齐提升技能演化,性能提升34.7%。
Dingzirui Wang, Xuanliang Zhang, Keyan Xu 等
HERB基准测试揭示了RAG系统在异构企业数据上的检索瓶颈,平均得分32.96。
Prafulla Kumar Choubey, Xiangyu Peng, Shilpa Bhagavath 等
提出基于多模态感知、世界建模的仿生AI代理,增强自主推理与交互能力。
Pascale Fung, Yoram Bachrach, Asli Celikyilmaz 等
提出评分偏差定义,发现Rubric顺序、Score ID、参考答案评分引入偏差,构建量化框架。
Qingquan Li, Shaoyu Dou, Kailai Shao 等