Cognitive-Inspired Hierarchical Attention Fusion With Visual and Textual for Cross-Domain Sequential Recommendation
提出HAF-VT,结合视觉文本模态,利用层次注意力模型提升跨域序列推荐性能。
Wangyu Wu, Zhenhong Chen, Siqi Song 等
提出HAF-VT,结合视觉文本模态,利用层次注意力模型提升跨域序列推荐性能。
Wangyu Wu, Zhenhong Chen, Siqi Song 等
Twin-Co框架结合多轮对话与内部优化,提升图像生成的准确性和质量,实验中CLIP得分提升至0.338。
Jianhui Wang, Yangfan He, Yan Zhong 等
提出CheXWorld,基于自监督的放射影像世界模型,捕获局部结构、全局布局与域变异,显著提升多任务表现。
Yang Yue, Yulin Wang, Chenxin Tao 等
构建开源的PerceptionLM模型,利用2.8M人类标注视频问答和空间-时间字幕,推动透明视觉理解研究。
Jang Hyun Cho, Andrea Madotto, Effrosyni Mavroudi 等
提出Uni-Inv与Uni-Edit,基于流模型实现高精度逆向与区域编辑。
Guanlong Jiao, Biqing Huang, Kuan-Chieh Wang 等
提出ForgetMe数据集和Entangled评估指标,基于Prompt层级编辑实现Diffusion模型的选择性遗忘。
Zhenyu Yu, Mohd Yamani Inda Idris, Pei Wang
PartField是一种无需预定义模板的3D特征学习方法,提升了20%的准确率。
Minghua Liu, Mikaela Angelina Uy, Donglai Xiang 等
GUI-R1利用规则强化学习提升多平台GUI任务理解,数据仅用3K,优于SOTA。
Run Luo, Lu Wang, Wanwei He 等
引入SegEarth-R1,基于大语言模型的遥感像素推理,显著优于传统方法。
Kaiyu Li, Zepeng Xin, Li Pang 等
GigaTok通过语义正则化将视觉标记器扩展至30亿参数,解决重建与生成的矛盾,提升图像生成质量。
Tianwei Xiong, Jun Hao Liew, Zilong Huang 等
KARMMA框架在缺失模态下实现稳健的自我动作识别,减少50%计算资源。
Maria Santos-Villafranca, Dustin Carrión-Ojeda, Alejandro Perez-Yus 等
提出MM-IFEngine,通过生成高质量多模态指令对,提升MLLM的指令跟随能力,达成+12.3%的性能提升。
Shengyuan Ding, Shenxi Wu, Xiangyu Zhao 等
提出Perception-R1框架,利用GRPO进行视觉感知策略学习,提升COCO检测31.9% AP。
En Yu, Kangheng Lin, Liang Zhao 等
VLM-R1通过GRPO算法提升视觉语言模型的推理能力,超越SFT。
Haozhan Shen, Peng Liu, Jingcheng Li 等
Objaverse++通过人工标注10,000个3D模型的质量与属性,提升图像到3D生成性能。
Chendi Lin, Heshan Liu, Qunshu Lin 等
VideoChat-R1通过强化学习微调提升时空感知,显著提高视频推理能力。
Xinhao Li, Ziang Yan, Desen Meng 等
提出PosterMaker框架,结合TextRenderNet和SceneGenNet,实现文本渲染准确率超过90%的高质量产品海报生成。
Yifan Gao, Zihang Lin, Chuanbin Liu 等
D2USt3R通过静态-动态对齐点图提升动态场景的3D重建,显著提高重建精度。
Jisang Han, Honggyu An, Jaewoo Jung 等
S4M通过SAM提升半监督实例分割,达到最先进性能。
Heeji Yoon, Heeseong Shin, Eunbeen Hong 等
Prior2Former结合证据学习与掩码变换器,实现无假设的开源世界泛视野分割。
Sebastian Schmidt, Julius Körner, Dominik Fuchsgruber 等