MM-IFEngine: Towards Multimodal Instruction Following
提出MM-IFEngine,通过生成高质量多模态指令对,提升MLLM的指令跟随能力,达成+12.3%的性能提升。
Shengyuan Ding, Shenxi Wu, Xiangyu Zhao 等
提出MM-IFEngine,通过生成高质量多模态指令对,提升MLLM的指令跟随能力,达成+12.3%的性能提升。
Shengyuan Ding, Shenxi Wu, Xiangyu Zhao 等
提出Perception-R1框架,利用GRPO进行视觉感知策略学习,提升COCO检测31.9% AP。
En Yu, Kangheng Lin, Liang Zhao 等
VLM-R1通过GRPO算法提升视觉语言模型的推理能力,超越SFT。
Haozhan Shen, Peng Liu, Jingcheng Li 等
Objaverse++通过人工标注10,000个3D模型的质量与属性,提升图像到3D生成性能。
Chendi Lin, Heshan Liu, Qunshu Lin 等
RayFronts结合密集与远距离语义映射,提升在线场景理解与探索效率。
Omar Alama, Avigyan Bhattacharya, Haoyang He 等
VideoChat-R1通过强化学习微调提升时空感知,显著提高视频推理能力。
Xinhao Li, Ziang Yan, Desen Meng 等
提出GraspClutter6D数据集,涵盖1000个高复杂度场景,含736K物体6D姿态和93亿抓取,显著提升复杂环境下的机器人抓取性能。
Seunghyeok Back, Joosoon Lee, Kangmin Kim 等
ASI方法通过程序化技能提升代理任务成功率23.5%,提高效率10.7-15.3%。
Zora Zhiruo Wang, Apurva Gandhi, Graham Neubig 等
提出基于领域条件场景图的状态地面化框架,显著提升任务规划准确率。
Jonas Herzog, Jiangpin Liu, Yue Wang
提出PosterMaker框架,结合TextRenderNet和SceneGenNet,实现文本渲染准确率超过90%的高质量产品海报生成。
Yifan Gao, Zihang Lin, Chuanbin Liu 等
ASHiTA结合LLM与3D场景图,实现高层任务的自动层级分析与环境绑定。
Yun Chang, Leonor Fermoselle, Duy Ta 等
D2USt3R通过静态-动态对齐点图提升动态场景的3D重建,显著提高重建精度。
Jisang Han, Honggyu An, Jaewoo Jung 等
GTBO算法通过识别活跃维度,在高维贝叶斯优化中实现了显著性能提升。
Erik Hellsten, Carl Hvarfner, Leonard Papenmeier 等
提出Meta-Continual Learning of Neural Fields (MCL-NF),显著提高学习速度和重建质量。
Seungyoon Woo, Junhyeog Yun, Gunhee Kim
AdaRFT通过自适应课程学习显著提升大模型数学推理效率,训练时间减半。
Taiwei Shi, Yiyang Wu, Linxin Song 等
S4M通过SAM提升半监督实例分割,达到最先进性能。
Heeji Yoon, Heeseong Shin, Eunbeen Hong 等
SmolVLM通过架构优化和高效标记策略,实现参数在几百万级别的多模态模型,GPU内存低于1GB,性能超越大规模模型。
Andrés Marafioti, Orr Zohar, Miquel Farré 等
NoveltyBench评估模型多样性,20个模型中大多表现低于人类,模型越大越缺乏多样性。
Yiming Zhang, Harshita Diddee, Susan Holm 等
提出LARM框架,通过微调多模态LLM、对齐嵌入及语义编码提升直播推荐效果。
Yueyang Liu, Jiangxia Cao, Shen Wang 等
Prior2Former结合证据学习与掩码变换器,实现无假设的开源世界泛视野分割。
Sebastian Schmidt, Julius Körner, Dominik Fuchsgruber 等