GroundingSuite: Measuring Complex Multi-Granular Pixel Grounding
GroundingSuite通过自动标注和大规模数据集提升像素级多粒度目标定位性能,达成68.9的cIoU。
Rui Hu, Lianghui Zhu, Yuxuan Zhang 等
GroundingSuite通过自动标注和大规模数据集提升像素级多粒度目标定位性能,达成68.9的cIoU。
Rui Hu, Lianghui Zhu, Yuxuan Zhang 等
CameraCtrl II通过摄像机控制的视频扩散模型实现大规模动态场景探索,提升视角范围和场景连续性。
Hao He, Ceyuan Yang, Shanchuan Lin 等
提出长时上下文调优(LCT),扩展视频扩散模型的上下文窗口,实现场景级一致性,支持多镜头生成。
Yuwei Guo, Ceyuan Yang, Ziyan Yang 等
CINEMA利用MLLM生成多主体一致视频,提升视频连贯性和主体一致性。
Yufan Deng, Xun Guo, Yizhi Wang 等
VicaSplat通过单次运行实现从无姿态视频帧中重建3D高斯和相机估计,性能优于基线。
Zhiqi Li, Chengrui Dong, Yiming Chen 等
IMPACT框架通过视觉语言模型实现接触丰富的运动规划,成功率达73.75%。
Yiyang Ling, Karan Owalekar, Oluwatobiloba Adesanya 等
提出MoC框架结合边界清晰与粘连性指标,提升文本分块质量与RAG性能。
Jihao Zhao, Zhiyuan Ji, Zhaoxin Fan 等
提出“计划与行动”框架,结合合成数据增强,显著提升长远任务中的规划能力。
Lutfi Eren Erdogan, Nicholas Lee, Sehoon Kim 等
Search-R1通过强化学习使大模型自主生成多轮搜索查询,提升问答性能41%。
Bowen Jin, Hansi Zeng, Zhenrui Yue 等
Týr-剪枝通过全局稀疏分布优化实现大规模语言模型结构剪枝,保留97%性能,剪除50%参数。
Guanchen Li, Yixing Xu, Zeping Li 等
UniCombine基于Diffusion Transformer,提出多条件融合机制,提升多模态图像生成的控制能力,实验显示优越性能。
Haoxuan Wang, Jinlong Peng, Qingdong He 等
Reangle-A-Video通过视频到视频翻译生成多视角视频,超越现有方法。
Hyeonho Jeong, Suhyeon Lee, Jong Chul Ye
LocAgent通过图结构表示和多跳推理,提升代码定位准确率至92.7%,成本降低86%。
Zhaoling Chen, Xiangru Tang, Gangda Deng 等
SeqMultiGrasp系统利用扩散模型实现多指灵巧手的多物体抓取,模拟成功率65.8%。
Sicheng He, Zeyu Shangguan, Kuanning Wang 等
提出CycleVAE与人类行为Transformer实现跨形体机器人操控,生成平滑轨迹。
Apan Dastider, Hao Fang, Mingjie Lin
提出GoAI构建AI研究知识图谱,利用路径规划支持个性化学习与创新。
Xian Gao, Zongyun Zhang, Ting Liu 等
本论文提出RexSeek模型,结合多模态大语言模型与目标检测,实现对多个人物的自然语言指示识别,基于HumanRef数据集,显著优于现有模型。
Qing Jiang, Lin Wu, Zhaoyang Zeng 等
OpenRAG通过端到端调优检索器,提升RAG性能4.0%,超越SOTA检索器2.1%。
Jiawei Zhou, Lei Chen
ArticulatedGS利用自监督学习,通过多视角RGB图像,结合3D高斯点云实现关节物体的部分级重建与运动参数估计。
Junfu Guo, Yu Xin, Gaoyi Liu 等
提出知识导向的检索增强生成(RAG)框架,强调知识生命周期管理。
Mingyue Cheng, Yucong Luo, Jie Ouyang 等