DynamicRAG: Leveraging Outputs of Large Language Model as Feedback for Dynamic Reranking in Retrieval-Augmented Generation
DynamicRAG通过强化学习动态调整文档排序与数量,提升知识问答性能。
Jiashuo Sun, Xianrui Zhong, Sizhe Zhou 等
DynamicRAG通过强化学习动态调整文档排序与数量,提升知识问答性能。
Jiashuo Sun, Xianrui Zhong, Sizhe Zhou 等
SparseMeXT通过优化稀疏表示,实现HD地图构建的高效性和准确性,mAP达到68.9%。
Anqing Jiang, Jinhao Chai, Yu Gao 等
本研究系统分析了预训练与微调在密集检索中的知识获取,验证了微调主要调整激活而非重组知识。
Zheng Yao, Shuai Wang, Guido Zuccon
Seed1.5-VL结合532M视觉编码器与20B参数Mixture-of-Experts实现多模态理解,达38项SOTA。
Dong Guo, Faming Wu, Feida Zhu 等
提出衡量干扰效应的指标,通过生成和检索硬干扰句改善RAG性能,提升答案准确率7.5%。
Chen Amiraz, Florin Cuconasu, Simone Filice 等
提出基于稀疏概念层的ViT符号规则提取,准确率提升5.14%。
Parth Padalkar, Gopal Gupta
提出配对自编码器框架,用于逆问题,结合数据驱动与模型基础,提升重建质量。
Matthias Chung, Bas Peters, Michael Solomon
使用Toxic-BERT和LlavaGuard过滤LLaVA数据集,去除7,531个有毒图文对。
Karthik Reddy Kanjula, Surya Guthikonda, Nahid Alam 等
基于Anymate数据集,提出三阶段自动绑定模型,显著提升3D物体绑定准确率。
Yufan Deng, Yuhao Zhang, Chen Geng 等
Moosbauer-Poole算法优化矩阵乘法,5x5矩阵仅需93次乘法。
Manuel Kauers, Isaac Wood
GPT-Image模型用于图像修复,提升视觉质量但缺乏像素级结构保真。
Hao Yang, Yan Yang, Ruikun Zhang 等
BrickGPT利用大规模稳定数据集和物理约束,从文本生成稳定可建的积木结构模型。
Ava Pun, Kangle Deng, Ruixuan Liu 等
提出clem:todd框架,通过多模型、多任务评测LLM任务导向对话系统,涵盖多架构和数据集,提供系统性性能分析。
Chalamalasetti Kranti, Sherzod Hakimov, David Schlangen
FG-CLIP通过生成16亿长描述、构建12百万图像区域标注和引入1000万难负样本,显著提升细粒度视觉文本对齐。
Chunyu Xie, Bin Wang, Fanjing Kong 等
评估九个大语言模型在孟加拉语健康问答摘要中的零-shot性能,Mixtral表现优异。
Ajwad Abrar, Farzana Tabassum, Sabbir Ahmed
提出集成实时运动-接触规划与跟踪的模型驱动多指手内操控框架,提升鲁棒性与精度。
Yongpeng Jiang, Mingrui Yu, Xinghao Zhu 等
DenseGrounding通过HSSE和LSE模块提升视觉和文本语义,显著提高自中心3D视觉定位准确率,整体提升5.81%。
Henry Zheng, Hao Shi, Qihang Peng 等
提出四阶段发展路线图,涵盖模块化到原生多模态推理,强调N-LMRMs未来潜力。
Yunxin Li, Zhenyu Liu, Zitao Li 等
VLA模型融合视觉、语言与动作,提升机器人自主理解与操作能力。
Ranjan Sapkota, Yang Cao, Konstantinos I. Roumeliotis 等
ZeroSearch通过模拟搜索提升LLM的搜索能力,14B模型超越真实搜索引擎。
Hao Sun, Zile Qiao, Jiayan Guo 等