Retrieval Improvements Do Not Guarantee Better Answers: A Study of RAG for AI Policy QA
研究发现,RAG系统的检索改进未必提升问答性能,尤其在AI政策分析中。
Saahil Mathur, Ryan David Rittner, Vedant Ajit Thakur 等
研究发现,RAG系统的检索改进未必提升问答性能,尤其在AI政策分析中。
Saahil Mathur, Ryan David Rittner, Vedant Ajit Thakur 等
MARCH框架通过多智能体强化自检显著减少LLM幻觉,提升8B参数模型的事实一致性。
Zhuo Li, Yupeng Zhang, Pengyu Cheng 等
EndoVGGT通过DeGAT模块提升手术3D重建的深度估计,PSNR提高24.6%,SSIM提高9.1%。
Falong Fan, Yi Xie, Arnis Lektauers 等
Chameleon通过几何基础的多模态记忆增强机器人操控,提升长时间任务的决策可靠性。
Xinying Guo, Chenxi Jiang, Hyun Bin Kim 等
VFIG利用视觉-语言模型将复杂图形转换为SVG,VLM-Judge得分0.829。
Qijia He, Xunmei Liu, Hammaad Memon 等
UI-Voyager采用RFT和GRSD,提升4B模型在AndroidWorld的成功率至81%,超越人类水平。
Zichuan Lin, Feiyu Liu, Yijun Yang 等
自蒸馏在数学推理中可能降低LLM性能,因抑制不确定性表达。
Jeonghye Kim, Xufang Luo, Minbeom Kim 等
基于Transformer的深度强化学习策略解决开放式作业调度问题,平均解优差15%。
Faezeh Ardali, Mwembezi A. Nyelele, Gerald M. Knapp
提出简洁稳定的流匹配生成模型,规模扩大两倍,FID提升两倍,结合分子嵌入实现未见分子模拟。
Charles Jones, Emmanuel Noutahi, Jason Hartford 等
ArrayDPS-Refine利用扩散模型无训练提升多通道语音增强效果,改善非线性失真。
Zhongweiyang Xu, Ashutosh Pandey, Juan Azcarreta 等
提出基于PSTO的去中心化端到端多无人机追捕框架,利用LiDAR直接映射控制,显著提升效率。
Yude Li, Zhexuan Zhou, Huizhe Li 等
UniScale结合数据扩展与模型架构优化,提升搜索排名性能。
Liren Yu, Caiyuan Li, Feiyi Dong 等
Realiz3D通过域感知学习,分离控制信号与视觉域,实现逼真且3D一致的图像生成。
Ido Sobol, Kihyuk Sohn, Yoav Blum 等
提出KG-M3PO框架,通过知识图增强多任务强化学习,在部分可观测环境中显著提升操控效率与泛化能力。
Aditya Narendra, Mukhammadrizo Maribjonov, Dmitry Makarov 等
HEAR框架通过语义切片和多层推理生成同理心和法律意识的无障碍问题报告,提升修复效率。
Ryoya Koyama, Zhiyao Wang, Devi Karolita 等
Echoes数据集通过语义对齐提高音乐深度伪造检测的泛化性能。
Octavian Pascu, Dan Oneata, Horia Cucu 等
MedObvious通过临床分诊揭示VLMs中的医疗Moravec悖论,提出1880项任务基准测试。
Ufaq Khan, Umair Nawaz, L D M S S Teja 等
UniGRPO通过GRPO优化文本和图像生成策略,提升推理驱动的视觉生成质量。
Jie Liu, Zilyu Ye, Linxiao Yuan 等
DA-Flow结合扩散模型与卷积特征,显著提升退化视频的光流估计精度。
Jaewon Min, Jaeeun Lee, Yeji Choi 等
WildWorld数据集提供了450多种动作和显式状态注释,支持生成式ARPG的动态世界建模。
Zhen Li, Zian Meng, Shuwei Shi 等