Bi'an: A Bilingual Benchmark and Model for Hallucination Detection in Retrieval-Augmented Generation
Bi'an框架结合双语基准和轻量级模型,有效检测RAG中的幻觉内容。
Zhouyu Jiang, Mengshu Sun, Zhiqiang Zhang 等
Bi'an框架结合双语基准和轻量级模型,有效检测RAG中的幻觉内容。
Zhouyu Jiang, Mengshu Sun, Zhiqiang Zhang 等
ConsJudge方法提高了RAG模型评估的一致性,提升了LLM的判断准确性。
Shuliang Liu, Xinze Li, Zhenghao Liu 等
提出自信度(Self-Certainty)指标,利用LLM输出概率分布实现无外部奖励模型的高效Best-of-N选择。
Zhewei Kang, Xuandong Zhao, Dawn Song
本文系统分析了利用大语言模型(LLMs)进行布局丰富文档信息提取的设计空间,提出LayIE-LLM测试套件,优化配置提升性能达37.5 F1点。
Gaye Colakoglu, Gürkan Solmaz, Jonathan Fürst
提出多模态大模型(MLLMs)在时间序列异常检测中的零样本能力,构建VisualTimeAnomaly基准,发现其在粗粒度异常检测中优于传统方法。
Xiongxiao Xu, Haoran Wang, Yueqing Liang 等
AutoLogi通过程序验证和可控难度生成逻辑谜题,评估大模型推理能力,性能从35%到73%。
Qin Zhu, Fei Huang, Runyu Peng 等
CODESYNC通过实时更新Python库API,提升大语言模型的代码同步能力。
Chenlong Wang, Zhaoyang Chu, Zhengxiang Cheng 等
提出CodeCriticBench,涵盖代码生成与问答,结合基础与细粒度评估,提升LLMs代码批评能力。
Alexander Zhang, Marcus Dong, Jiaheng Liu 等
ALFA框架通过属性分解、合成与偏好优化提升LLMs在临床问诊中的问答质量,诊断错误降低56.6%。
Shuyue Stella Li, Jimin Mun, Faeze Brahman 等
提出FUR框架,通过参数反向学习评估模型推理的忠实性,实验证明能有效识别关键推理步骤。
Martin Tutek, Fateme Hashemi Chaleshtori, Ana Marasović 等
提出HippoRAG 2,通过深度 Passage 集成和在线LLM优化,提升大模型的事实、感知与联想记忆性能,超越标准RAG 7%。
Bernal Jiménez Gutiérrez, Yiheng Shu, Weijian Qi 等
基于规则强化学习的Logic-RL模型,通过逻辑谜题训练,显著提升推理能力,能泛化至AIME和AMC等数学基准。
Tian Xie, Zitian Gao, Qingnan Ren 等
提出SUnsET数据集,提升长文本查询摘要的证据引用准确性。
Dustin Wright, Zain Muhammad Mujahid, Lu Wang 等
本研究提出基于教育评估的生成式MCQA改进方案,解决数据泄露、偏差和难度不足问题。
Nishant Balepur, Rachel Rudinger, Jordan Lee Boyd-Graber
通过监督链式推理提升长文本理解,GPT-4o-mini w/ PAI在Loong基准上提升20%。
Jingyang Lin, Andy Wong, Tian Xia 等
提出MeCo,通过元认知信号自适应调控大模型工具调用,显著提升效率与准确性。
Wenjun Li, Dexun Li, Kuicai Dong 等
本研究评估LLMs在真实数学定义自动形式化中的表现,提出Def_Wiki和Def_ArXiv数据集,结合外部反馈和定义基础策略提升性能。
Lan Zhang, Marco Valentino, Andre Freitas
探讨神经网络扩展的缩放法则,揭示模型大小与性能的关系。
Ayan Sengupta, Yash Goel, Tanmoy Chakraborty
LLM在医学中应用广泛,但仍需解决幻觉管理和多模态集成等问题。
Wenxuan Wang, Zizhan Ma, Zheng Wang 等
TituLLMs为孟加拉语设计的首个大规模预训练模型,包含1B和3B参数,基于扩展的Llama-3.2 tokenizer,采用37亿标记数据,显著优于多语种版本。
Shahriar Kabir Nahin, Rabindra Nath Nandi, Sagor Sarker 等