Geometric Uncertainty for Detecting and Correcting Hallucinations in LLMs
提出几何体积与悬疑指标,提升LLM幻觉检测与修正能力。
Edward Phillips, Sean Wu, Soheila Molaei 等
提出几何体积与悬疑指标,提升LLM幻觉检测与修正能力。
Edward Phillips, Sean Wu, Soheila Molaei 等
WebWeaver采用动态轮廓和双代理架构,有效提升开源深度研究的准确性和效率。
Zijian Li, Xin Guan, Bo Zhang 等
提出Agentic CPT方法,基于大规模多任务数据训练,显著提升深度研究型智能体性能,关键指标突破39.9%。
Liangcai Su, Zhen Zhang, Guangyu Li 等
WebResearcher通过迭代深度研究范式和WebFrontier数据引擎,实现长远推理能力突破,达成6项基准最优。
Zile Qiao, Guoxin Chen, Xuanzhong Chen 等
Conan-Embedding-v2为从零训练的1.4B参数大模型,结合跨语言数据,提出软掩码和动态硬负样本挖掘,实现SOTA文本嵌入性能。
Shiyu Li, Yang Tang, Ruijie Liu 等
利用线性判别分析识别模型中时态与体貌的正交方向,实现多词生成中的因果控制。
Alina Klerings, Jannik Brinkmann, Daniel Ruffinelli 等
AgenticIE系统在复杂法规文件中提取信息,EM得分提升16%。
Gaye Colakoglu, Gürkan Solmaz, Jonathan Fürst
提出一种基于LLM的社会模拟方法,通过重要性采样和最优传输生成与人口对齐的角色集。
Zhengyu Hu, Jianxun Lian, Zheyuan Xiao 等
FHIR-AgentBench评估LLM在HL7 FHIR标准下的EHR问答性能,揭示数据检索和推理挑战。
Gyubok Lee, Elea Bach, Eric Yang 等
提出CAI比率,用于无监督环境下评估LLMs的标注质量,模型选择效果显著。
Cheng Chen, Haiyan Yin, Ivor Tsang
DiverValue-Bench用于评估大语言模型与多元人类价值的对齐,揭示地理和人口差异。
Yao Liang, Dongcheng Zhao, Feifei Zhao 等
PersonaFuse框架通过个性激活提升人机交互,显著提高情感智能。
Yixuan Tang, Yi Yang, Ahmed Abbasi
本研究分析多智能体辩论中的失败模式,发现模型倾向于盲从和协同错误,导致性能下降。
Andrea Wynn, Harsh Satija, Gillian Hadfield
利用LLMs的配对比较和微调方法,提升社会科学中标量构念测量的准确性。
Hauke Licht, Rupak Sarkar, Patrick Y. Wu 等
DARLING框架通过结合语义分布式分类器,优化语言模型生成的多样性与质量,显著提升在创造性和验证性任务中的表现。
Tianjian Li, Yiming Zhang, Ping Yu 等
ConspirED数据集揭示阴谋论的认知特征,评估LLM安全性。
Luke Bates, Max Glockner, Preslav Nakov 等
DeepScholar-bench为生成性研究综述设计的实时基准,评估知识合成、检索质量与可验证性。
Liana Patel, Negar Arabzadeh, Harshit Gupta 等
提出T2R-bench,评估工业表格转报告的深度推理能力,模型表现仅达62.71%。
Jie Zhang, Changzai Pan, Kaiwen Wei 等
本研究评估LVLMs的知识边界感知,采用概率、答案一致性和口头信号,发现改进空间大。
Zhikai Ding, Shiyu Ni, Keping Bi
Pandora利用Python Pandas实现统一结构化知识推理,提升跨任务性能。
Yongrui Chen, Junhao He, Linbo Fu 等