Ragas: Automated Evaluation of Retrieval Augmented Generation
Ragas框架通过无参考指标评估RAG系统的保真性、相关性和上下文焦点。
Shahul Es, Jithin James, Luis Espinosa-Anke 等
Ragas框架通过无参考指标评估RAG系统的保真性、相关性和上下文焦点。
Shahul Es, Jithin James, Luis Espinosa-Anke 等
本研究评估了GPT-3.5、LLaMA-2-13b-chat和Claude-2在孟加拉语多任务零-shot性能,发现大部分任务表现不佳。
Mohsinul Kabir, Mohammed Saidul Islam, Md Tahmid Rahman Laskar 等
MINT通过多轮交互评估LLMs利用工具和自然语言反馈的能力,性能提升1-17%。
Xingyao Wang, Zihan Wang, Jiateng Liu 等
通过在LLaMA模型中加入3%安全示例,显著提高其安全性,同时保持其能力。
Federico Bianchi, Mirac Suzgun, Giuseppe Attanasio 等
提出C-Pack,包含C-MTEB、C-MTP和BGE,显著提升中文文本嵌入性能。
Shitao Xiao, Zheng Liu, Peitian Zhang 等
通过分析MLMs训练中的突变点,发现Syntactic Attention Structure(SAS)在语法学习中的关键作用,揭示训练动态中的相变。
Angelica Chen, Ravid Shwartz-Ziv, Kyunghyun Cho 等
SafetyBench评估大语言模型安全性,GPT-4表现优异。
Zhexin Zhang, Leqi Lei, Lindong Wu 等
MAmmoTH模型通过混合指令调优在数学推理上提升16%-32%。
Xiang Yue, Xingwei Qu, Ge Zhang 等
SignRound方法通过SignSGD优化LLM量化,2位精度提升6.91%-33.22%。
Wenhua Cheng, Weiwei Zhang, Haihao Shen 等
通过控制实验测量LLMs(GPT3和InstructGPT)对内容多样性的影响,发现InstructGPT显著降低内容多样性。
Vishakh Padmakumar, He He
MADLAD-400是涵盖419语言的手工审核多语种单语数据集,结合多阶段过滤提升质量。
Sneha Kudugunta, Isaac Caswell, Biao Zhang 等
本文通过提示依赖角度分析模型去毒化方法,比较反向微调与强化学习的影响。
Daniel Scalena, Gabriele Sarti, Malvina Nissim 等
RLAIF通过AI反馈替代人类反馈,性能与RLHF相当。
Harrison Lee, Samrat Phatale, Hassan Mansoor 等
LongBench是首个双语多任务长文本理解基准,涵盖21个数据集,平均长度6,711词,推动长上下文模型性能提升。
Yushi Bai, Xin Lv, Jiajie Zhang 等
提出SWIE和OVERMISS提升大模型翻译忠实度,显著改善BLEU和信任指标。
Yijie Chen, Yijin Liu, Fandong Meng 等
提出基于自我引导数据选择的Instruction-Following Difficulty (IFD)指标,显著提升LLM指令调优效率。
Ming Li, Yong Zhang, Zhitao Li 等
本研究分析大语言模型在多项选择题中对选项顺序敏感,发现性能差异达75%,提出校准策略改善鲁棒性。
Pouya Pezeshkpour, Estevam Hruschka
提出Graph of Thoughts(GoT)框架,通过图结构增强大模型推理能力,提升排序质量62%,降低成本31%。
Maciej Besta, Nils Blach, Ales Kubicek 等
提出RED-EVAL红队测试基准和STARLING安全对齐模型,利用Chain of Utterances提升LLM安全性,显著降低有害输出。
Rishabh Bhardwaj, Soujanya Poria
WizardMath结合Evol-Instruct和强化学习,显著提升大模型数学推理能力,超越多项开源和商业模型。
Haipeng Luo, Qingfeng Sun, Can Xu 等