Flames: Benchmarking Value Alignment of LLMs in Chinese
提出FLAMES基准,评估17个主流中文LLM的价值对齐,表现普遍较差。
Kexin Huang, Xiangyang Liu, Qianyu Guo 等
提出FLAMES基准,评估17个主流中文LLM的价值对齐,表现普遍较差。
Kexin Huang, Xiangyang Liu, Qianyu Guo 等
提出LRP2模块,显著提高多语言模型的事实知识检索准确率。
Shaoyang Xu, Junzhuo Li, Deyi Xiong
提出DARE方法,无需再训练即可融合同源模型参数,提升大规模语言模型能力。
Le Yu, Bowen Yu, Haiyang Yu 等
本研究通过对BERTScore、BLEURT和COMET的对抗攻击,揭示其在高质量翻译中的脆弱性,提出增强鲁棒性的方法。
Yichen Huang, Timothy Baldwin
ChipNeMo通过领域自适应预训练和指令微调提升芯片设计相关任务性能。
Mingjie Liu, Teodor-Dumitru Ene, Robert Kirby 等
提出FollowBench,基于多层细粒度约束的评测框架,评估13个主流大模型的指令遵循能力,涵盖五类约束,揭示模型在复杂指令下的不足。
Yuxin Jiang, Yufei Wang, Xingshan Zeng 等
提出凸函数训练目标,提升文本生成模型的输出集中性,改善自动回归和非自动回归模型性能。
Chenze Shao, Zhengrui Ma, Min Zhang 等
提出MIN-K% PROB,无需训练即可检测大模型预训练数据,提升7.4%。
Weijia Shi, Anirudh Ajith, Mengzhou Xia 等
提出DP-Prompt,结合预训练大模型和零样本提示,有效降低文本去匿名化成功率,提升隐私保护。
Saiteja Utpala, Sara Hooker, Pin Yu Chen
MuSR利用神经符号合成生成复杂多步软推理任务,挑战GPT-4等模型。
Zayne Sprague, Xi Ye, Kaj Bostrom 等
提出信息价值指标,基于神经生成模型测量话语预测性,优于传统困惑度,能解释人类理解行为。
Mario Giulianelli, Sarenne Wallbridge, Raquel Fernández
AgentTuning提升LLM的通用代理能力,AgentLM-70B在未见任务上与GPT-3.5-turbo相当。
Aohan Zeng, Mingdao Liu, Rui Lu 等
本研究利用可解释性方法分析指令微调模型中的性别偏见,提出少样本引导去偏策略,显著改善翻译中的性别公平。
Giuseppe Attanasio, Flor Miriam Plaza-del-Arco, Debora Nozza 等
SPEED通过推测执行加速Transformer解码,显著减少延迟。
Coleman Hooper, Sehoon Kim, Hiva Mohammadzadeh 等
Self-RAG通过自我反思实现检索、生成与批评,显著提升事实准确性和多样性。
Akari Asai, Zeqiu Wu, Yizhong Wang 等
NeMo Guardrails工具包通过可编程轨道实现LLM应用的可控性和安全性。
Traian Rebedea, Razvan Dinu, Makesh Sreedhar 等
CLIN利用持续记忆和因果抽象实现无参数更新的任务快速适应与迁移,性能超越SOTA。
Bodhisattwa Prasad Majumder, Bhavana Dalvi Mishra, Peter Jansen 等
提出衡量大模型偏好冗长回答的指标,发现GPT-4偏好更长答案。
Keita Saito, Akifumi Wachi, Koki Wataoka 等
大语言模型遗忘技术,通过梯度上升减少不良行为,计算效率高。
Yuanshun Yao, Xiaojun Xu, Yang Liu
本研究分析了大规模语言模型生成推荐信中的性别偏见,采用偏差内容和风格指标,发现ChatGPT和Alpaca存在显著偏差。
Yixin Wan, George Pu, Jiao Sun 等