A Troublemaker with Contagious Jailbreak Makes Chaos in Honest Towns
提出TMCHT任务与ARCJ方法,有效攻击多代理系统,提升成功率达52.93%。
Tianyi Men, Pengfei Cao, Zhuoran Jin 等
提出TMCHT任务与ARCJ方法,有效攻击多代理系统,提升成功率达52.93%。
Tianyi Men, Pengfei Cao, Zhuoran Jin 等
通过三项实验评估大模型对论元角色的敏感性,发现模型能区分合理与不合理的动词,但缺乏人类的选择性模式。
Eun-Kyoung Rosa Lee, Sathvik Nair, Naomi Feldman
通过蕴涵调优提升密集段落检索,实验显示在NQ数据集上提高3%。
Lu Dai, Hao Liu, Hui Xiong
MiCEval提出多模态链式推理评价框架,基于描述和推理步骤的自动化评估,显著优于现有方法。
Xiongtao Zhou, Jie He, Lanyu Chen 等
GenEOL利用LLMs生成多样句子变换,通过平均增强语义表示,显著优于现有无训练句向量方法。
Raghuveer Thirukovalluru, Bhuwan Dhingra
统一框架系统比较LCKV、YOCO与CLA:KV缓存减半时多数配置兼顾速度与性能。
You Wu, Haoyi Wu, Kewei Tu
提出MemTree,采用动态树状记忆结构,显著提升长时记忆管理,适用于多轮对话与文档问答。
Alireza Rezazadeh, Zichao Li, Wei Wei 等
本研究采用统一的检索增强生成(RAG)框架,评估了24个多语言大模型在印度患者医疗问答中的表现,重点关注事实正确性和文化适应性。
Varun Gumma, Ananditha Raghunath, Mohit Jain 等
OpenAI的o1模型在数学、编码等推理任务中表现最佳,使用Test-time Compute方法。
Siwei Wu, Zhongyuan Peng, Xinrun Du 等
提出DeCo动态校正解码方法,有效降低多模态大语言模型的幻觉率。
Chenxi Wang, Xiang Chen, Ningyu Zhang 等
Li和 Zhou发现MoE大模型的路由权重(RW)可作为无需微调的优质嵌入,结合HS提升性能。
Ziyue Li, Tianyi Zhou
FlatQuant通过可学习的仿射变换显著提升LLM量化的平坦性,达成W4A4精度误差<1%。
Yuxuan Sun, Ruikang Liu, Haoli Bai 等
提出EGAD扩展Longformer,通过关键词检测增强长距离全局注意力,提升摘要性能。
Evan Lucas, Dylan Kangas, Timothy C Havens
DRAFT框架通过自我反馈优化工具文档,提升LLMs理解与利用能力。
Changle Qu, Sunhao Dai, Xiaochi Wei 等
Herald:通过双重增强策略将Mathlib4翻译为自然语言,提升LLM在数学推理中的表现。
Guoxiong Gao, Yutong Wang, Jiedong Jiang 等
TorchTitan实现4D并行,优化Llama 3.1训练,提升65.08%的速度。
Wanchao Liang, Tianyu Liu, Less Wright 等
提出MoLAS和AgentSquare,通过模块演化和重组优化LLM代理,性能提升17.2%。
Yu Shang, Yu Li, Keyu Zhao 等
Casablanca构建了涵盖8个阿拉伯方言的多层次标注语音数据集,评估多语种模型性能。
Bashar Talafha, Karima Kadaoui, Samar Mohamed Magdy 等
MetricX-24结合多阶段训练与合成数据,提升翻译评估准确性,显著优于MetricX-23。
Juraj Juraska, Daniel Deutsch, Mara Finkelstein 等
X-ALMA采用插件模块与自适应拒绝优化,确保50语种高质量翻译。
Haoran Xu, Kenton Murray, Philipp Koehn 等