Large Language Model based Multi-Agents: A Survey of Progress and Challenges
基于LLMs的多智能体系统通过合作、通信与能力演化实现复杂任务,关键算法包括DyLAN、ProAgent等。
Taicheng Guo, Xiuying Chen, Yaqi Wang 等
基于LLMs的多智能体系统通过合作、通信与能力演化实现复杂任务,关键算法包括DyLAN、ProAgent等。
Taicheng Guo, Xiuying Chen, Yaqi Wang 等
ChatQA通过两阶段指令调优和密集检索器,超越GPT-4在对话问答和RAG上的表现。
Zihan Liu, Wei Ping, Rajarshi Roy 等
提出自我奖励语言模型,通过迭代DPO训练,Llama 2 70B在AlpacaEval 2.0中超越Claude 2、Gemini Pro和GPT-4 0613。
Weizhe Yuan, Richard Yuanzhe Pang, Kyunghyun Cho 等
提出R-Judge基准,评估大模型在多场景下的安全风险识别能力,最佳模型达74.42%。
Tongxin Yuan, Zhiwei He, Lingzhong Dong 等
提出IQC方法生成MMIQC数据集,Qwen-72B-MMIQC在MATH基准上达45.0%准确率。
Haoxiong Liu, Yifan Zhang, Yifan Luo 等
提出对比偏好优化(CPO)提升7B/13B模型翻译性能,显著超越SFT,匹配GPT-4。
Haoran Xu, Amr Sharaf, Yunmo Chen 等
提出推测解码(Speculative Decoding)以提升大规模语言模型推理效率,结合draft-verify策略实现约5倍加速。
Heming Xia, Zhe Yang, Qingxiu Dong 等
利用大规模语言模型(GPT-3.5、GPT-4、DepGPT)结合深度学习和Transformer模型,精准检测孟加拉语社交媒体中的抑郁文本。
Ahmadul Karim Chowdhury, Md. Saidur Rahman Sujon, Md. Shirajus Salekin Shafi 等
提出桥接模型BGM,利用监督和强化学习优化检索器与LLMs的连接,显著提升问答和个性化生成性能。
Zixuan Ke, Weize Kong, Cheng Li 等
EASYTOOL通过提取工具文档核心信息,生成简洁统一的工具指令,提升LLM工具利用效率。
Siyu Yuan, Kaitao Song, Jiangjie Chen 等
调查NLP在方言数据集上的表现,提出改进方法。
Aditya Joshi, Raj Dabre, Diptesh Kanojia 等
提出DRFR指标和InFoBench基准,评估大模型指令遵循能力,显著提升评估可靠性。
Yiwei Qin, Kaiqiang Song, Yebowen Hu 等
提出Activation Beacon,通过逐步压缩激活实现长文本高效处理,压缩比最高达8倍。
Peitian Zhang, Zheng Liu, Shitao Xiao 等
GRAM方法在多页文档VQA中实现了73.68%的ANLS,提升了处理长序列的效率。
Tsachi Blau, Sharon Fogel, Roi Ronen 等
DeepSeek LLM通过扩展开源语言模型,67B模型在代码、数学和推理上超越LLaMA-2 70B。
DeepSeek-AI, :, Xiao Bi 等
TinyLlama以Llama 2架构训练1.1B模型,处理约3万亿token并超越同规模基线。
Peiyuan Zhang, Guangtao Zeng, Tianduo Wang 等
MosaicBERT结合FlashAttention、ALiBi、GLU等技术,极大提升预训练速度和效率,达成79.6分的GLUE表现。
Jacob Portes, Alex Trott, Sam Havens 等
提出时间向量,通过微调模型差异实现时间编码,改善特定时期文本表现。
Kai Nylund, Suchin Gururangan, Noah A. Smith
利用模型生成的特征工件(如Softmax、注意力、输入归因)提前检测事实问答中的幻觉,达AUROC最高0.80。
Ben Snyder, Marius Moisescu, Muhammad Bilal Zafar
RAG结合检索与生成,提升大模型知识准确性,关键技术包括索引、检索与增强。
Yunfan Gao, Yun Xiong, Xinyu Gao 等