APIGen-MT: Agentic Pipeline for Multi-Turn Data Generation via Simulated Agent-Human Interplay
APIGen-MT通过两阶段蓝图生成与模拟交互,提升多轮人机数据质量。
Akshara Prabhakar, Zuxin Liu, Ming Zhu 等
APIGen-MT通过两阶段蓝图生成与模拟交互,提升多轮人机数据质量。
Akshara Prabhakar, Zuxin Liu, Ming Zhu 等
提出KnowSelf实现语言模型的情境自我认知,结合两阶段训练提升规划表现。
Shuofei Qiao, Zhisong Qiu, Baochang Ren 等
提出SCUD4ICL,通过分解程序和对齐话语提升语义解析精度。
Mayank Kothyari, Sunita Sarawagi, Soumen Chakrabarti 等
AD-GPT结合Llama3和BERT,提升阿尔茨海默病相关信息检索的准确性。
Ziyu Liu, Lintao Tang, Zeliang Sun 等
HyperRAG利用KV缓存重用优化RAG中的reranker效率,实现2-3倍吞吐提升。
Yuwei An, Yihua Cheng, Seo Jin Park 等
MultiBLiMP 1.0利用自动化流程构建涵盖101语种的多语言最小对比语料库,评估大模型的形式语法能力。
Jaap Jumelet, Leonie Weissweiler, Joakim Nivre 等
本研究提出多层次记忆机制,结合文本、KV缓存、参数和隐藏状态,提升大模型长时记忆能力。
Lianlei Shan, Shixian Luo, Zezhou Zhu 等
利用大规模语言模型(如GPT-4)通过提示和微调提升机器翻译性能,特别关注低资源语言和多文档场景。
Baban Gain, Dibyanayan Bandyopadhyay, Asif Ekbal 等
InfiniteICL通过长短期记忆转换突破上下文窗口限制,实现上下文长度减少90%,性能提升103%。
Bowen Cao, Deng Cai, Wai Lam
提出Causal Intervened Likelihood(CIL)评估未来预测的可推断性,构建PROPHET基准。
Zhengwei Tao, Pu Wu, Zhi Jin 等
BoundlessBPE打破预分词瓶颈,bytes/token最高提升15%。
Craig W. Schmidt, Varshini Reddy, Chris Tanner 等
提出四维框架系统分析TTS方法,包括“何时、如何、何地、效果”,推动LLMs推理能力提升。
Qiyuan Zhang, Fuyuan Lyu, Zexu Sun 等
JudgeLRM通过强化学习激活推理能力,超越SFT模型,7B/8B模型F1超GPT-4。
Nuo Chen, Zhiyuan Hu, Qingyun Zou 等
提出基于方法论的LLM智能体体系结构,涵盖构建、协作与演化,推动人工通用智能发展。
Junyu Luo, Weizhi Zhang, Ye Yuan 等
提出R-PRM,通过强模型生成种子数据和偏好优化,显著提升数学推理步骤评估准确率,F1提升11.9点。
Shuaijie She, Junxiao Liu, Yifeng Liu 等
使用Llama-3.1-8B模型,73%的回答高度相关,召回率达100%。
Julia Ive, Felix Jozsa, Nick Jackson 等
Gemma 3引入多模态、长上下文(128K tokens)和视觉理解,采用改进架构和蒸馏训练,性能优于Gemma 2。
Gemma Team, Aishwarya Kamath, Johan Ferret 等
AdaptiVocab通过轻量化词汇调整,减少25%以上的标记数,提升低资源领域LLM效率。
Itay Nakash, Nitay Calderon, Eyal Ben David 等
本论文提出“JudgeAnything”基准,利用多模态大模型(MLLM)作为跨模态评估工具,涵盖15类任务,评估模型理解与生成能力,显示其在MMU表现优异,但在MMG方面仍存偏差。
Shu Pu, Yaochen Wang, Dongping Chen 等
提出多策略优化大语言模型推理效率,包括模型剪枝、输出控制和输入提示,显著减少冗余步骤。
Yang Sui, Yu-Neng Chuang, Guanchu Wang 等