Goldfish: Monolingual Language Models for 350 Languages
提出Goldfish系列单语模型,针对350种低资源语言,参数为125M,显著优于多语模型在困惑度和语法任务中的表现。
Tyler A. Chang, Catherine Arnett, Zhuowen Tu 等
提出Goldfish系列单语模型,针对350种低资源语言,参数为125M,显著优于多语模型在困惑度和语法任务中的表现。
Tyler A. Chang, Catherine Arnett, Zhuowen Tu 等
Anim-Director利用GPT-4驱动多模态模型,实现动画视频的自动化生成与控制。
Yunxin Li, Haoyuan Shi, Baotian Hu 等
ConVerSum利用对比学习在无大规模数据条件下实现跨语言摘要,显著优于现有方法。
Sanzana Karim Lora, M. Sohel Rahman, Rifat Shahriyar
Math-PUMA以692K对齐样本和三阶段训练缩小数学图文推理差距。
Wenwen Zhuang, Xin Huang, Xiantao Zhang 等
提出OpenEP任务与OpenEPBench数据集,结合StkFEP框架进行开放式未来事件预测,利用多角度、多样化结果实现更真实场景模拟。
Yong Guan, Hao Peng, Xiaozhi Wang 等
提出Speculative Diffusion Decoding(SpecDiff),结合离散扩散模型实现语言生成的7.2倍加速。
Jacob K Christopher, Brian R Bartoldson, Tal Ben-Nun 等
SWIFT为大模型微调提供支持,支持550+ LLM和200+ MLLM,集成多种训练技术。
Yuze Zhao, Jintao Huang, Jinghan Hu 等
提出多智能体LLM框架自动生成数据故事,涵盖1494个真实案例。
Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Md Rizwan Parvez 等
ToolSandbox是一种支持状态保持和对话交互的LLM工具使用评估基准,涵盖隐式状态依赖和动态里程碑。
Jiarui Lu, Thomas Holleis, Yizhe Zhang 等
通过微调小模型,提升其在心智理论任务中的表现,达到大模型的46%对齐度。
Nunzio Lore, Sepehr Ilami, Babak Heydari
研究发现多模态大语言模型在GUI环境中易受环境干扰,影响其忠实性。
Xinbei Ma, Yiting Wang, Yao Yao 等
本研究比较GPT-4、Llama 2和Gemini在低资源语言中的零样本性能,发现英语优越。
Md. Arid Hasan, Prerona Tarannum, Krishno Dey 等
通过负注意力分数对齐方法,减少大型语言模型中的负偏差,提升准确率和召回率。
Sangwon Yu, Jongyoon Song, Bongkyu Hwang 等
提出Meta-Reward机制,利用模型自评自我提升,显著改善Llama-3-8B-Instruct在指令遵循和判断能力上的表现。
Tianhao Wu, Weizhe Yuan, Olga Golovneva 等
本研究比较RAG与长上下文LLMs,提出Self-Route实现成本优化,性能接近长上下文模型。
Zhuowan Li, Cheng Li, Mingyang Zhang 等
提出三种方法预测LLMs最优词汇规模,发现大模型需配备更大词汇。
Chaofan Tao, Qian Liu, Longxu Dou 等
提出LMMS-EVAL、LMMS-EVAL LITE与LIVEBENCH,覆盖50+任务,解决多模模型评估中的三难困境。
Kaichen Zhang, Bo Li, Peiyuan Zhang 等
Case2Code任务通过大规模合成数据提升代码生成性能。
Yunfan Shao, Linyang Li, Yichuan Ma 等
NeedleBench框架评估LLM在不同信息密度下的检索与推理能力,揭示模型在信息稠密任务中的不足。
Mo Li, Songyang Zhang, Taolin Zhang 等
论文以MidEast-TE-mini评测图、文及混合LLM预测,发现GPT-4抽取事件达72.6%,文本微调和RAG最有潜力。
He Chang, Chenchen Ye, Zhulin Tao 等