TituLLMs: A Family of Bangla LLMs with Comprehensive Benchmarking

TL;DR

TituLLMs为孟加拉语设计的首个大规模预训练模型,包含1B和3B参数,基于扩展的Llama-3.2 tokenizer,采用37亿标记数据,显著优于多语种版本。

cs.CL 🔴 高级 2025-02-17 57 次浏览
Shahriar Kabir Nahin Rabindra Nath Nandi Sagor Sarker Quazi Sarwar Muhtaseem Md Kowsher Apu Chandraw Shill Md Ibrahim Mehadi Hasan Menon Tareq Al Muntasir Firoj Alam
自然语言处理 低资源语言 大规模预训练 模型微调 语料库构建

核心发现

方法论

本研究采用扩展的Llama-3.2 tokenizer,结合多源数据(网页、书籍、合成数据)进行预训练,构建了约37亿标记的语料库。通过逐步增加词汇表规模(从32K到96K)优化词汇扩展,结合持续预训练和指令微调提升模型能力。开发了五个基准数据集,涵盖世界知识、常识推理和阅读理解,采用多任务评估模型性能。模型训练在LlamaFactory平台上进行,使用4096长度上下文,训练一轮耗时1750H100 GPU小时。模型在多项低资源任务中优于多语种版本,特别是在常识推理方面表现突出。

关键结果

  • TituLLMs-3B在Bangla MMLU任务中0-shot得分为0.25,表现优于原始多语种模型,且在常识问答(BoolQ)中达到0.53的准确率。基准测试显示,模型在世界知识和推理任务中表现出色,尤其在推理任务(如PIQA)中达0.60,显示出良好的语言特定推理能力。
  • 通过扩展词汇表,模型词汇效率显著提升,TPW(每词Token数)从原始的高值降低至更合理范围,增强了模型的理解和推理能力。合成数据(如翻译、转写)在补充低资源语料方面发挥关键作用,显著改善了模型在低资源环境下的表现。
  • 模型在多个基准任务中表现优异,但在世界知识(如Bangla MMLU)方面仍存在不足,提示未来需结合更大规模、多样化数据进行强化训练。

研究意义

本研究填补了孟加拉语大规模预训练模型的空白,为低资源语言的NLP研究提供了范例。通过扩展多语种模型的词汇和持续预训练策略,有望推动类似低资源语言模型的快速发展,促进本地化应用的普及。模型的公开发布降低了研究门槛,为学术界和产业界提供了宝贵资源,有望改善孟加拉语在AI中的代表性和应用能力,推动多语言AI生态系统的多样化发展。

技术贡献

本研究提出了基于扩展词汇表和持续预训练的低资源语言模型微调策略,创新性地结合了文化特定知识的词汇扩展和合成数据生成技术。通过对Llama-3.2模型的结构调整和多源数据融合,有效提升了模型在孟加拉语环境下的表现。开发了五个专用基准数据集,涵盖多维度任务,推动了低资源语言模型的评估体系建立。模型训练流程优化和数据采集方法为未来低资源语言模型的快速部署提供了技术基础。

新颖性

本研究首次系统性地为孟加拉语构建大规模预训练模型,采用扩展的Llama-3.2 tokenizer结合多源合成数据,突破了低资源语料限制。提出了表达语义翻译(EST)技术用于高质量基准数据生成,显著提升了模型在本土任务中的表现。这在低资源语言模型研究中尚属首次,展示了文化语料扩展和合成数据结合的创新路径。

局限性

  • 模型训练仅用一轮(37亿标记),未充分捕获完整知识体系,导致在某些知识任务表现有限。
  • 训练数据虽多样,但仍受限于数字内容稀缺,影响模型在世界知识方面的泛化能力。
  • 模型在长文本推理和复杂推理任务中表现尚有提升空间,未来需多轮微调和更大规模数据支撑。

未来方向

未来将通过多轮微调和引入更大规模、多样化的语料库,提升模型的知识深度和推理能力。计划结合多模态数据(如图像、音频)扩展模型能力,推动多模态多语言模型的发展。此外,将探索跨语言迁移和多任务微调策略,以增强模型在多语言环境中的适应性和鲁棒性。

AI 总览摘要

随着大规模预训练模型(LLMs)在自然语言处理中的广泛应用,低资源语言的研究逐渐成为焦点。孟加拉语作为南亚重要语言,数字内容稀缺,限制了其在AI中的应用。本研究提出了TituLLMs,首个专为孟加拉语设计的预训练模型,参数规模涵盖1B和3B,基于扩展的Llama-3.2 tokenizer,结合多源数据(网页、书籍、合成数据)进行训练,构建了约37亿标记的语料库。通过逐步扩展词汇表(从32K到96K)优化词汇效率,显著提升模型理解能力。我们开发了五个专用基准数据集,涵盖世界知识、常识推理和阅读理解,全面评估模型性能。实验结果显示,TituLLMs在多项任务中优于原始多语种模型,尤其在推理和常识任务中表现突出,验证了文化特定词汇扩展和合成数据的重要性。模型训练在LlamaFactory平台上完成,训练时间合理,模型参数调整充分,展现出良好的迁移和微调潜力。该研究不仅丰富了低资源语言的NLP工具箱,也为未来多语言、多模态模型的研究提供了技术基础。模型和数据集已公开发布,期待推动孟加拉语及其他低资源语言的AI应用发展。

深度分析

研究背景

近年来,随着Transformer架构的普及,大规模预训练模型(如GPT、BERT、Llama)极大推动了NLP的发展。这些模型在英语等高资源语言中表现优异,但低资源语言如孟加拉语仍面临数据匮乏、语料有限等挑战。此前研究多集中在多语种模型的迁移学习(如mBERT、XLM-R),但在特定低资源语种上效果有限。Zehady等(2024)利用Llama在孟加拉语新闻语料上微调,取得一定成果,但语料规模较小(12.4M新闻文章),且缺乏系统性评估。本研究旨在突破数据瓶颈,通过多源数据采集、合成技术和词汇扩展,构建适合孟加拉语的预训练模型,填补该领域空白。

核心问题

孟加拉语作为低资源语言,数字化内容稀缺,限制了大规模预训练模型的构建。现有模型多依赖迁移学习,效果有限,难以满足本土化需求。缺乏专门的基准数据集,难以全面评估模型能力。此外,词汇表限制和文化知识缺失也影响模型理解和生成能力。如何在有限数据条件下,构建高效、文化适应性强的模型,成为亟待解决的核心问题。

核心创新

本研究的创新点包括:1)扩展Llama-3.2 tokenizer,显著提升词汇效率,减少序列长度;2)结合多源数据(网页、书籍、合成)构建庞大语料库,突破低资源瓶颈;3)提出表达语义翻译(EST)技术,生成高质量基准数据,提升模型评估的可靠性;4)开发五个多任务基准,涵盖知识和推理,系统评估模型能力。这些创新共同推动低资源语言模型的实用化和文化适应性。

方法详解

  • �� 数据采集:利用Amazon Athena筛选Common Crawl中的孟加拉网页,结合网页清洗、去重、过滤技术,获得高质量网页文本。
  • �� 书籍处理:采集公开孟加拉语书籍,采用Google OCR和Tesseract识别技术,结合文档分割模型筛选文本。
  • �� 合成数据:收集口语转写、翻译(利用NLLB模型)、转写和对话数据,丰富训练语料。
  • �� 词汇扩展:训练多种词汇表(从32K到96K),融合到Llama-3.2模型中,优化词汇效率。
  • �� 模型预训练:在LlamaFactory平台上,使用4096上下文长度,训练参数调整后进行一轮训练,结合合成和真实数据微调。
  • �� 基准评估:设计五个多任务数据集(如Bangla MMLU、BoolQ、CommonsenseQA等),采用准确率指标,进行模型性能评估。

实验设计

采用五个基准数据集,涵盖教育、常识、世界知识等任务,评估模型的理解和推理能力。模型在不同参数规模(1B、3B)下进行训练和测试,比较不同词汇表规模的影响。采用0-shot和few-shot设置,分析模型迁移能力。对比多种模型(如Llama-3.2、Qwen、Gemma),验证TituLLMs的优越性。实验还包括词汇扩展对模型性能的影响分析,以及合成数据对知识掌握的贡献。

结果分析

TituLLMs-3B在Bangla MMLU任务中0-shot得分为0.25,优于原多语种模型,且在常识问答(BoolQ)中达0.53。推理任务(PIQA)得分达0.60,显示出良好的推理能力。词汇扩展显著降低TPW,提高理解效率。合成数据(翻译、转写)增强模型在低资源环境下的表现。模型在多项任务中表现优异,但在世界知识方面仍有提升空间,提示未来需多轮微调。

应用场景

模型可应用于孟加拉语的自动问答、文本生成、翻译和教育辅助等场景。其文化适应性强,适合本土化内容开发。未来可结合多模态数据,推动多语言、多模态AI应用,改善孟加拉语在AI中的代表性。

局限与展望

模型训练仅一轮,知识覆盖有限,难以应对复杂推理和长文本任务。数据来源受限于数字内容稀缺,影响知识深度。未来需引入更大规模、多样化数据,进行多轮微调和多模态融合,提升模型能力。

通俗解读 非专业人士也能看懂

想象你在一家工厂里,工厂里有很多工人(模型),他们需要学习如何制造各种产品(理解和生成语言)。如果工厂只有少量的工具和材料(数据),工人们就很难学会所有的技能。这个研究就像给工厂带来了新工具和新材料,让工人们可以更快学会孟加拉语的各种技能。通过不断练习和改进工具,工人们变得更聪明、更懂得文化和习俗,能帮人们写文章、回答问题,就像一个懂得很多的助手一样。这些工人还学会了用不同的语言交流(翻译、转写),让工厂的产品更丰富、更贴近实际需求。最终,这个工厂的工人们变得更厉害,也让孟加拉语的应用变得更广泛,大家都能用上这些新工具。

简单解释 像给14岁少年讲一样

想象你在学校里学习新东西,但你只知道一些基础知识,没有很多书可以帮你学习。这个研究就像是给你带来了很多新书和学习工具,让你能更快理解孟加拉语。科学家们用特别的方法,把不同的资料(网页、书、对话、翻译)整理在一起,像拼拼图一样,把所有信息都放到一个大脑里。然后,他们用这些资料训练一个超级聪明的机器人,让它学会读、写、理解孟加拉语。这个机器人还学会了用孟加拉语翻译成英语,或者用英语翻译成孟加拉语,就像你用翻译软件一样。它还能回答各种问题,比如“孟加拉的首都是哪里?”或者“为什么天空是蓝色的?”虽然它还不完美,但已经比以前更聪明了。未来,这个机器人会变得更厉害,能帮人们写作文、做作业,甚至帮老师讲课。这就像给你带来了一个超级聪明的朋友,随时帮你解答问题,学习变得更轻松有趣!

术语表

Tokenizer(分词器)

一种将文本拆分成词或子词的算法,帮助模型理解句子结构。技术上采用Byte Pair Encoding (BPE)机制。

用于扩展和优化孟加拉语的词汇处理,提升模型理解能力。

Pretraining(预训练)

在大量未标注数据上训练模型,使其掌握基础语言知识。技术上采用Transformer架构,优化损失函数。

模型基础能力的建立阶段,为微调提供基础。

Synthetic Data(合成数据)

通过翻译、转写等技术人工生成的训练数据,用于补充低资源语料。

增强模型在孟加拉语中的表现,弥补真实数据不足。

Vocabulary Expansion(词汇扩展)

增加模型词汇表的规模,以覆盖更多词汇和文化特定词。技术上通过训练新词表并合并到原模型中实现。

提升模型理解和生成孟加拉语的能力。

Benchmark Dataset(基准数据集)

用于评估模型在特定任务上的性能标准集合,包括问答、推理等。

衡量TituLLMs在世界知识和推理任务中的表现。

开放问题 这项研究留下的未解疑问

  • 1 当前模型在世界知识和复杂推理方面仍有限制,未来需引入更大规模、多样化的语料库进行强化训练。如何有效结合多模态数据以提升模型能力仍是未解难题。

应用场景

近期应用

孟加拉语自动问答系统

利用TituLLMs实现本土化的问答服务,支持教育、客服等场景,提升信息获取效率。

文化内容生成

帮助本地内容创作者自动生成文章、故事,丰富孟加拉语文化生态。

远期愿景

多模态多语言AI助手

结合图像、语音等多模态数据,打造多语言智能助手,普及到教育、医疗等行业,推动AI普惠化。

原文摘要

In this paper, we present TituLLMs, the first large pretrained Bangla LLMs, available in 1b and 3b parameter sizes. Due to computational constraints during both training and inference, we focused on smaller models. To train TituLLMs, we collected a pretraining dataset of approximately ~37 billion tokens. We extended the Llama-3.2 tokenizer to incorporate language- and culture-specific knowledge, which also enables faster training and inference. There was a lack of benchmarking datasets to benchmark LLMs for Bangla. To address this gap, we developed five benchmarking datasets. We benchmarked various LLMs, including TituLLMs, and demonstrated that TituLLMs outperforms its initial multilingual versions. However, this is not always the case, highlighting the complexities of language adaptation. Our work lays the groundwork for adapting existing multilingual open models to other low-resource languages. To facilitate broader adoption and further research, we have made the TituLLMs models and benchmarking datasets publicly available (https://huggingface.co/collections/hishab/titulm-llama-family-6718d31fc1b83529276f490a).

cs.CL cs.AI