Goldfish: Monolingual Language Models for 350 Languages

TL;DR

提出Goldfish系列单语模型,针对350种低资源语言,参数为125M,显著优于多语模型在困惑度和语法任务中的表现。

cs.CL 🔴 高级 2024-08-20 29 引用 78 次浏览
Tyler A. Chang Catherine Arnett Zhuowen Tu Benjamin K. Bergen
多语NLP 低资源语言 单语模型 困惑度评估 语法理解

核心发现

方法论

本研究采用基于Transformer架构的单语预训练模型,针对每种语言训练参数为125M的模型,数据规模在5MB至1GB之间。模型训练采用自回归的GPT-2机制,使用定制的50K词汇表和Unigram分词器,确保模型在低资源条件下的适应性。通过合并多个低资源语料库(如Glot500、MADLAD-400)进行数据预处理,剔除重复和偏差内容,确保数据多样性。模型训练在不同数据规模下进行10轮,采用Byte Premium工具估算每种语言的字节溢出系数,以保证数据规模的公平性。模型训练后,采用FLORES-200的困惑度指标进行评估,并在多语言语法和推理任务(如MultiBLiMP、Babel、XCOPA)上进行测试。对比分析包括大规模多语模型(XGLM、BLOOM、MaLA-500)和简单的二元模型,验证Goldfish在困惑度和语法准确性上的优越性。

关键结果

  • Goldfish模型在98/204个FLORES语种中实现了比XGLM 4.5B、BLOOM 7.1B更低的平均困惑度(分别低13%和11%),且在43%的低资源语种中困惑度优于BLOOM 7.1B。模型规模虽小(125M参数),但在多语困惑度评估中表现优异,显著优于大规模多语模型和简单二元模型。
  • 在多语言语法能力评估(MultiBLiMP)中,Goldfish模型在74个语种中表现出比多语模型更高的准确率,最高达78.8%,优于BLOOM、XGLM等模型,体现出单语模型在特定语种的语法理解方面的优势。
  • 在多语推理任务(如Babel、XCOPA)中,Goldfish模型表现接近随机猜测(接近50%或更低),显示出模型在复杂推理任务中的局限性,提示当前模型仍需在推理能力上进行改进。

研究意义

本研究突破了低资源语言模型的瓶颈,首次大规模系统性地为350种低资源语言提供了单语预训练模型,填补了缺乏专属模型的空白。通过对比多语模型,验证了小规模单语模型在困惑度和语法任务中的优越性,为低资源语言的自然语言处理提供了新的基准和工具。这不仅推动了低资源语种的技术平等,也为未来多语模型的优化提供了宝贵的参考。模型的开源极大地促进了学术界和产业界的合作,有望带动低资源语种的实际应用和保护工作。

技术贡献

本研究提出了基于Transformer的125M参数单语模型训练框架,结合Byte Premium估算和定制分词器,确保模型在极低数据规模下的有效学习。创新点包括:• 采用多源低资源语料的合并与去重策略,提升数据质量;• 引入字节溢出系数,公平比较不同语言的数据规模;• 在不同数据规模下训练多版本模型,分析模型参数与数据关系;• 设计专用的单语词汇表和Unigram分词器,优化模型表达能力。与现有多语模型相比,Goldfish在困惑度和语法评估中表现优异,验证了单语模型在低资源场景中的潜力。

新颖性

本研究首次系统性地为350种低资源语言训练并公开了超过1000个单语模型,覆盖215种此前无专属模型的语言。不同于以往多语模型依赖大量高资源语料,Goldfish在极低数据条件下依然实现优异性能,展示了单语模型在低资源环境中的潜力。其核心创新在于结合字节溢出估算和定制分词,极大提升模型在少量数据下的表现,突破了低资源语言建模的瓶颈。

局限性

  • 模型在推理任务中的表现仍接近随机,说明其在复杂逻辑和推理方面能力有限,可能受限于数据规模和模型容量。
  • 模型训练依赖于多源语料的整合,存在数据偏差和噪声,影响模型泛化能力。
  • 由于训练数据有限(最大1GB),模型在某些语言的表达和理解能力仍不足,未来需结合增强学习和多模态信息提升性能。

未来方向

未来将探索更大规模的单语模型,结合少样本学习和迁移学习技术,提升推理和复杂任务能力。同时,计划引入多模态数据(如语音、图像)以丰富模型理解能力,推动低资源语言的多模态应用。此外,优化模型训练流程和数据采集策略,解决数据偏差问题,进一步提升模型的公平性和实用性。

AI 总览摘要

在自然语言处理领域,构建适用于低资源语言的高效模型一直是技术难题。现有的多语模型如XGLM、BLOOM在多语环境中表现虽佳,但在低资源语种的基本文本生成和语法理解方面仍显不足。原因在于这些模型依赖大量高资源语料,且在低资源语料中的表现受限。为此,本文提出了Goldfish系列单语模型,专门针对350种低资源语言进行训练,参数规模为125M,数据规模在5MB到1GB之间,显著低于传统大模型。通过结合字节溢出估算和定制的Unigram分词器,Goldfish在困惑度和语法任务中表现优于多语模型,填补了低资源语种缺乏专属模型的空白。

研究采用多源低资源语料库(如Glot500、MADLAD-400)进行数据预处理,确保数据多样性和质量。模型训练在不同数据规模下进行,采用自回归GPT-2架构,结合Byte Premium工具估算字节溢出系数,保证不同语言数据规模的公平性。训练过程中,模型在困惑度和多语言语法评估(如MultiBLiMP)中均表现出色,尤其在98/204个FLORES语种中优于大模型。实验结果显示,Goldfish在低资源语种中困惑度平均比XGLM低13%,比MaLA-500低11%,在语法准确率上也优于多语模型。

这些发现表明,小规模单语模型在低资源环境下具有巨大潜力,能够提供更准确、更语法合理的文本生成能力。模型的开源为学术界和产业界提供了宝贵的工具,有望推动低资源语种的自然语言处理技术发展。尽管如此,Goldfish在推理任务中的表现仍有限,未来需结合多模态信息和增强学习技术,提升模型的推理和复杂任务能力。总体而言,本研究为低资源语言的技术平等和多样性保护提供了新的路径,也为多语模型的未来发展提供了重要参考。

深度解读

原文摘要

For many low-resource languages, the only available language models are large multilingual models trained on many languages simultaneously. Despite state-of-the-art performance on reasoning tasks, we find that these models still struggle with basic grammatical text generation in many languages. First, large multilingual models perform worse than bigrams for many languages (e.g. 24% of languages in XGLM 4.5B; 43% in BLOOM 7.1B) using FLORES perplexity as an evaluation metric. Second, when we train small monolingual models with only 125M parameters on 1GB or less data for 350 languages, these small models outperform large multilingual models both in perplexity and on a massively multilingual grammaticality benchmark. To facilitate future work on low-resource language modeling, we release Goldfish, a suite of over 1,000 small monolingual language models trained comparably for 350 languages. These models represent the first publicly-available monolingual language models for 215 of the languages included.

cs.CL

参考文献 (20)

Glot500: Scaling Multilingual Corpora and Language Models to 500 Languages

Ayyoob Imani, Peiqin Lin, Amir Hossein Kargaran 等

2023 160 引用 ⭐ 高影响力 查看解读 →

A Bit of a Problem: Measurement Disparities in Dataset Sizes across Languages

Catherine Arnett, Tyler A. Chang, Benjamin K. Bergen

2024 18 引用 ⭐ 高影响力 查看解读 →

MADLAD-400: A Multilingual And Document-Level Large Audited Dataset

Sneha Kudugunta, Isaac Caswell, Biao Zhang 等

2023 247 引用 ⭐ 高影响力 查看解读 →

mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer

Linting Xue, Noah Constant, Adam Roberts 等

2020 3329 引用 查看解读 →

Findings of the AmericasNLP 2021 Shared Task on Open Machine Translation for Indigenous Languages of the Americas

Manuel Mager, Arturo Oncevay, Abteen Ebrahimi 等

2021 91 引用

Larger-Scale Transformers for Multilingual Masked Language Modeling

Naman Goyal, Jingfei Du, Myle Ott 等

2021 162 引用 查看解读 →

Experiments on a Guarani Corpus of News and Social Media

Santiago Góngora, Nicolás Giossa, Luis Chiruzzo

2021 16 引用

KLUE: Korean Language Understanding Evaluation

Sungjoon Park, Jihyung Moon, Sungdong Kim 等

2021 249 引用 查看解读 →

Improving Pretrained Cross-Lingual Language Models via Self-Labeled Word Alignment

Zewen Chi, Li Dong, Bo Zheng 等

2021 85 引用 查看解读 →

AraBench: Benchmarking Dialectal Arabic-English Machine Translation

Hassan Sajjad, Ahmed Abdelali, Nadir Durrani 等

2020 47 引用

Language ID in the Wild: Unexpected Challenges on the Path to a Thousand-Language Web Text Corpus

Isaac Caswell, Theresa Breiner, D. Esch 等

2020 113 引用 查看解读 →

How Good is Your Tokenizer? On the Monolingual Performance of Multilingual Language Models

Phillip Rust, Jonas Pfeiffer, Ivan Vulic 等

2020 436 引用 查看解读 →

Beyond English-Centric Multilingual Machine Translation

Angela Fan, Shruti Bhosale, Holger Schwenk 等

2020 1112 引用 查看解读 →

BERTimbau: Pretrained BERT Models for Brazilian Portuguese

Fábio Souza, Rodrigo Nogueira, R. Lotufo

2020 579 引用

The Tatoeba Translation Challenge – Realistic Data Sets for Low Resource and Multilingual MT

J. Tiedemann

2020 232 引用 查看解读 →

ChrEn: Cherokee-English Machine Translation for Endangered Language Revitalization

Shiyue Zhang, B. Frey, Mohit Bansal

2020 36 引用 查看解读 →

Towards Computational Linguistics in Minangkabau Language: Studies on Sentiment Analysis and Machine Translation

Fajri Koto, Ikhwan Koto

2020 36 引用 查看解读 →

IndoNLU: Benchmark and Resources for Evaluating Indonesian Natural Language Understanding

Bryan Wilie, Karissa Vincentio, Genta Indra Winata 等

2020 520 引用 查看解读 →

TICO-19: the Translation Initiative for Covid-19

Antonios Anastasopoulos, A. Cattelan, Zi-Yi Dou 等

2020 118 引用 查看解读 →

ParaCrawl: Web-Scale Acquisition of Parallel Corpora

Marta Bañón, Pinzhen Chen, B. Haddow 等

2020 296 引用

被引用 (20)

Multilinguality as Sense Adaptation

2026 ⭐ 高影响力 查看解读 →

Explaining and Mitigating Crosslingual Tokenizer Inequities

2025 5 引用 ⭐ 高影响力 查看解读 →

Left-Branching Transformers Excel at Right-Branching Languages: Data Shapes Word Order Preferences in Language Models

2026 ⭐ 高影响力 查看解读 →

TurBLiMP: A Turkish Benchmark of Linguistic Minimal Pairs

2025 12 引用 查看解读 →

Lattice @MultiGEC-2025: A Spitful Multilingual Language Error Correction System Using LLaMA

4 引用

Extending the BabyLM Initiative: Promoting Diversity in Datasets and Metrics through High-Quality Linguistic Corpora

3 引用

Zero-Shot Evaluation of Conversational Language Competence in Data-Efficient LLMs Across English, Mandarin, and French

2025 1 引用

Global PIQA: Evaluating Physical Commonsense Reasoning Across 100+ Languages and Cultures

2025 10 引用

GUIR at SemEval-2026 Task 7: Probing Cultural Knowledge in LLMs via Multi-Agent Debate

2026 1 引用

Thesis Proposal: Diagnosing and Mitigating Semantic Interference in Script-Sharing Low-Resource Language Models: A Case Study on Square Bai Script

2026

Low-resource Machine Translation: what for? who for? An observational study on a dedicated Tetun language translation service

2024 11 引用 查看解读 →

Why do language models perform worse for morphologically complex languages?

2024 74 引用 查看解读 →

Weak Supervision Dynamic KL-Weighted Diffusion Models Guided by Large Language Models

Multi-granular Training Strategies for Robust Multi-hop Reasoning Over Noisy and Heterogeneous Knowledge Sources

IPA-CHILDES & G2P+: Feature-Rich Resources for Cross-Lingual Phonology and Phonemic Language Modeling

2025 4 引用 查看解读 →

MultiBLiMP 1.0: A Massively Multilingual Benchmark of Linguistic Minimal Pairs

2025 65 引用 查看解读 →

Spontaneous Speech Variables for Evaluating LLMs Cognitive Plausibility

2025 3 引用 查看解读 →

BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization

2025 13 引用 查看解读 →

Beyond Weaponization: NLP Security for Medium and Lower-Resourced Languages in Their Own Right

2025 3 引用 查看解读 →

Evaluating Data-Efficient LLMs on a Benchmark of Disfluency Minimal Pairs

2025