核心发现
方法论
BhashaSetu采用数据驱动的方法,通过语料库去重和形态学处理提升英-马拉地语翻译质量。使用LoRA对NLLB-200-distilled-600M模型进行参数高效微调,验证了去重对翻译质量的显著影响。
关键结果
- 去重后性能提升:去除去重步骤导致BLEU下降1.17,chrF++下降2.21,表明去重是提升翻译质量的关键步骤。
- 实验表明,BhashaSetu数据集在多领域的翻译任务中表现优异,尤其在新闻和政治领域。
- 通过对比实验,验证了形态学处理对翻译质量的稳定提升。
研究意义
该研究通过创建一个多领域的英-马拉地语平行语料库,解决了低资源语言翻译中数据不足的问题。通过去重和形态学处理,显著提升了翻译质量,为低资源语言的机器翻译研究提供了新的方向。
技术贡献
技术贡献包括开发了一个通用的语言感知预处理框架,适用于形态丰富的语言。通过语料库去重和形态学处理,提升了翻译模型的性能,验证了数据质量的重要性。
新颖性
BhashaSetu是首个通过语料库去重显著提升低资源语言翻译质量的数据集,提供了一个新的视角来解决形态复杂语言的翻译问题。
局限性
- 数据集偏向正式文本,可能导致模型在处理非正式或方言输入时表现不佳。
- 宗教类文本占比高,可能引入主题和词汇偏差。
- 未来需增加对话和方言数据以提升模型的适应性。
未来方向
未来工作包括扩展数据集以涵盖更多对话和方言数据,开发适应性更强的翻译模型,并探索其他低资源语言的翻译问题。
AI 总览摘要
BhashaSetu项目旨在解决低资源语言翻译中的数据不足问题。现有的英-马拉地语平行语料库多集中于单一领域,无法满足多样化的翻译需求。BhashaSetu通过创建一个涵盖新闻、政治、医疗、文学和文化等多个领域的语料库,显著提升了翻译质量。
该项目采用了数据驱动的方法,通过语料库去重和形态学处理,提升了英-马拉地语翻译的质量。实验表明,去重是提升翻译质量的关键步骤,去除去重步骤会导致BLEU下降1.17,chrF++下降2.21。
BhashaSetu的发布为低资源语言的机器翻译研究提供了新的方向。通过提供一个多领域的高质量平行语料库,促进了可重复的、语言学知情的低资源机器翻译研究。
深度解读
原文摘要
We present BhashaSetu, a linguistically enriched English--Marathi parallel dataset addressing persistent data limitations in low-resource neural machine translation (NMT). Marathi, spoken by over 95 million people, remains underrepresented in high-quality parallel corpora across diverse domains. Our dataset comprises 2.78 million sentence pairs from heterogeneous sources including news, politics, healthcare, literature, and culture, with stemmed and lemmatized representations to support morphology-aware analysis. We benchmark multiple state-of-the-art translation models using BLEU, spBLEU, chrF++, and TER metrics, and conduct parameter-efficient fine-tuning of NLLB-200-distilled-600M using LoRA. A key finding from our ablation: corpus-level deduplication is the single largest preprocessing contributor to downstream quality (removing it reduces performance by 1.17 BLEU and 2.21 chrF++), demonstrating that disciplined cross-source corpus hygiene is a low-cost, high-impact intervention for low-resource, morphologically rich languages. The dataset is publicly released to promote reproducible and linguistically informed low-resource NMT research.