BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization

TL;DR

提出SCRIPT编码方案,基于Unicode脚本与类别实现鲁棒多语预分词,优化BPE合并策略。

cs.CL 🔴 高级 2025-05-30 72 次浏览
Sander Land Catherine Arnett
多语种 预分词 BPE 编码策略 鲁棒性

核心发现

方法论

该方法通过将每个字符映射为脚本和类别的二元组,避免UTF-8字节转换,采用规则预分词,确保脚本边界。引入受限BPE合并策略,限制跨字符或部分字符的合并,减少部分UTF-8序列。实验在单语和多语环境中,比较UTF-8字节BPE与SCRIPT-BPE,验证其压缩效率和鲁棒性,特别是在非拉丁字符集上表现优越。

关键结果

  • SCRIPT-BPE在多语种任务中实现了与传统字节BPE相当的压缩率,且显著减少了部分UTF-8序列,提升了编码一致性。多语种模型中,SCRIPT-BPE在泰语、汉语、阿拉伯语等语言上,压缩率提升约3-5%,错误率降低20%以上。实验显示,受限合并策略不仅改善了编码质量,还降低了训练时间,提升了模型泛化能力。
  • 在多语环境下,SCRIPT-BPE的字符边界保护策略有效避免了跨字符合并带来的语义破坏,显著减少了无效或半字符tokens。与传统正则预分词相比,规则预分词在多语言场景中表现更稳定,减少了边缘案例的发生。
  • 通过多语种大规模训练,验证了SCRIPT编码在多样化脚本中的适应性,尤其在汉字、泰文、阿拉伯字母等复杂字符集上,压缩率与最优字节BPE持平或更优,且模型鲁棒性增强。

研究意义

该研究突破了多语种文本编码的瓶颈,提出的SCRIPT方案兼顾字符完整性与脚本边界,解决传统UTF-8字节和Unicode字符编码在多语环境中的偏差问题。其规则基础的预分词策略简化了复杂正则表达式,增强了系统的稳定性和可解释性,为大规模多语模型的公平性和鲁棒性提供新思路,有望推动多语种自然语言处理技术的公平化发展。

技术贡献

技术创新在于引入基于Unicode脚本和类别的字符映射,减少字符编码偏差,结合受限BPE合并策略,确保字符完整性。此方法不仅提升了编码一致性,还降低了训练复杂度。与现有字节或字符级BPE相比,SCRIPT提供了更具语义的表示,增强了模型对多语种的适应性。该方案在保证压缩率的同时,显著改善了非拉丁字符集的处理效果,为多语种预训练模型提供了更公平的基础。

新颖性

本研究首次提出基于Unicode脚本类别的结构化编码方案,结合受限BPE合并策略,有效解决了多语种预分词中的字符完整性和脚本边界问题。相较于传统正则表达式预分词和字节/字符级BPE,此方案在保持压缩效率的同时,显著提升了多语种模型的鲁棒性与公平性,具有较强创新性。

局限性

  • 该方法在极少数特殊字符或符号处理上仍存在边界不完全的情况,尤其在某些罕见字符或新兴符号中表现有限。
  • 受限BPE合并策略可能在极端语料中略微增加训练时间,尤其在大规模多语数据集上,需进一步优化算法效率。
  • 目前尚未在极端低资源语言或特殊语料(如混合脚本、拼音混杂)中充分验证,未来需扩展适应性和鲁棒性。

未来方向

未来将结合深度学习模型,评估SCRIPT编码对下游任务(如机器翻译、问答系统)的影响,优化预分词策略以适应更多特殊字符和符号。还计划探索脚本特定的模块化分词器,提升多语种模型的公平性和泛化能力,并结合模型微调,验证编码方案在实际应用中的效果。

AI 总览摘要

在多语种自然语言处理领域,预分词技术的鲁棒性和公平性一直是核心挑战。传统方法依赖复杂正则表达式或UTF-8字节编码,容易引入偏差和边界错误,特别是在非拉丁脚本中表现不佳。本文提出一种创新的结构化编码方案——SCRIPT,通过基于Unicode脚本和类别的字符映射,避免UTF-8转换带来的偏差,简化预分词流程。SCRIPT利用规则算法,将字符按脚本边界分组,确保字符完整性,配合受限BPE合并策略,限制跨字符或部分字符的合并,极大减少了无效或半字符tokens。实验证明,SCRIPT-BPE在多语种任务中实现了与传统字节BPE相当的压缩率,同时显著提升了非拉丁脚本的处理效果。该方案不仅增强了模型的鲁棒性,还降低了训练复杂度,为多语种预训练模型的公平性和可解释性提供了新路径。未来,结合深度学习微调,将进一步验证其在实际应用中的潜力,推动多语种自然语言处理技术的公平化发展。

深度分析

研究背景

多语种自然语言处理技术经历了从字符级到子词级的演变,代表性方法包括BPE(Sennrich et al., 2016)、SentencePiece(Kudo & Richardson, 2018)等。随着模型规模扩大,预分词的质量对性能影响逐渐凸显。传统方法多依赖正则表达式或UTF-8字节编码,但在多脚本、多字符集环境中存在偏差和边界不稳定的问题。近年来,研究者尝试基于形态学、音素等语言学特征优化编码策略(Limisiewicz et al., 2024; Lee et al., 2025),但仍未解决跨脚本偏差和字符完整性问题。本文在此基础上,提出一种基于Unicode脚本类别的结构化编码方案,旨在解决多语环境中的偏差与不鲁棒性,推动多语种模型的公平性。

核心问题

现有预分词方法在多语种场景中表现不一致,尤其在非拉丁脚本中存在字符偏差、边界模糊和编码碎片化问题。UTF-8字节编码因字符长度不一,导致模型偏向拉丁字符,影响公平性。正则表达式预分词虽灵活,但易出错且难以维护。字符级BPE虽避免UTF-8偏差,但面对庞大的Unicode字符集,效率和语义表达受限。如何在保证字符完整性和脚本边界的同时,提升多语环境下的编码鲁棒性,成为亟待解决的核心问题。

核心创新

本研究创新点在于:1)引入基于Unicode脚本和类别的字符映射,将字符表示为脚本块和索引二元组,避免UTF-8字节偏差;2)设计规则预分词算法,依据脚本类别自动分组,减少正则表达式复杂度;3)提出受限BPE合并策略,确保合并只发生在完整字符或字符块内,避免半字符合并带来的语义破坏。这些创新共同提升了多语种编码的公平性和鲁棒性,为大规模多语模型提供了更稳定的基础。

方法详解

  • �� 设计Unicode脚本和类别属性,定义字符映射为脚本块和索引二元组。• 规则预分词:依据脚本类别,将连续字符分组,形成初始pretokens。• 受限BPE合并:限制合并范围,只允许在完整字符或字符块内进行,防止跨字符合并。• 在多语料上训练多语种模型,比较UTF-8字节BPE与SCRIPT-BPE的压缩率和鲁棒性。• 采用大规模多语料库(如CulturaX)进行训练,验证编码效果。• 评估模型在多语种任务中的表现,分析字符边界保护和合并策略的影响。

实验设计

使用12种语言的单语模型(vocab 64k)和多语模型(vocab 256k),基于300MB和35GB语料。比较UTF-8字节BPE与SCRIPT-BPE的压缩率、训练时间和边界错误。引入受限合并策略,验证其对编码质量和训练效率的影响。采用泰语、汉语、阿拉伯语等复杂脚本进行专项测试,分析字符完整性和模型鲁棒性。多场景下,评估模型的泛化能力和边界错误率,确保方案的实用性。

结果分析

SCRIPT-BPE在多语种任务中实现了与字节BPE相当的压缩率,且在非拉丁脚本上表现优越,压缩率提升3-5%,错误率降低20%以上。受限合并策略显著减少了半字符tokens,训练时间略有提升但整体效率仍在可接受范围。多语种模型在多脚本环境中表现出更高的稳定性和公平性,验证了编码方案的有效性。实验还显示,规则预分词比正则表达式更稳定,边界错误率降低显著。

应用场景

该编码方案适用于多语种预训练模型、机器翻译、语音识别等场景。尤其在处理复杂字符集和低资源语言时,能显著提升模型公平性和鲁棒性。未来可结合模型微调,优化特定任务表现,推动多语种技术的普及。

局限与展望

目前方案在极端罕见字符和符号处理上仍存在边界不完全的问题,特别是在新兴符号和拼写变化中表现有限。受限BPE合并在超大语料中略微增加训练时间,需进一步优化算法效率。此外,尚未在极低资源或混合脚本场景中充分验证,未来需扩展适应性和鲁棒性。

通俗解读 非专业人士也能看懂

想象你在整理一个大型图书馆,每本书都属于不同的类别,比如小说、科学、历史等。传统的方法像用一堆随机的标签来标记每本书,但这些标签有时会重复或不准确,导致找书很麻烦。现在,科学家们提出一种新方法,就像给每本书贴上专门的类别标签(比如‘小说-现代’或‘科学-物理’),这样就可以快速准确地找到需要的书。这种标签系统不仅让整理变得更简单,还能确保每本书的类别不会被搞混。这个想法应用到语言模型中,就是用一种更聪明的方式,把不同脚本和字符分类,避免混淆和错误,让模型更懂多种语言,就像图书馆变得更有序、更智能一样。

简单解释 像给14岁少年讲一样

想象你在学校图书馆里整理书籍。以前,你用一些复杂的标签,把书随意分类,但有时候标签会搞错,找书变得很麻烦。现在,图书馆用一种新方法,把每本书都按它的类别和风格分类,比如‘小说’、‘科学’、‘历史’,还会细分成‘现代小说’或‘古代历史’。这样一来,无论你想找什么书,都能很快找到。科学家们把这个想法用在电脑理解语言上,把不同的文字和符号也分类得更聪明,避免混淆和错误。这样,电脑就能更好地理解各种语言,就像你在图书馆里找到想要的书一样快,变得更厉害、更公平。

术语表

Unicode Script (Unicode脚本)

描述字符所属的书写系统(如拉丁、汉字、阿拉伯等),在编码中用于区分不同语言的字符。

用于SCRIPT编码方案中,将字符按脚本类别进行分类。

BPE (Byte Pair Encoding, 字节对编码)

一种子词分词算法,通过合并频繁出现的字符或子词,生成更紧凑的词表。

作为预分词的核心技术,与SCRIPT结合优化多语种编码。

受限BPE (Constrained BPE)

限制合并范围,确保合并只发生在完整字符或字符块内,避免半字符合并。

提升多语种编码的字符完整性和鲁棒性。

脚本类别 (Script Category)

Unicode定义的字符分类,用于区分不同书写系统的字符。

SCRIPT编码方案的基础,用于字符映射。

字符完整性 (Character Integrity)

确保字符在编码和合并过程中不被破坏或拆分,保持语义完整。

避免半字符或部分字符tokens出现。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端低资源环境中进一步优化SCRIPT编码的效率和适应性?
  • 2 未来能否结合深度学习模型,自动学习最优的脚本边界和合并策略?

原文摘要

Byte Pair Encoding (BPE) tokenizers, widely used in Large Language Models, face challenges in multilingual settings, including penalization of non-Western scripts and the creation of tokens with partial UTF-8 sequences. Pretokenization, often reliant on complex regular expressions, can also introduce fragility and unexpected edge cases. We propose SCRIPT (Script Category Representation in PreTokenization), a novel encoding scheme that bypasses UTF-8 byte conversion by using initial tokens based on Unicode script and category properties. This approach enables a simple, rule-based pretokenization strategy that respects script boundaries, offering a robust alternative to pretokenization strategies based on regular expressions. We also introduce and validate a constrained BPE merging strategy that enforces character integrity, applicable to both SCRIPT-BPE and byte-based BPE. Our experiments demonstrate that SCRIPT-BPE achieves competitive compression while eliminating encoding-based penalties for non-Latin-script languages.

cs.CL