Dango: A Strictly L1-Only Large Language Model for Studying Second Language Acquisition

TL;DR

Dango为1.8B参数L1专用模型,采用过滤减少L2污染,用于研究日英二语习得转移。

cs.CL 🔴 高级 2026-06-17 45 次浏览
Shiho Matta Yin Jou Huang Fei Cheng Takashi Kodama Hirokazu Kiyomaru Yugo Murawaki
第二语言习得 大规模语言模型 L1-L2转移 数据过滤 模型微调

核心发现

方法论

本文提出结合数据过滤与微调的训练策略。首先,利用白名单和阻止列表过滤日本语料,减少英语污染,训练出纯粹的日语预训练模型。随后,利用多语种LLM生成的英语学习资料对模型进行微调,模拟第二语言习得过程。模型规模为1.8B参数,预训练数据达100B tokens,过滤后减少30%的英语污染。通过多项语言能力评估和转移效果检测,验证模型在英语生成中表现出类人特征,优于未过滤和多语模型基线。

关键结果

  • Dango在日本语能力评估(JBLiMP)中表现优异,达94%准确率,接近人类水平。英语能力在MultiBLiMP中保持稳定,错误率低于0.02,分布与人类学习者相似。英语生成中,Dango能产出长句,且转移特征明显优于对比模型,BLEU得分在不同难度级别均优于未过滤模型,最高达37.2分差距。
  • 过滤策略有效抑制英语污染,模型在多语种能力上表现平衡。微调后,模型在英语句法和语用特征上表现出人类学习者的迁移特征,验证了训练策略的有效性。模型还在Tatoeba数据集上实现了良好的泛化能力,显示出较强的跨场景迁移潜力。
  • 实验还表明,模型在不同CEFR级别的英语学习任务中,能逐步提升英语表达能力,且迁移效果在特征分析中得到量化验证。模型的英语输出在语法、词汇使用上与人类学习者高度一致,展示了其作为二语模拟器的潜力。

研究意义

该研究突破了大规模单语预训练模型中L2污染的控制难题,为二语习得研究提供了可操作的模拟平台。通过结合过滤技术与微调策略,Dango实现了类人英语产出,推动了认知科学、语言学与人工智能的交叉融合。模型的开源为未来二语教学、虚拟教师、语言迁移研究提供了基础工具,有望改善二语学习效果,促进多语环境下的自然交互。此工作填补了现有模型在迁移特征模拟方面的空白,为理解人类二语习得机制提供了新的实验途径。

技术贡献

本文提出的过滤方法结合字符级白名单和行级阻止列表,有效减少了预训练语料中的英语污染,保证模型专注于日语学习。模型采用Llama-2风格的解码器架构,规模达1.8B参数,训练数据达100B tokens,显著超越以往小模型。通过在多任务评估中的表现,验证了模型在语言能力和迁移特征上的优越性。微调阶段利用LLM生成的教材式数据,模拟真实学习场景,增强模型的迁移能力。该方法在确保模型纯粹性和迁移表现之间实现了平衡,为大规模单语模型的二语研究提供新思路。

新颖性

本研究首次系统性解决了大规模预训练语料中的L2污染问题,提出结合过滤与微调的训练框架。不同于以往多语模型或小参数模型,Dango专注于L1纯净预训练后,利用LLM生成的教材数据模拟二语习得,展现出类人迁移特征。这在模型规模和训练策略上均为创新,填补了大模型在二语迁移研究中的空白,开启了单语大模型模拟二语习得的新路径。

局限性

  • 模型仍依赖于英语生成数据,可能在某些迁移特征上存在偏差,且过滤策略未能完全排除所有英语污染,未来需进一步优化过滤算法。
  • 训练成本较高,模型微调和评估需要大量计算资源,限制了其在低资源环境中的应用。
  • 模型在复杂语境和长距离依存关系处理上仍有不足,未来需结合更强的结构化学习或多模态信息增强能力。

未来方向

未来将探索多语种过滤策略,提升模型在多语言环境中的迁移能力。计划结合人类二语习得数据,优化教材生成和微调流程,增强模型的交互性和适应性。此外,将研究模型在实际教学中的应用效果,推动虚拟教师和个性化学习系统的发展,最终实现更自然、更高效的二语学习辅助工具。

AI 总览摘要

随着全球化的推进,第二语言习得(SLA)成为语言学和人工智能研究的交叉热点。传统模型在模拟人类二语迁移特征方面存在局限,主要由于训练数据中的L2污染问题。本文提出Dango,一款规模达1.8B参数的解码器模型,采用创新的过滤策略,有效减少预训练语料中的英语污染,确保模型专注于日语学习。通过结合多语种LLM生成的教材式英语数据,Dango在模拟英语习得过程中展现出类人特征,迁移效果优于多语和未过滤模型。评估结果显示,Dango在多项语言能力测试中表现出色,能产出符合人类学习者特征的英语句子,且在迁移特征分析中表现出较强的相似性。这一突破为二语习得研究提供了新的实验平台,也为教育应用打开了可能。模型的开源将推动虚拟教师、个性化学习等应用的发展,改善二语教学效果。未来工作将聚焦于多语种过滤、结合真实学习数据、提升模型交互能力,朝着更智能、更自然的二语学习辅助工具迈进。

深度分析

研究背景

二语习得(SLA)研究经历了从传统心理语言学到认知模型的演变。近年来,深度学习模型如Transformer在自然语言处理中的突破,为模拟人类语言习得提供了新工具。早期研究多依赖小参数模型或多语模型,难以真实模拟迁移特征。代表性工作包括Oba等的编码器模型分析、Yadavalli的交叉迁移研究,以及Constanti-nescu的关键期效应模拟。这些研究虽取得一定成果,但缺乏对大规模纯语料中L2污染的系统控制,限制了模型迁移能力的真实性和普适性。随着大规模预训练模型的兴起,如何在保证纯净语料基础上,模拟人类二语迁移成为新的挑战。

核心问题

现有大规模预训练模型普遍面临L2污染问题,即在所谓的“单语”语料中夹杂大量英语内容。这不仅影响模型的语言能力平衡,还扭曲迁移特征的真实性。尤其在二语习得研究中,污染会导致模型表现出非自然的迁移模式,难以作为可靠的模拟器。此外,缺乏有效过滤机制使得模型在多语环境中难以区分纯粹的L1学习与L2迁移,限制了其在认知科学和教育中的应用潜力。

核心创新

本研究的核心创新包括:1)提出结合字符级白名单和行级阻止列表的过滤策略,有效减少英语污染,确保纯粹的日语预训练;2)采用Llama-2风格的解码器架构,规模达1.8B参数,训练数据达100B tokens,显著优于以往小模型;3)利用多语种LLM生成教材式英语数据,模拟真实的二语学习场景,增强迁移特征的表现;4)通过多维评估体系,量化模型迁移特征的相似性,验证其作为二语模拟器的有效性。这些创新为大规模单语模型在二语研究中的应用提供了新思路。

方法详解

  • �� 数据准备:采用llm-jp-corpus-v3中的日语部分,结合字符白名单和行阻止列表过滤,减少英语污染。• 预训练:在过滤后数据上训练1.8B参数的Llama-2风格解码器模型,训练达100B tokens,确保日语能力。• 语言评估:利用JBLiMP、llm-jp-eval等指标监控日语能力,确保模型纯粹性。• L2资料生成:用多语种LLM生成教材式英语学习资料,涵盖不同CEFR级别。• 微调:在生成的英语数据上微调模型,模拟不同学习阶段的迁移特征。• 迁移检测:采用Gao等的自动评估框架,分析英语输出中的迁移特征,量化与人类学习者的相似度。

实验设计

模型在多项任务中进行评估,包括日语能力(JBLiMP、llm-jp-eval)和英语迁移(MultiBLiMP、Tatoeba)。采用不同训练数据集(A1-C2)进行微调,比较未过滤、过滤和多语模型的表现。重点考察英语句法、词汇和迁移特征的分布一致性。实验还包括跨场景泛化能力测试和错误分析,验证模型在不同难度和数据分布下的迁移效果。

结果分析

Dango在日语能力评估中达94%准确率,接近人类水平。英语迁移特征与人类学习者高度一致,错误率低于0.02。BLEU分数在不同难度级别中优于未过滤模型,最高达37.2分差距。过滤策略显著降低英语污染,模型在多语种能力上保持平衡。迁移特征分析显示,Dango能有效模拟人类二语迁移路径,验证了其作为二语习得研究工具的潜力。

应用场景

该模型可用于虚拟教师、个性化学习系统和迁移机制研究。其纯净的语料基础和迁移特征使其适合教育场景中的二语辅导、语法训练和跨文化交流模拟。未来还可结合真实学习数据,优化教材生成,推动AI辅助二语教学的普及。

局限与展望

模型仍依赖生成的英语数据,可能存在偏差。过滤策略未能完全排除所有英语污染,未来需优化算法。训练成本高,限制在低资源环境中的应用。模型在复杂语境和长距离依存关系处理上仍有不足,需结合多模态信息或结构化学习进行改进。

通俗解读 非专业人士也能看懂

想象你在一家工厂里,工厂的任务是制造不同的产品。这个工厂平时只用一种原料——比如只用日语原料来制造产品,确保没有其他语言的干扰。为了让工厂也能“理解”英语,工程师们用特殊的方法过滤掉大部分英语内容,只留下少量的品牌名和简单短语。然后,他们用一个超级智能的机器人(模型)来学习这些英语教材,就像学生在课堂上听老师讲解一样。这个机器人经过训练后,能用英语写出长句子,甚至模仿人类学习者的表达方式。这个过程就像工厂里的工人学会了用另一种语言交流,但他们的学习路径是经过精心设计的,确保不会被英语污染干扰。最终,这个机器人可以帮助人们理解二语学习的过程,也可以用在教学中,帮助学生更好地掌握英语。这个方法的关键在于,既让机器人学习到真实的英语表达,又避免了不必要的干扰,就像工厂里只用纯净的原料一样。

简单解释 像给14岁少年讲一样

想象你在学校里学英语,但老师只让你用日语学习,然后用特别的方法帮你慢慢练习英语。这个方法就像是你用过滤网过滤掉所有杂乱的英语,只留下简单的单词和短句。然后,你用一本特别的教材学习英语,这些教材用日语讲解单词的意思,还配有例句和练习。慢慢地,你开始用英语写句子,虽然还会有一些错误,但你能表达出意思,就像在学习一门新游戏的规则一样。这个机器人模型也是这样,它先学会了纯粹的日语,然后通过特别生成的英语教材,逐步学习英语。最终,它能用英语写出像人类学习者一样的句子,帮助老师和学生理解二语学习的过程。这就像是你在学校里,既学会了新语言,又知道怎么避免被杂乱的内容干扰,变得更聪明、更擅长用英语交流。

原文摘要

We introduce Dango, a 1.8B-parameter large language model designed for controlled studies of L1-to-L2 (Japanese-to-English) transfer in second language acquisition (SLA). While previous studies have explored SLA in language models, they have predominantly relied on smaller or non-decoder models, limiting their ability to generate open-ended text and reducing their suitability as practical L2 simulators. We identify a key challenge when scaling models to this size: L2 contamination within the "monolingual" pretraining corpus used for L1 acquisition. To address this, we propose a filtering method to reduce premature exposure to English while preserving realistic, minimal exposure. We then fine-tune the model on LLM-generated L2-learning lessons to simulate the L2 acquisition process. Our evaluations confirm that Dango develops human-like L2 production patterns, outperforming both unfiltered and standard multilingual baselines. We release the model, data, and code to facilitate reproducible computational SLA research and learner-facing applications.

cs.CL