CantoneseLLM v2: Reasoning in a Low-Resource Language

TL;DR

CantoneseLLM v2结合CPT、DPO与RLVR,在HKCanto-Eval达73.16分并实现粤语繁体推理。

cs.CL 🟡 进阶级 2026-09-07 41 次浏览
Tsz Chung Cheng Chung Shing Cheng Chaak Ming Lau Cheuk Hei Chong
粤语大模型 低资源语言 RLVR 推理对齐 繁体中文

核心发现

方法论

研究以Qwen3 8B和30B-A3B为基础,依次进行连续预训练(CPT)、Chat Vector合并、监督微调(SFT)、直接偏好优化(DPO)和可验证奖励强化学习(RLVR)。CPT使用784M个粤语及香港相关token;Chat Vector通过Δchat=θinstruct−θbase并入CPT权重;RLVR将任务奖励与输出格式门控、粤语及繁体字乘法奖励结合。

关键结果

  • CPT后的30B-A3B在HKCanto-Eval平均分为68.47,Chat Vector合并后升至74.36;但其推理语言主要继承捐赠模型,未必是自然粤语。
  • SFT显著损害推理:8B平均性能下降20.52分,30B-A3B下降12.46分;30B推理长度缩短至原来的约十分之一,8B在60,850个提示中64.5%产生空推理块。
  • RLVR恢复关键能力与语言对齐;最终30B-A3B在HKCanto-Eval达到73.16,仅比合并检查点低1.20分,同时保留粤语、繁体字推理行为。

研究意义

论文说明,低资源语言的困难并非说话人数少,而是缺少高质量书面语、原生推理轨迹和本地教师模型。它揭示了直接翻译或套用高资源语言训练配方可能破坏推理格式与通用能力。对香港本地部署而言,模型在数据、权重和训练环境上的开放,支持更具区域自主性的文档处理、检索和教育应用。

技术贡献

核心贡献是把训练流程设计成诊断—修复闭环,而非机械堆叠算法。CPT注入本地词汇,Chat Vector以零训练成本迁移指令遵循,DPO修复推理块格式,RLVR则以任务可验证奖励和粤语/繁体字乘法因子恢复能力。论文还公开13年繁体中文Common Crawl、检查点及Nemo-Gym环境,形成可复现实验基础。

新颖性

这是对低资源、强口语化语言进行系统推理模型适配的代表性尝试。相较于主要依赖数百亿token、原生教师模型和大量链式思维数据的既有方案,本文把脚本正确性、语言身份和任务正确性联合进RLVR奖励,并实证展示SFT可能删除推理,而非简单提升目标语言能力。

局限性

  • 语料仅784M token,其中Common Crawl粤语占5.4%,且大量内容来自非正式领域;这限制了正式文体、社会语用和文化覆盖。
  • HKCanto-Eval主要是选择题,可能无法充分检测生成流畅度、粤语词汇、脚本规范及推理终止问题。

未来方向

未来需扩大原生粤语推理数据,构建覆盖教育、法律和医疗的生成式评测,并研究更稳健的跨语言验证器。作者还计划利用v2生成更丰富的长上下文训练数据,推进下一代模型。

AI 总览摘要

粤语拥有约8,500万使用者,却因正式书面语长期偏向普通话、书面粤语受污名化以及数据集中于社交媒体而成为“低资源”语言。现有多语模型能够理解粤语,却常以普通话、简体字或英语推理;直接翻译训练数据又可能制造不自然的词汇、语法和社会语用。

CantoneseLLM v2以Qwen3 8B和30B-A3B为基础,采用五阶段流程:在784M粤语及香港相关token上进行CPT;用Chat Vector迁移指令遵循;通过SFT补充翻译、数据整理和推理样本;用DPO修复推理块;最后使用带格式门控及粤语、繁体字乘法约束的RLVR。结果显示,合并模型虽能提升指令能力,却继承捐赠模型的推理语言。SFT反而使8B大多删除推理块,并令30B推理长度缩短约90%。

RLVR恢复了能力与语言对齐。最终30B-A3B在HKCanto-Eval取得73.16分,仅比其合并检查点低1.20分,同时能够以粤语繁体字进行推理。研究的更广泛意义在于:低资源语言适配不能只追求更低训练损失或更多翻译数据,而必须把语言、脚本、格式和任务正确性联合优化。公开的检查点、训练环境和13年Common Crawl数据,也为区域化、可本地部署的模型研究提供了基础。

深度分析

研究背景

Qwen3、Swallow和SEA-LION表明,持续预训练能提升区域语言能力,但其语料规模分别可达35.1B至200B token。粤语虽然使用者众多,却缺少大规模书面语和原生推理轨迹;普通话与粤语在词汇、语法、语用和文化规范上也并非简单互换。因此,香港需要的是能在本地语言和脚本中稳定工作的中型模型,而非仅在多项选择题上“看似懂粤语”的系统。

核心问题

研究要解决四个相互关联的问题:如何用784M级别的小语料注入本地知识;如何在没有粤语教师模型时迁移指令遵循;如何避免有限SFT数据删除或缩短推理;以及如何让模型同时满足答案正确、使用粤语和繁体字、保持合法输出格式。传统训练损失不能可靠衡量这些目标,选择题评测也会掩盖生成失败。

核心创新

第一,使用Common Crawl、网页小说、百科和合成评论构建784M token语料,并发布13年繁体中文数据。第二,采用Chat Vector算术零成本迁移对齐能力。第三,以DPO针对推理块格式进行修复,而不是盲目加入更多数据。第四,RLVR将环境任务奖励、硬格式门控和语言—脚本乘法因子联合起来,使语言约束成为任务成功的必要条件,而非装饰性偏好。

方法详解

  • �� CPT:在64个TPU v6e上训练Qwen3 8B与30B-A3B;8B学习率为3.0×10^-5,30B最佳选择为1.5×10^-5。
  • �� Chat Vector:计算Δchat=θinstruct−θbase,再令θcv=θcpt+Δchat,避免额外指令数据。
  • �� SFT:74,865行、177.4M token,推理token占52.2%,包含粤语、机器翻译推理和英文回放。
  • �� DPO:以偏好数据恢复正确的思考—回答结构。
  • �� RLVR:在Nemo-Gym可验证环境中,将任务奖励乘以粤语和繁体字因子,并设置格式门控;每阶段用HKCanto-Eval与生成探针诊断。

实验设计

评测覆盖HKCanto-Eval、MMLU、CantoMMLU及受控生成探针,检查推理块存在率、长度、语言、脚本、指令遵循和终止。CPT比较多个步数和学习率;8B的530步被选中。论文还比较官方Qwen3、Chat Vector、SFT、DPO和GRPO检查点,并用机器翻译GSM8K观察数词量词、粤语词汇和推理语言。

结果分析

8B CPT步数扫掠的平均分约为65.07、65.12和64.85;30B最佳CPT为68.47,而高学习率虽降低训练损失,却使分数降至67.65,说明过拟合。Chat Vector使8B达到69.51,但30B合并模型为74.36。SFT分别造成20.52和12.46分回退。最终RLVR将30B带回73.16,并恢复目标语言推理。

应用场景

模型可用于香港政府和企业的粤语文档整理、检索增强问答、书面中文—粤语转换、教育辅导和本地客服。由于公开了权重、环境和数据,机构可在区域内部署并审计模型。实际使用仍需领域词表、隐私过滤、人工质检和对法律医疗高风险答案的独立验证。

局限与展望

数据规模和原生粤语比例仍低,语料偏向非正式网络内容;机器翻译推理可能带入普通话结构。训练RLVR成本高,论文列出的设备成本约为8B/30B分别441/1,256 GPU小时,而完整管线还包括CPT和DPO。HKCanto-Eval以选择题为主,无法完全评价开放式生成。后续应扩大原生轨迹、改善验证器、增加正式领域和多维生成评测。

通俗解读 非专业人士也能看懂

把训练模型想成培养一位香港新员工。第一步,给他读784M个字的本地报纸、网页、小说和百科,让他知道香港知识和粤语词汇;这就是CPT。第二步,把另一位已经懂得听指令的员工的工作习惯复制过来,也就是Chat Vector。但这位员工可能用普通话或简体字思考。第三步,给他少量粤语范例做练习,却可能让他学会“直接交答案”,甚至留下空白的思考栏;这正是SFT造成的失败。

接着,DPO像主管挑选较好的工作样本,要求员工保留正确的思考步骤。最后,RLVR像自动评分系统:答案要正确,表达要像粤语,还要使用繁体字;只满足其中一项,奖励就会大幅减少。这样,模型不只是答对题,还会以目标语言和脚本完成过程。最终30B模型得到73.16分,几乎追上合并模型,同时补回了合并模型缺失的粤语推理能力。

简单解释 像给14岁少年讲一样

想象你在训练一个超强游戏队友。他原本很聪明,但平时用普通话、简体字甚至英语想攻略;你希望他用香港人自然会说的粤语和繁体字交流。研究者先给他看784M个本地资料,让他熟悉香港地图、词语和文化。然后,他们把一个很会听指令的队友的“操作习惯”复制过来,不必重新训练。

问题来了:少量粤语练习反而让队友懒了。他有时不写思考过程,或者把长攻略缩成很短的一句。8B模型甚至在64.5%的测试提示中留下空的思考框。于是研究者先用DPO教他恢复正确格式,再用RLVR像游戏积分系统一样奖励三件事:答案正确、真的用粤语、使用繁体字。

结果很酷:30B-A3B模型在HKCanto-Eval拿到73.16分,只比早期合并版本低1.20分,但它终于能用粤语繁体字思考。这个故事告诉我们,训练AI不只是塞更多题目;还要明确告诉它“怎样思考、用什么语言、用什么文字”,并逐项检查。

术语表

Continuous Pre-training(连续预训练,CPT)

在已有模型上继续学习特定领域文本,以注入词汇、知识和语言分布。它不同于从零训练,但可能牺牲通用能力。

论文用784M粤语及香港相关token训练Qwen3。

Chat Vector(对话向量)

通过聊天模型权重减去基础模型权重得到的参数方向,用于迁移指令遵循和对齐。公式为Δchat=θinstruct−θbase。

被加入CPT检查点,无需额外指令训练。

SFT(监督微调)

用输入—目标输出样本直接训练模型。数据不足或格式混杂时,可能强化空答案或短推理。

SFT使8B和30B性能分别下降20.52和12.46分。

DPO(直接偏好优化)

利用偏好答案与非偏好答案优化模型,无需显式训练奖励模型。它适合修正输出格式和偏好。

论文用DPO恢复推理块,尤其改善8B。

RLVR(可验证奖励强化学习)

利用可自动验证的任务结果提供奖励。本文还加入格式门控及粤语、繁体字乘法约束。

RLVR恢复了最终模型的能力和目标语言推理。

开放问题 这项研究留下的未解疑问

  • 1 如何获得大规模、原生而非机器翻译的粤语推理轨迹,仍没有成熟答案;需要长期数据共建、隐私保护和专业领域标注。
  • 2 HKCanto-Eval不能充分衡量自然生成、社会语用和脚本正确性;社区需要开放式、领域化、多轮交互评测。

应用场景

近期应用

香港本地知识助手

政府、学校和企业可部署30B模型处理粤语问答、文件摘要和检索。前提是加入机构私有知识库,并对法律、医疗及个人资料设置人工审核。

粤语—书面中文转换

编辑、客服和教育机构可用模型进行口语粤语与正式书面中文之间的改写,同时保留繁体字。上线前应建立术语表并评测地域、礼貌和语境差异。

远期愿景

区域自主语言基础设施

公开权重、数据和验证环境可支持香港长期建设可审计、可本地运行的语言模型生态。主要障碍是高质量数据、持续算力和跨领域安全评测。

原文摘要

Cantonese is widely spoken but remains low-resource in written data, with no large corpus of native Cantonese reasoning traces available for model training. We develop and release CantoneseLLM v2, comprising models based on Qwen3 8B and 30B-A3B. The models are trained through CPT on 784 million Cantonese and Hong Kong-related tokens, chat-vector merging, SFT, DPO, and RLVR. Evaluation across the training stages shows that chat-vector merging transfers instruction following but preserves the donor model's reasoning language, while SFT with limited Cantonese reasoning data substantially shortens or removes reasoning traces and reduces benchmark performance. DPO restores the reasoning-block format, particularly for the 8B model, but recovers only part of the lost performance. The RLVR training with Cantonese language and Traditional Chinese scripts as multiplicative constraints introduced Cantonese language alignment and restored the lost performance. The 30B-A3B model reaches 73.16 on HKCanto-Eval, within 1.20 points of its merged checkpoint, while retaining the Cantonese reasoning behaviour absent from that checkpoint. We release the model checkpoints, the training environments, and a thirteen-year Traditional Chinese Common Crawl dataset. The models can be accessed at https://huggingface.co/collections/hon9kon9ize/cantonesellm-v20

cs.CL