Conan-Embedding-v2: Training an LLM from Scratch for Text Embeddings

TL;DR

Conan-Embedding-v2为从零训练的1.4B参数大模型,结合跨语言数据,提出软掩码和动态硬负样本挖掘,实现SOTA文本嵌入性能。

cs.CL 🔴 高级 2025-09-16 48 次浏览
Shiyu Li Yang Tang Ruijie Liu Shi-Zhe Chen Xi Chen
大模型 文本嵌入 多语言 软掩码 负样本挖掘

核心发现

方法论

Conan-Embedding-v2采用从零训练的1.4B参数Transformer模型,结合新闻和多语种配对数据进行预训练。引入软掩码机制,逐步从因果掩码过渡到双向掩码,解决模型训练中的掩码类型差异。利用跨语言检索数据集,支持26语种的跨语言表示融合。提出动态硬负样本挖掘策略,持续提升负样本难度,增强模型判别能力。训练流程包括预训练、SFT、弱监督和有监督微调,结合InfoNCE和CoSENT损失优化不同任务。

关键结果

  • Conan-Embedding-v2在MTEB和中文MTEB上均达到了SOTA性能,参数仅1.4B,超越多种大模型和专用嵌入模型,分类和重排序任务表现优异,平均得分超过73分。
  • 在零样本设置中,Conan-Embedding-v2在英文MTEB中取得73.52分,优于对比模型,验证了其强泛化能力。
  • 跨语言检索任务中,Conan-Embedding-v2在MKQA基准上实现了最高的R@20和nDCG@10,分别提升3.6%和5.7%,显示出优异的多语种对齐能力。

研究意义

该研究突破了传统基于微调的文本嵌入方法的局限,从零训练模型,结合跨语言数据和创新机制,有效提升多语种、多任务文本表示能力。对信息检索、多语言理解等场景具有重要推动作用,推动大模型在实际应用中的普及与优化。

技术贡献

提出从零训练的1.4B参数Transformer模型,创新引入软掩码机制实现掩码类型平滑过渡,结合跨语种检索数据集,增强多语种融合能力。设计动态硬负样本挖掘策略,持续优化负样本难度,提升模型判别能力。整体训练流程涵盖多阶段,兼顾多任务、多语种需求,显著优于微调方法的效果。

新颖性

首次在从零训练大模型中引入软掩码机制,解决因果与双向掩码的训练差异,结合跨语言检索数据,显著提升多语种嵌入质量。不同于以往微调为主的方案,模型从头训练,兼具效率与性能,开创了文本嵌入新路径。

局限性

  • 模型训练依赖大量多语种数据,数据质量和覆盖范围仍有限,可能影响少数语种的表现。
  • 软掩码调度参数需精细调节,训练过程复杂,参数调优成本较高。
  • 模型在极端低资源语种或特定专业领域表现仍有待提升。

未来方向

未来将探索更高效的训练策略,减少数据依赖,提升低资源语种表现。结合多模态信息,扩展跨模态跨语种能力。同时,优化模型结构,降低推理成本,增强实际应用适应性。

AI 总览摘要

Conan-Embedding-v2代表了文本嵌入技术的一个重要突破。传统方法多依赖微调预训练模型,受限于数据和训练差异,效果有限。本文提出从零训练的1.4B参数Transformer模型,通过引入新闻和多语种配对数据,弥补数据鸿沟。创新性地设计软掩码机制,使模型在训练中逐步从因果掩码过渡到双向掩码,解决训练中的掩码类型差异问题。结合跨语言检索数据集,支持26语种的跨语义匹配,显著提升多语种表示能力。此外,提出动态硬负样本挖掘策略,持续增加负样本难度,增强模型判别能力。训练流程包括预训练、SFT、弱监督和有监督微调,利用InfoNCE和CoSENT损失优化多任务性能。实验结果显示,Conan-Embedding-v2在MTEB和中文MTEB上均达到了SOTA,参数规模仅1.4B,远优于大模型和专用嵌入模型。在零样本测试中表现尤为出色,验证了其强泛化能力。跨语言检索任务中,模型在MKQA基准上实现了最高R@20和nDCG@10,展现出优异的多语种对齐能力。这一研究不仅推动了多语种文本表示的发展,也为实际应用中的多任务、多场景提供了强大工具。未来,将继续优化模型结构,降低成本,扩展多模态能力,推动大模型在多语言环境中的普及。

深度分析

研究背景

随着大规模预训练模型的发展,文本嵌入技术已成为自然语言处理中的核心。早期的Word2Vec、GloVe等方法通过词向量实现基本语义表达,随后BERT、RoBERTa等模型引入上下文信息,极大提升了表示能力。近年来,基于大模型的文本嵌入在信息检索、问答、语义匹配等任务中表现出色,但多依赖微调预训练模型,受限于数据差异和训练方式。微调方法如LoRA虽降低参数成本,但仍受训练差异影响,效果有限。多语种场景下,跨语言表示的融合成为难点,现有方法多用平行语料或少量多语种数据,效果仍不理想。Conan-Embedding-v2试图从根本上解决这些问题,通过从零训练模型,结合丰富的多语种和新闻数据,推动多语种、多任务的统一表示。

核心问题

现有文本嵌入模型多依赖微调预训练模型,面临数据鸿沟和训练差异的双重挑战。微调受限于预训练语料的局限性,难以实现跨任务和跨语言的高质量表示。多语种场景中,模型难以有效融合不同语言的语义信息,导致性能不平衡。此外,因果掩码和双向掩码的训练差异限制了模型在多任务中的表现,特别是在多语种、多任务环境下,模型的泛化能力不足。解决这些问题需要一种从根本上改变训练策略的方法,兼顾多语种、多任务、多场景的需求。

核心创新

本文的核心创新包括:1)从零训练1.4B参数Transformer模型,突破微调限制,提升模型自主学习能力;2)引入软掩码机制,实现因果掩码到双向掩码的平滑过渡,解决训练中的掩码类型差异;3)设计跨语言检索数据集,支持26语种的跨语义匹配,增强多语种融合能力;4)提出动态硬负样本挖掘策略,持续提升负样本难度,增强判别能力。这些创新结合,显著提升多语种文本嵌入的质量和泛化能力,推动模型在多任务、多场景中的应用。

方法详解

  • �� 预训练阶段:采用新闻、问答、网页数据,训练8层、隐藏维度3584的Transformer模型,支持32,768 tokens输入。• 引入多语种配对数据,扩展训练语料,结合新闻和多语种数据弥合数据差距。• 软掩码机制:定义调度函数α(t),逐步从0变到1,调节掩码类型,平滑过渡因果到双向掩码。• 跨语种检索数据集:采集26语种的检索对,翻译查询,支持跨语义匹配。• 动态硬负样本挖掘:在训练中实时检测负样本难度,替换不再困难的负样本,保持训练难度。• 多阶段训练:包括弱监督、微调、任务微调,结合InfoNCE和CoSENT损失优化多任务性能。

实验设计

使用MTEB和中文MTEB作为主要评估基准,比较多种模型性能。训练中调节参数,验证软掩码和负样本策略的效果。在零样本和有监督环境下测试模型泛化能力。跨语言检索在MKQA上评估多语种对齐。通过消融实验验证各组件贡献,分析不同设置对性能的影响。模型参数规模控制在1.4B,推理速度在合理范围内,确保实用性。

结果分析

Conan-Embedding-v2在MTEB和中文MTEB上均达SOTA,分类任务得分超过91,重排序73,平均分超过73分。零样本环境中,英文表现73.52,优于对比模型。跨语言检索在MKQA上,R@20提升3.6%,nDCG@10提升5.7%。消融实验显示软掩码和硬负样本策略对性能提升显著,验证了设计的有效性。整体结果表明,从零训练结合创新机制能显著优于微调方案。

应用场景

模型可广泛应用于多语种信息检索、跨语言问答、语义匹配等场景。支持多任务、多语种环境,适合构建多语言搜索引擎、多语种知识库等。未来结合多模态信息,有望实现更丰富的跨模态、多语种应用,推动国际化信息处理的发展。

局限与展望

模型依赖大量多语种数据,少数低资源语种表现仍有限。软掩码调度参数复杂,训练调优成本高。在极端低资源或专业领域,性能可能不足。未来需优化训练效率,扩展多模态能力,提升低资源语种表现。

通俗解读 非专业人士也能看懂

想象一个工厂里有很多不同的机器,每台机器都要学会识别各种不同的产品。以前,工厂会用专门的培训让每台机器只学会一部分产品,但这样效率很低。现在,这个新方法像是让所有机器从一开始就学会了所有产品的特征,而且还设计了一种特殊的调节机制,就像给机器逐步调整学习策略,让它们既能专注细节,又能看全局。这样,工厂的机器不但学得快,还能同时处理多种产品,更聪明、更灵活。这个方法还让不同国家的机器都能理解彼此的产品信息,就像让来自不同国家的工人都能用同一种标准识别商品一样。通过不断调整学习难度,工厂里的机器也变得越来越厉害,能应对各种复杂的任务。最终,这个系统可以用在搜索引擎、翻译、问答等很多地方,让信息变得更快、更准、更智能。

简单解释 像给14岁少年讲一样

想象你在学校里学不同的语言和知识,以前老师会给你一本书,然后你反复阅读,直到记住为止。但如果你能从一开始就学会理解各种语言和内容,甚至还能帮朋友翻译,那就更厉害了。这就是Conan-Embedding-v2做的事:它从头开始学会理解不同语言的句子,不用特别的微调,只用一些聪明的技巧,让它逐步变得更聪明。它还设计了一个特别的“调节器”,让模型一开始像只看一部分信息,后来逐渐学会看全局,就像你从只看重点到能理解整篇文章一样。这样,它可以在很多任务中表现得非常好,比如找信息、回答问题,甚至帮不同语言的人沟通。它还能不断挑战自己,学习更难的例子,让自己变得更聪明。最终,这个模型能在多语种、多任务环境中表现出色,帮助我们更快、更准地找到想要的信息。

术语表

Transformer (变换器)

一种深度学习模型结构,擅长处理序列数据,广泛应用于自然语言处理。

模型架构基础,用于实现文本理解和生成。

软掩码机制

一种动态调节掩码类型的方法,使模型逐步从因果掩码过渡到双向掩码。

解决训练中掩码类型差异的问题。

跨语言检索数据集

包含多语种问答对,用于训练模型理解不同语言间的语义关系。

支持多语种表示融合。

InfoNCE损失

一种对比学习损失,用于最大化正样本间的相似度,最小化负样本间的相似度。

优化文本嵌入的相似性。

动态硬负样本挖掘

在训练过程中实时检测负样本难度,替换不再困难的负样本,保持训练挑战性。

提升模型判别能力。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步降低模型训练成本,提升效率,尤其是在低资源语种中实现高性能。
  • 2 软掩码调度参数的最优设置及其对模型表现的影响机制尚不完全清楚。
  • 3 多模态、多任务融合的潜力及其实现路径仍需深入探索。

应用场景

近期应用

多语种搜索引擎

利用模型实现跨语种信息检索,提高搜索的准确性和覆盖面,适合多语言国家和企业。

多语种问答系统

支持多语种用户提问,提供准确答案,提升国际化服务能力。

远期愿景

全球知识图谱

构建多语种、多模态的知识库,实现全球信息的无缝连接与智能管理。

原文摘要

Large language models (LLMs) have recently demonstrated excellent performance in text embedding tasks. Previous work usually use LoRA to fine-tune existing LLMs, which are limited by the data and training gap between LLMs and embedding models. In this work, we introduce Conan-embedding-v2, a new 1.4B-parameter LLM trained from scratch and fine-tuned as a text embedder. First, we add news data and multilingual pairs for LLM pretraining to bridge the data gap. Based on this, we propose a cross-lingual retrieval dataset that enables the LLM to better integrate embeddings across different languages. Second, whereas LLMs use a causal mask with token-level loss, embedding models use a bidirectional mask with sentence-level loss. This training gap makes full fine-tuning less effective than LoRA. We introduce a soft-masking mechanism to gradually transition between these two types of masks, enabling the model to learn more comprehensive representations. Based on this, we propose a dynamic hard negative mining method that exposes the model to more difficult negative examples throughout the training process. Being intuitive and effective, with only approximately 1.4B parameters, Conan-embedding-v2 achieves SOTA performance on both the Massive Text Embedding Benchmark (MTEB) and Chinese MTEB (May 19, 2025).

cs.CL cs.AI