LGAI-EMBEDDING-Preview Technical Report

TL;DR

基于Mistral-7B的指令式文本嵌入框架,结合软监督与硬负样本挖掘,提升多任务表现。

cs.CL 🔴 高级 2025-06-09 47 次浏览
Jooyoung Choi Hyun Kim Hansol Jang Changwook Jun Kyunghoon Bae Hyewon Choi Stanley Jungkyu Choi Honglak Lee Chulmin Yun
自然语言处理 文本嵌入 大模型 指令调控 信息检索

核心发现

方法论

该方法利用decoder-only大模型Mistral-7B,通过结构化指令和少样本示例引导模型实现多任务文本嵌入。结合在上下文中学习(In-Context Learning)、软监督(软标签)和自适应硬负样本挖掘,避免任务微调。软标签由高性能密集检索器和重排序器提取连续相关性分数,作为细粒度监督信号。硬负样本通过相似度过滤,提升训练稳定性。模型在多任务基准MTEB-v2上表现优异,排名靠前。

关键结果

  • 在41个任务中,模型在检索任务中得分66.18,STS任务86.69,配对分类88.67,摘要任务38.93,均优于多数大模型,表现出强泛化能力。
  • 相较于完全微调模型,本文模型无需参数微调,依靠指令和软监督实现多任务适应,效果与微调模型相当甚至更优。
  • 引入自适应边际硬负挖掘,有效过滤语义模糊负样本,提升训练稳定性和检索鲁棒性。

研究意义

该研究突破了传统微调限制,展示了利用大模型的内在泛化能力,通过结构化指令和软监督实现高质量、多任务的文本嵌入。对信息检索、文本分类、聚类等场景具有重要推动作用,降低了微调成本,提升模型适应性,为大规模应用提供新思路。

技术贡献

提出无微调多任务文本嵌入方案,结合结构化指令、软标签和自适应硬负挖掘,充分利用decoder-only大模型潜能。引入密集检索器的连续相关性分数作为软监督信号,创新性地实现多任务泛化。采用RRF融合多模检索策略,提升检索效果。模型在无需参数微调的情况下,兼顾多任务性能,展现出优异的泛化能力。

新颖性

首次在不微调的情况下,结合结构化指令、软标签与自适应硬负样本挖掘,构建通用文本嵌入模型。区别于传统微调或结构改造方法,充分利用大模型的上下文学习能力,显著提升多任务表现。

局限性

  • 模型依赖高质量的检索器和重排序器,若检索质量下降,嵌入效果受影响。
  • 在极端语义模糊或少样本场景中,软标签可能不足以捕捉细粒度差异。
  • 当前方法未充分考虑多语言或跨领域适应性,未来需扩展多语种能力。

未来方向

未来将探索多语言、多领域的泛化能力,结合更强的软监督策略,提升模型在少样本和偏域任务中的表现。同时,优化检索-重排序流程,降低依赖,提高效率。

AI 总览摘要

随着大规模语言模型(LLMs)的崛起,文本嵌入作为多任务基础表示的重要性日益凸显。传统方法多依赖微调模型参数,成本高且缺乏灵活性。本文提出基于Mistral-7B的指令式文本嵌入框架,结合在上下文中学习(ICL)、软监督和自适应硬负样本挖掘,实现无需微调的多任务泛化能力。

该方法利用结构化指令和少样本示例引导模型理解任务,软标签由高性能密集检索器提供连续相关性分数,作为细粒度监督信号。硬负样本通过相似度过滤,避免语义模糊的负样本干扰训练。模型在新引入的MTEB-v2基准上表现优异,涵盖41个任务类别,包括检索、分类、聚类、语义相似和摘要,整体排名靠前。

实验结果显示,该模型在检索任务中得分66.18,STS任务86.69,配对分类88.67,摘要任务38.93,均优于多项大模型,验证了其强泛化能力。引入自适应边际硬负挖掘,有效提升训练稳定性和鲁棒性。该研究突破了微调限制,展示了利用大模型潜能实现多任务高效嵌入的可能,为信息检索、文本理解等应用提供新思路。未来,将扩展多语种、多领域能力,优化检索流程,推动大模型在实际场景中的应用落地。

深度分析

研究背景

近年来,文本嵌入技术成为自然语言处理的核心,代表性工作包括BERT、SBERT、CLIP等。随着大模型的发展,越来越多研究尝试用LLMs作为通用编码器,如Llama2Vec、E5-Mistral、NV-Embed,取得显著提升。然而,这些方法多依赖微调,成本高,泛化能力有限。近年来,利用大模型的上下文学习能力,采用少样本指令调控,成为新的研究热点。尽管如此,如何在不微调的情况下实现多任务高质量嵌入,仍是挑战。

核心问题

现有方法多依赖微调或结构改造,成本高且不易扩展。微调模型在多任务环境下缺乏灵活性,且容易过拟合。如何充分利用大模型的内在泛化能力,设计一种无需微调、能适应多任务的通用文本嵌入方案,成为行业和学术界关注的焦点。特别是在多任务、多场景应用中,模型的适应性和效率尤为关键。

核心创新

本研究提出:1)利用结构化指令和少样本示例实现上下文感知嵌入,避免微调;2)引入密集检索器的连续相关性分数作为软监督信号,提升语义区分能力;3)采用自适应边际硬负挖掘,过滤语义模糊负样本,增强训练稳定性。这些创新突破了传统微调限制,充分挖掘大模型潜能,显著提升多任务性能。

方法详解

  • �� 结构化指令+少样本示例:在输入中加入任务定义和示范对,模型通过上下文学习理解任务。
  • �� 软监督:利用密集检索器(ANNA IR)生成连续相关性分数,作为训练中的细粒度标签。
  • �� 硬负挖掘:根据相关性分数,动态过滤语义模糊的负样本,采用边际比例控制。
  • �� 多模检索融合:结合BM25、密集检索和重排序器的得分,采用RRF算法融合。
  • �� 训练:使用InfoNCE对比损失,结合软标签和硬负样本,优化嵌入空间。

实验设计

在多任务基准MTEB-v2上进行评估,涵盖检索、分类、聚类、STS和摘要任务。使用公开数据集如MSMARCO、Natural Questions、Quora、STS-B等。模型采用LoRA微调,训练一轮,学习率1e-4,硬负样本采用自适应边际过滤。对比多种SOTA模型,分析不同策略的贡献。

结果分析

模型在41任务中平均得分74.12,检索任务66.18,STS86.69,配对分类88.67,摘要38.93,优于多数大模型。引入软标签和硬负挖掘显著提升性能,验证了多任务泛化能力。模型在不微调的情况下,表现出与微调模型相当甚至更优的效果,展示了强大的上下文感知和泛化能力。

应用场景

可广泛应用于搜索引擎、推荐系统、文本分类、语义匹配等场景。无需微调,便于快速部署,适应多变任务需求。未来可结合多语言、多领域数据,提升跨域适应性,推动行业智能化升级。

局限与展望

依赖检索器和重排序器质量,若检索效果差,嵌入性能受影响。对极端语义模糊或少样本场景表现有限。当前未充分考虑多语种和跨领域扩展,未来需加强多语能力和模型鲁棒性。

通俗解读 非专业人士也能看懂

想象一个工厂里,有很多不同的机器负责不同的任务。以前,每台机器都需要专门调试,才能做好工作,既费时间又费钱。现在,我们用一种聪明的机器人,它可以通过阅读说明书(指令)自己学习怎么做不同的任务,不需要每次都调试。这个机器人还能从其他工厂的经验中学习(软监督),知道哪些工作是重要的,哪些可以忽略。它还会挑选那些难以区分的错误样本(硬负样本),确保自己不被误导。这样一来,无论是找货、分类商品还是总结信息,这个机器人都能快速适应,表现得很好。它就像一个万能的助手,能帮你完成各种任务,而且不用每次都重新训练。

简单解释 像给14岁少年讲一样

想象你有一个超级聪明的朋友,他可以通过听你说话,马上理解你要做什么,比如帮你找书、分类照片或者总结故事。以前,要让他学会这些技能,你得花很多时间教他每一种任务,还要反复调试。现在,这个朋友有个特别的本领:只要你给他一些说明和例子,他就能自己理解任务的意思,不需要专门训练。更厉害的是,他还能从别的朋友那里学到一些秘密技巧(软监督),知道哪些答案更靠谱,还会避开那些模糊不清的错误答案(硬负样本)。这样一来,他就能快速帮你完成各种不同的任务,而且表现得非常棒。就像你身边的万能助手,能帮你省时省力,还能应对各种新挑战!

原文摘要

This report presents a unified instruction-based framework for learning generalized text embeddings optimized for both information retrieval (IR) and non-IR tasks. Built upon a decoder-only large language model (Mistral-7B), our approach combines in-context learning, soft supervision, and adaptive hard-negative mining to generate context-aware embeddings without task-specific fine-tuning. Structured instructions and few-shot examples are used to guide the model across diverse tasks, enabling strong performance on classification, semantic similarity, clustering, and reranking benchmarks. To improve semantic discrimination, we employ a soft labeling framework where continuous relevance scores, distilled from a high-performance dense retriever and reranker, serve as fine-grained supervision signals. In addition, we introduce adaptive margin-based hard-negative mining, which filters out semantically ambiguous negatives based on their similarity to positive examples, thereby enhancing training stability and retrieval robustness. Our model is evaluated on the newly introduced MTEB (English, v2) benchmark, covering 41 tasks across seven categories. Results show that our method achieves strong generalization and ranks among the top-performing models by Borda score, outperforming several larger or fully fine-tuned baselines. These findings highlight the effectiveness of combining in-context prompting, soft supervision, and adaptive sampling for scalable, high-quality embedding generation.

cs.CL