Reasoning Quality Matters: Combating Reasoning Collapse in LLM-based Embedding Learning

TL;DR

CoFree框架通过两阶段方法解决LLM嵌入学习中的推理崩溃问题,提升了2.8 nDCG@10。

cs.IR 🔴 高级 2026-09-17 15 次浏览
Zihan Gong Xiaohan Ye Jiangchao Yao Jinsong Lan Xiaoyong Zhu Xu Chen
LLM 嵌入学习 推理崩溃 强化学习 信息检索

核心发现

方法论

CoFree框架通过两阶段方法解决推理崩溃问题。第一阶段采用参考引导的监督微调恢复推理能力,第二阶段通过双重奖励机制在强化学习中优化嵌入和推理质量。此方法确保了推理的细粒度相关性,并将嵌入学习转变为高质量的推理引导搜索过程。

关键结果

  • CoFree-4B在MTEB和BRIGHT的22个数据集上比Qwen3-Embedding-4B平均提升2.8 nDCG@10。
  • 在线实验显示在实际检索系统中取得了一致的提升。
  • 实验验证了CoFree在多种冻结嵌入骨干上的推理崩溃缓解效果。

研究意义

该研究通过提出CoFree框架,显著提升了LLM在嵌入学习中的推理质量。它解决了推理崩溃问题,确保了推理生成的相关性和嵌入的判别能力。这对于提高信息检索的准确性和效率具有重要意义。

技术贡献

CoFree框架在推理生成和嵌入判别能力之间取得了平衡。通过参考引导的监督微调和双重奖励强化学习,确保了推理的相关性和嵌入的判别能力,超越了现有的SOTA方法。

新颖性

CoFree首次系统性地解决了LLM嵌入学习中的推理崩溃问题,提出了参考引导的监督微调和双重奖励机制,显著提升了推理生成的相关性。

局限性

  • 在代码检索任务中表现略逊于某些基线模型,可能由于特定领域的推理需求差异。
  • 需要大量计算资源进行训练,限制了小型团队的使用。

未来方向

未来工作可以探索在更大规模数据集上的应用,以及在不同领域的适应性。还可以研究如何降低计算成本以提高可用性。

AI 总览摘要

大型语言模型(LLM)在生成上下文丰富的文本嵌入方面显示出巨大潜力,但在专注于嵌入目标时可能导致推理生成的退化,即推理崩溃。CoFree框架通过两阶段方法解决这一问题。首先,参考引导的监督微调恢复了推理能力,同时保留了基础嵌入模型的表现力。接着,通过双重奖励机制在强化学习中优化嵌入和推理质量。实验表明,CoFree在多个数据集上显著提升了检索性能,在线实验也显示出一致的提升。尽管在某些特定任务上仍有改进空间,CoFree为LLM嵌入学习提供了一个强有力的解决方案。

深度分析

研究背景

随着信息检索技术的发展,密集文本嵌入成为现代信息检索的基础组件。传统方法如TF-IDF和BM25虽然高效,但无法捕捉深层语义。大规模语言模型(LLM)的出现为嵌入学习带来了新的可能性,通过生成推理文本来增强嵌入的语义表达。

核心问题

现有方法在优化嵌入目标时可能抑制有用的推理生成或产生与检索无关的文本,导致推理崩溃。这种崩溃会影响检索的准确性和效率。

核心创新

CoFree框架通过两阶段方法解决推理崩溃问题。第一阶段采用参考引导的监督微调恢复推理能力,第二阶段通过双重奖励机制在强化学习中优化嵌入和推理质量。

方法详解

  • �� 参考引导的监督微调:恢复推理能力,保留嵌入表现力。

  • �� 双重奖励机制:在强化学习中优化嵌入和推理质量,确保推理的细粒度相关性。

实验设计

实验在MTEB和BRIGHT的22个数据集上进行,使用nDCG@10作为评价指标。与多个基线模型进行对比,验证了CoFree的有效性。

结果分析

CoFree-4B在多个数据集上比Qwen3-Embedding-4B平均提升2.8 nDCG@10。在线实验显示在实际检索系统中取得了一致的提升。

应用场景

CoFree可以直接应用于信息检索系统,提升检索的准确性和效率。适用于需要高质量文本嵌入的场景,如搜索引擎和推荐系统。

局限与展望

尽管CoFree在多个任务上表现优异,但在代码检索任务中表现略逊于某些基线模型。此外,训练过程需要大量计算资源,限制了小型团队的使用。

通俗解读 非专业人士也能看懂

想象一个图书馆,CoFree就像一个聪明的图书管理员。传统方法就像简单地按字母顺序排列书籍,而CoFree则能理解每本书的主题和内容,并根据读者的需求推荐最合适的书籍。通过这种方式,CoFree确保了每次推荐都是精准且相关的。

简单解释 像给14岁少年讲一样

想象你在玩一个大型多人在线游戏。游戏中有很多任务和线索,传统的方法就像只看任务的标题,而CoFree就像一个聪明的助手,能理解任务的背景和细节,帮助你找到最相关的线索。这样,你就能更快地完成任务,获得更多奖励!

术语表

推理崩溃 (Reasoning Collapse)

指在优化嵌入目标时,推理生成能力的退化,导致生成无关或不准确的文本。

在LLM嵌入学习中,推理崩溃会影响检索的准确性。

参考引导的监督微调 (Reference-Guided Supervised Fine-Tuning)

一种通过参考模型指导的微调方法,旨在恢复模型的推理生成能力。

用于CoFree框架的第一阶段,恢复推理能力。

双重奖励机制 (Dual Reward Mechanism)

在强化学习中同时优化嵌入和推理质量的机制。

用于CoFree框架的第二阶段,确保推理的细粒度相关性。

nDCG@10

一种用于评估信息检索系统性能的指标,考虑结果的相关性和排序。

用于评估CoFree在多个数据集上的性能。

信息检索 (Information Retrieval)

从大量数据中检索相关信息的过程。

CoFree旨在提升信息检索系统的准确性和效率。

开放问题 这项研究留下的未解疑问

  • 1 如何在更大规模数据集上应用CoFree?
  • 2 如何降低计算成本以提高CoFree的可用性?

应用场景

近期应用

搜索引擎优化

通过提高文本嵌入的质量,提升搜索结果的相关性和准确性。

远期愿景

智能推荐系统

在推荐系统中应用CoFree,提升个性化推荐的精度和用户满意度。

原文摘要

Large Language Models (LLMs) have recently shown strong potential for producing context-rich text embeddings for retrieval. Most existing methods either treat embedding learning as passive feature extraction or exploit LLM reasoning through instruction following for better embedding optimization. However, specialization toward embedding objectives can suppress useful reasoning generation or produce retrieval-irrelevant text. We refer to these two forms of degradation as reasoning collapse. To address this issue, we propose CoFree (Collapse-Free Reasoning Embedding), a two-stage framework that progressively integrates LLM reasoning into query and document embedding optimization while preserving reasoning quality. At the first stage, CoFree applies reference-guided supervised fine-tuning to restore the reasoning ability and retain representational strength of the foundation embedding model. At the second stage, we introduce dual rewards, an embedding-oriented reward and a reasoning-oriented reward, to guarantee fine-grained reasoning of the relevance toward the embedding goal in reinforcement learning. This endpoint-coupled optimization transforms embedding learning from static alignment into a high-quality reasoning-guided search process for retrieval. Extensive experiments demonstrate the effectiveness of CoFree, with CoFree-4B achieving an average absolute improvement of 2.8 nDCG@10 points over Qwen3-Embedding-4B across 22 datasets from MTEB and BRIGHT. Online experiments in a real-world retrieval system further show consistent gains. Code, RTED, and model checkpoints will be made publicly available.

cs.IR