SAM-D2Q: Aligning Multimodal Doc2Query with Search Demand and Conversion for E-commerce

TL;DR

SAM-D2Q通过多模态文档扩展提升电商搜索,GMV提高3.38%。

cs.IR 🔴 高级 2026-09-04 88 次浏览
Hui Zhou Jian Hui Ji Lei Ma Rong Xiao Xiaoyi Zeng
电商搜索 多模态 文档扩展 强化学习 业务对齐

核心发现

方法论

SAM-D2Q框架包含三个阶段:任务适应的多模态监督微调、多模态数据增强、基于强化学习的偏好对齐。通过视觉信号和业务目标优化生成伪查询。

关键结果

  • 结果1:离线实验显示,SAM-D2Q在检索性能上优于传统Doc2Query方法,GMV提升3.38%。
  • 结果2:在线测试中,支付次数增加2.27%。
  • 结果3:多模态数据增强提高了视觉属性的感知能力。

研究意义

该研究通过多模态信息结合商业目标优化电商搜索,解决了传统方法在语义相关性和商业价值上的不足,显著提升了检索性能和商业指标。

技术贡献

提出了工业化多模态Doc2Query框架,结合视觉信号和业务目标优化,提供了新的工程可能性和理论保证。

新颖性

首次在布尔检索约束下实现多模态Doc2Query,扩展词必须提供召回增益和商业效用。

局限性

  • 局限1:模型可能在低质量数据上过拟合,影响扩展词的有效性。
  • 局限2:视觉属性的识别依赖于图像质量。

未来方向

未来工作可探索更复杂的视觉信号处理和更广泛的商业目标优化,以进一步提升模型性能。

AI 总览摘要

电商搜索面临用户查询与商品标题之间的词汇不匹配问题。传统的Doc2Query方法虽然能生成伪查询扩展文档,但仅基于文本,未能充分优化商业目标。SAM-D2Q框架通过多模态信息结合商业目标优化电商搜索,显著提升了检索性能和商业指标。

SAM-D2Q包含三个阶段:任务适应的多模态监督微调、多模态数据增强、基于强化学习的偏好对齐。通过视觉信号和业务目标优化生成伪查询,离线实验显示其在检索性能上优于传统方法,在线测试中,商业指标如GMV和支付次数均有显著提升。

该研究通过结合视觉信号和商业目标优化,解决了传统方法在语义相关性和商业价值上的不足,为电商搜索提供了新的解决方案。未来工作可进一步探索更复杂的视觉信号处理和更广泛的商业目标优化,以提升模型性能。

深度分析

研究背景

随着电商的快速发展,在线购物已成为全球用户日常生活的重要组成部分。电商搜索引擎是连接用户意图与海量商品库存的关键。尽管神经检索方法取得了显著进展,但基于关键词的检索仍是大型电商搜索系统的核心,因其低延迟、高可解释性和冷启动产品的鲁棒性。

核心问题

电商搜索面临词汇不匹配问题,即用户查询与商品描述可能使用不同术语表达相同意图。传统Doc2Query方法主要优化文本数据的语义相关性,忽略了关键的商业信号,如搜索页面浏览量和转化率。

核心创新

SAM-D2Q框架通过多模态信息结合商业目标优化电商搜索。它通过视觉信号、多模态数据合成和业务对齐优化生成扩展查询,使其不仅在产品内容上有依据,还能为后续商业绩效提供价值。

方法详解

  • �� 任务适应的多模态监督微调:增强产品标题、图像和用户查询的视觉语言理解。
  • �� 多模态数据增强:提高视觉属性的感知能力和扩展覆盖。
  • �� 基于强化学习的偏好对齐:鼓励模型生成更符合用户意图和商业价值的伪查询。

实验设计

实验设计包括离线实验和在线A/B测试。离线实验显示SAM-D2Q在检索性能上优于传统方法,在线测试中,商业指标如GMV和支付次数均有显著提升。

结果分析

离线实验显示,SAM-D2Q在检索性能上优于传统Doc2Query方法,GMV提升3.38%。在线测试中,支付次数增加2.27%。多模态数据增强提高了视觉属性的感知能力。

应用场景

SAM-D2Q可直接应用于电商搜索系统,提升用户查询与商品标题的匹配度,增加商业指标如GMV和支付次数。

局限与展望

模型可能在低质量数据上过拟合,影响扩展词的有效性。视觉属性的识别依赖于图像质量。未来工作可探索更复杂的视觉信号处理和更广泛的商业目标优化。

通俗解读 非专业人士也能看懂

想象你在商场购物,寻找一件完美的红色连衣裙。商场的商品标签可能没有明确标出“红色连衣裙”,但你可以通过观察商品的颜色和风格来找到它。类似地,SAM-D2Q通过分析商品的图像和标题,生成更符合用户搜索意图的查询,使得搜索结果更贴近用户需求。

简单解释 像给14岁少年讲一样

嘿,小朋友!想象你在玩一个寻找宝藏的游戏。你有一个地图,上面有一些线索,但这些线索可能不够详细。SAM-D2Q就像一个超级助手,它能帮你根据地图上的线索和图片找到更多的宝藏,让你的游戏更有趣!

术语表

Doc2Query (文档到查询)

一种通过生成伪查询来扩展文档的方法。

用于解决电商搜索中的词汇不匹配问题。

GMV (商品交易总额)

衡量电商平台销售额的指标。

用于评价SAM-D2Q的商业效果。

多模态 (Multimodal)

结合多种数据类型(如文本和图像)的技术。

用于增强电商搜索的视觉语言理解。

强化学习 (Reinforcement Learning)

一种通过奖励机制优化模型行为的机器学习方法。

用于优化伪查询生成的商业价值。

偏好对齐 (Preference Alignment)

使模型生成的结果更符合用户意图和商业目标的过程。

用于提高伪查询的商业效用。

开放问题 这项研究留下的未解疑问

  • 1 如何在低质量数据上保持模型的扩展词有效性?
  • 2 如何进一步优化视觉信号处理以提升模型性能?

应用场景

近期应用

电商搜索优化

通过多模态信息结合商业目标优化电商搜索,提升用户查询与商品标题的匹配度。

远期愿景

智能购物助手

结合多模态信息和商业目标优化,提供更智能的购物体验。

原文摘要

E-commerce search often suffers from vocabulary mismatch between user queries and merchant-authored product titles, since short titles cannot fully cover diverse user expressions or visual product attributes. Although Doc2Query alleviates this issue by generating pseudo-queries for document expansion, traditional methods are text-only and not optimized for e-commerce business objectives. As a result, they may produce semantically plausible but commercially ineffective expansions and miss key attributes present in product images. To this end, we propose E-commerce Search-Aligned Multimodal Doc2Query (SAM-D2Q), a business-aligned multimodal document expansion framework for e-commerce search under Boolean retrieval constraints. SAM-D2Q consists of three stages: (1) task-adapted multimodal supervised fine-tuning to enhance vision-language understanding of product titles, images, and user queries; (2) multimodal data augmentation to improve perception of key visual attributes and expansion coverage; and (3) reinforcement-learning-based preference alignment toward search business objectives, encouraging the model to generate pseudo-queries that better match user intent and commercial value. Offline experiments show that SAM-D2Q substantially improves retrieval performance over traditional Doc2Query methods. Deployed in the AliExpress production search system, SAM-D2Q improves online business metrics, increasing GMV by +3.38% and Pay Count by +2.27%.

cs.IR