OptAgent: Optimizing Query Rewriting for E-commerce via Multi-Agent Simulation

TL;DR

OptAgent以多智能体模拟和遗传算法优化电商查询,整体得分提升21.98%,较BoN高3.36%。

cs.AI 🔴 高级 2025-10-04 19 次浏览
Divij Handa David Blincoe Orson Adams Yinlin Fu
查询重写 多智能体模拟 遗传算法 LLM评估 电商搜索

核心发现

方法论

OptAgent先用LLM生成初始查询种群,再让多个不同temperature的Gemini-2.5-Flash购物代理评估搜索结果。代理为商品赋予−1、0、1三档相关性分数,并模拟购买行为;平均相关性与归一化购买金额组成适应度。遗传算法通过选择、交叉和突变迭代改写查询。

关键结果

  • 在Etsy的1000条真实查询上,OptAgent总体适应度为0.7441,原始查询为0.6100,提升21.98%;LLM-Rewrite为0.5509,BoN-Rewrite为0.7199,因此OptAgent较BoN提升3.36%。
  • 各子集均优于基线:Head、Torso、Tail、Fandom和多语言查询分别达到0.7660、0.7377、0.6405、0.7969和0.8547。相对原始查询的最大提升出现在Tail查询,约28.67%。
  • 287条查询的人评与代理分数相关系数为Pearson r=0.552(p<0.001),人类间相关为0.532。去除全部进化操作后得分降至0.6965,交叉单独贡献明显,突变影响仅约0.3%。

研究意义

论文回应了主观任务缺少标准答案、难以直接优化的长期问题。它把“用户是否会觉得结果合适”转化为可计算但动态的模拟信号,减少对昂贵人工标注和历史点击日志的依赖。对电商而言,该方法尤其适合新词、低频词和长尾查询;对研究而言,它展示了测试时计算、多代理评估与进化搜索结合的可扩展范式。

技术贡献

核心技术是将多代理语义评分与购买模拟整合为连续适应度。每个商品分数先跨代理平均,再构造Top-10平均相关性、全结果相关性和指数归一化购买价值的加权目标,权重为0.5、0.4、0.1。遗传操作由LLM直接在自然语言空间执行,使交叉具有语义组合能力,避免单次重写或贪心搜索的局部最优。

新颖性

新意不只是使用LLM评判,而是让多个无固定人格、仅改变temperature的购物代理形成动态评估群体,并将其作为遗传算法的适应度函数。相较静态奖励模型、单一LLM裁判和Best-of-N采样,OptAgent把“评估多样性”与“候选生成搜索”统一起来。

局限性

  • 代理无法稳定读取网页交互控件中的颜色、尺码等信息,导致部分商品相关性判断失真。
  • 代理可能过度依赖评论数量或评论内容,使新商品即使高度相关也被低估;其与人评仅中度相关,仍是噪声奖励。
  • 实验集中于Etsy、1000条查询和Gemini-2.5-Flash,成本、模型迁移性及真实点击或转化收益尚未充分验证。

未来方向

后续应引入结构化商品属性、网页交互解析和真实用户反馈,校准代理对评论、新品及低资源语言的偏差。还可研究自适应temperature、代理数量与成本的权衡,并用在线A/B测试检验查询重写是否真正提高点击率、购买率和长期满意度。

AI 总览摘要

电商查询往往只有几个词、包含错别字或隐藏偏好,例如“更快配送”或“高质量评论”。查询重写的目标不是改写得更通顺,而是让搜索结果更贴近用户意图。然而,这类任务没有唯一标准答案。传统方法依赖历史日志,RLHF成本高,单一LLM裁判又容易受位置、长度和表达方式影响。

OptAgent提出一种“模拟购物者评估、遗传搜索改写”的框架。系统先生成多个语义相近的候选查询,再让一组使用不同temperature的LLM代理检查商品标题、描述、图片、价格、评分、评论和配送信息。代理为商品标注“完全相关、部分相关、不相关”,随后模拟购买并计算总金额。平均相关性和归一化购买价值组成适应度,遗传算法再通过选择、LLM交叉和突变产生下一代候选。

在Etsy 1000条真实查询上,OptAgent总分0.7441,高于原始查询0.6100和Best-of-N基线0.7199;相对原始查询提升21.98%,较BoN提升3.36%。Tail查询提升约28.67%,说明进化搜索对数据稀疏场景尤其有用。人评相关系数为0.552,但网页隐藏属性、评论偏差和低资源语言仍限制可靠性。总体而言,论文提供了在没有明确奖励函数时,用多智能体模拟构造优化信号的实用路线。

深度分析

研究背景

LLM已在数学、代码等可验证任务中通过STaR和GRPO取得进展,但电商查询重写缺少唯一答案。既有方法包括基于历史匹配的编码器、Seq2Seq语义分类、强化学习改写和session graph个性化;它们依赖大量交互数据,难以覆盖Tail查询。RLAIF虽降低人工成本,单一LLM-as-a-Judge仍存在偏差和不稳定性。

核心问题

给定用户原始查询,系统需生成更能表达潜在意图的查询,使搜索结果既相关又能促成合理购买。难点在于意图通常未明示,商品质量还涉及属性、评论、价格和配送;没有gold label时,奖励函数难以设计。简单重写可能改变意图,贪心优化也容易陷入局部最优。

核心创新

  • �� 用多名购物代理替代单一裁判,并以temperature sampling制造不同推理路径。• 将商品级−1/0/1语义判断、Top-10质量、全页质量和购买价值合成连续适应度。• 用LLM执行自然语言交叉与突变,在语义空间搜索,而非只抽样一次。• 通过群体式遗传搜索应对代理奖励的随机噪声,特别面向长尾和多语言查询。

方法详解

  • �� 初始种群:LLM将原查询改写为多个语义相近候选。• 检索评估:每个候选触发商品搜索;代理读取标题、描述、图片、价格、评分、前四条评论和配送信息,并过滤广告商品。• 语义评分:每个代理对商品输出−1、0或1及理由;跨K名代理平均得到商品分数。• 购买模拟:代理选择愿意购买的商品并计算raw purchase value。• 适应度:F=w10·s10+wa·sa+wp·p,其中w10=0.5、wa=0.4、wp=0.1,购买价值采用指数归一化。• 进化:保留高分个体,概率0.7进行交叉,概率0.1进行突变,最多四代,输出全程最高分查询。

实验设计

数据来自Etsy的1000条无PII查询,划分为Head、Torso、Tail、Fandom和多语言类别,其中多语言部分含150条查询。模型为Gemini-2.5-Flash,代理temperature为0.00、0.25、0.50、0.75、1.00。基线包括原始查询、一次LLM-Rewrite和生成8个候选的BoN-Rewrite。研究还对287条查询进行专家标注,报告Pearson相关,并移除进化操作、交叉或突变开展消融。

结果分析

OptAgent总体得分0.7441,超过原始查询0.6100、LLM-Rewrite 0.5509和BoN 0.7199。Tail、Fandom和多语言查询显示较强收益;多语言中意大利语提升32.36%,Others仅较BoN提升0.49%。四代中适应度持续上升但后期趋于饱和。消融显示去除全部进化操作降至0.6965,去除交叉为0.6987,去除突变为0.7419,说明交叉是主要增益来源。

应用场景

搜索平台可在没有充分历史日志的新商品、新词和长尾查询上使用该框架。线上部署前,可把代理模拟作为离线候选筛选器,输出最优改写,再由安全规则和人工抽检过滤。该方法也可扩展到站内推荐、广告检索、跨语言搜索和客服意图标准化,但需要控制多次LLM调用成本。

局限与展望

代理评估不是人类偏好的完美替代,r=0.552表明仍有明显噪声。网页交互属性无法完整读取,评论偏好会惩罚新品,且低资源语言表现较弱。购买价值可能与相关性冲突,研究还未报告真实线上点击率、转化率或长期满意度。未来应结合结构化页面解析、真实反馈、成本感知搜索和跨模型验证。

通俗解读 非专业人士也能看懂

把电商搜索想成一家大型商场。顾客只递给店员一张潦草纸条:“适合生日的蓝色礼物,快点到”。店员不能只把字改漂亮,因为真正重要的是顾客想买什么。OptAgent会先写出许多意思相近的购物清单,然后请几位“虚拟顾客”分别逛商场。

每位虚拟顾客都会看商品名称、图片、价格、评价和配送时间,把商品分成很合适、有点合适和不合适三类,还会决定哪些商品值得买。不同顾客的判断不会完全一样,就像真实家庭成员各有偏好。系统把这些意见合起来,既看前几件商品是否合适,也看整页质量和可能的购买金额。

接着,系统像选拔比赛一样保留好清单,让两个好清单互相组合,或对一个清单做小修改,再重新请虚拟顾客评价。经过几轮后,清单通常变得更好。它在1000条Etsy查询上比原始查询高21.98%,但虚拟顾客仍可能看不见下拉菜单里的尺码,也可能因为新品评论少而误判。因此,它更像高效试衣顾问,而不是万能读心术。

简单解释 像给14岁少年讲一样

想象你在游戏里输入:“生日礼物,蓝色,快到”。搜索系统不知道你是要衣服、杯子还是装饰品。普通做法可能只把句子改得更完整,但改错一个重点,结果就会跑偏。OptAgent的办法像组建一支购物战队:每个队员都扮演不同风格的顾客,去看搜索结果并打分。

队员会检查商品图片、名字、价格、评分、评论和送货信息,然后判断它是“超匹配”“部分匹配”还是“不匹配”。他们还会模拟自己愿不愿意买。系统把所有队员的意见平均起来,避免一个裁判突然犯迷糊。不同temperature就像让队员拥有不同的思考习惯:有人保守,有人更愿意探索。

之后,系统像培养游戏角色一样进化查询。高分查询留下来,两个好查询可以合成一个,另一个查询则只改动几个词。重复几轮后,系统从很多候选中找到最好的版本。在Etsy的1000条真实查询中,它比原始查询提升21.98%,比Best-of-N方法再高3.36%。

不过它不是魔法。虚拟顾客可能看不到网页按钮里的颜色或尺码,也可能嫌新品没有评论。它更像一群聪明但不完美的测试玩家:能帮搜索系统找到更好的方向,但上线前仍需要真人测试和实际数据验证。

术语表

Query Rewriting(查询重写)

把用户原始搜索词改写成更清晰、能表达真实意图的形式。技术上,它是面向检索效果的自然语言生成任务。

OptAgent优化的目标对象。

Multi-Agent Simulation(多智能体模拟)

让多个LLM分别扮演评估者或用户,并汇总其判断。它用群体意见替代单一裁判。

用于构造动态适应度。

Genetic Algorithm(遗传算法)

通过选择、交叉和突变迭代改进候选解的群体式优化算法。它能在噪声奖励下保持多区域探索。

负责搜索更优查询。

Best-of-N

生成N个候选并选择评分最高者的推理时方法。它有多样性,但缺少连续的进化搜索。

主要基线,N约为8。

Temperature Sampling(温度采样)

调节生成概率分布的平滑程度;低温更确定,高温更探索。不同温度可产生不同推理路径。

用于增加代理评估多样性。

Fitness Function(适应度函数)

衡量候选查询质量的数值目标。本文综合Top-10相关性、全页相关性和归一化购买价值。

遗传算法的优化信号。

开放问题 这项研究留下的未解疑问

  • 1 代理分数与人评仅中度相关,尚不清楚增加代理数量、采用不同模型或引入真实用户画像能否稳定提高相关性。
  • 2 离线适应度0.7441是否能转化为线上点击率、转化率和满意度提升,论文没有A/B测试证据。
  • 3 低资源语言和新品评论稀缺造成明显误判,需要多语言模型、结构化属性和更公平的评分校准。

应用场景

近期应用

长尾查询离线优化

电商平台可对低频、错别字或新出现的查询生成多个候选,用模拟代理筛选后进入线上检索。前提是能访问商品页面和配送信息;预期收益是改善相关性,同时减少人工规则编写。

多语言搜索改写

平台可针对德语、法语、意大利语等查询使用多代理候选选择,但应先进行语言级质量评测。对低资源语言需要人工抽检和专门校准,避免将语言能力差异放大为搜索质量差异。

远期愿景

面向用户偏好的搜索优化器

未来可把模拟用户扩展为真实反馈驱动的长期系统,联合优化相关性、价格、配送、转化和满意度。主要障碍是成本、偏差、安全控制以及离线代理与真实消费者行为之间的差距。

原文摘要

Deploying capable and user-aligned LLM-based systems necessitates reliable evaluation. While LLMs excel in verifiable tasks like coding and mathematics, where gold-standard solutions are available, adoption remains challenging for subjective tasks that lack a single correct answer. E-commerce Query Rewriting (QR) is one such problem where determining whether a rewritten query properly captures the user intent is extremely difficult to figure out algorithmically. In this work, we introduce OptAgent, a novel framework that combines multi-agent simulations with genetic algorithms to verify and optimize queries for QR. Instead of relying on a static reward model or a single LLM judge, our approach uses multiple LLM-based agents, each acting as a simulated shopping customer, as a dynamic reward signal. The average of these agent-derived scores serves as an effective fitness function for an evolutionary algorithm that iteratively refines the user's initial query. We evaluate OptAgent on a dataset of 1000 real-world e-commerce queries in five different categories, and we observe an average improvement of 21.98% over the original user query and 3.36% over a Best-of-N LLM rewriting baseline.

cs.AI