Demand-Side Measurement for Generative Engine Optimization: Constructing and Validating a Million-Persona, Intent-Annotated Buyer Corpus

TL;DR

以MinHash LSH与语义去重构建PersonaGen-1M,得103万意图标注买家画像。

cs.IR 🔴 高级 2026-08-31 39 次浏览
Dmitrij Żatuchin Daniil Dzemesjuk
生成式引擎优化 合成画像 搜索意图 需求侧测量 信息检索

核心发现

方法论

研究从NVIDIA Nemotron-Personas-USA、BSC-LT m-Personas、Orange PersonasForSalesbot和Tencent PersonaHub汇集约4000万描述,先用128置换、8×16分桶的GPU MinHash LSH(Jaccard阈值0.9)去重,再以KaLM-Embedding-Gemma3-12B和余弦相似度0.9进行语义去重,最后用Grok-4-1-fast在temperature 0.7下结构化扩展。

关键结果

  • 最终PersonaGen-1M含1,031,732个画像、511个行业和4类市场,含19,416,821项行为属性:5,160,046条查询、5,132,320条信息需求、3,124,904个目标、3,115,862个痛点和2,883,689个未满足需求。
  • 主意图分布为信息型78.3%、商业型17.4%、交易型4.3%;商业型约17.96万画像对应近90万查询。FinTech试验抽取30个画像、150条查询,97.3%回答至少提及一个品牌,平均每答5.01个品牌。
  • 质量验证显示行业、市场、性别、意图归一化熵分别为0.37、0.58、0.73、0.57;行业×意图Cramér’s V=0.299。两品牌抽取模型一致率36.0%,平均Jaccard=0.737。

研究意义

论文把GEO从单纯观察模型输出推进到需求侧采样。由于查询语言可解释单次回答26.5%的方差,而品牌身份仅1.5%,由买家画像生成分行业、分阶段查询,比研究者凭经验编写探针更系统。preferred_sources还可与167,551条引用的来源数据连接,比较买家信任与引擎引用的差异。

技术贡献

贡献不是新的生成模型,而是可连接的测量基础设施:每个画像同时拥有primary_intent、典型查询和preferred_sources。MinHash LSH负责大规模词法筛选,KaLM嵌入负责语义近重复清理,Grok-4-1-fast负责固定JSON模式扩展;完整性达100%,首次生成合规率98.5%,重试后99.8%,质量过滤后保留103万条。

新颖性

相较PersonaHub、FinePersonas和Nemotron-Personas-USA,本工作把买家查询、阶段性商业意图和命名来源列表放入同一画像。MatrAIx Persona 1M虽有意图和来源字段,但意图偏对话行为、来源仅六类媒体枚举且无查询集;PersonaGen-1M更直接服务需求—供应连接。

局限性

  • 数据完全合成,查询是合理构造而非真实日志,不能直接估计真实买家意图或品牌需求。
  • 行业分布严重头部化:General、EdTech、Consulting占60.2%,前15类占94.9%;B2C占70.6%,存在来源数据偏差。
  • 每个画像只给查询集合一个主意图,难以表达真实会话中的多重意图;年龄重分类也包含照护者年龄推断。

未来方向

作者计划将商业型查询与供应侧品牌推荐份额、引用溯源连接,并以重复采样和释义控制估计影响。关键验证是把查询库与同产业真实商业搜索日志对照;还应进行跨供应商品牌抽取、语言与市场分层,以及平衡行业再采样。

AI 总览摘要

生成式引擎正在把搜索结果页变成一段直接回答:ChatGPT、Gemini和Perplexity不仅回答“买什么”,还会列出少量品牌。对品牌而言,成功不再只是网页排名,而是进入模型生成的推荐清单。然而,现有PersonaHub等大型画像资源主要服务训练数据多样性,缺少买家查询、购买阶段和信任来源,因此难以解释某品牌为何被推荐或遗漏。

Żatuchin与Dzemesjuk提出PersonaGen-1M,构建了1,031,732个合成买家画像。研究从约4000万条公开描述出发,以GPU MinHash LSH进行词法去重,再用KaLM-Embedding-Gemma3-12B语义去重,并通过Grok-4-1-fast扩展固定字段。结果覆盖511个行业和B2C、B2B、B2B2C、B2G四类市场,包含516万条查询;每个画像拥有信息型、商业型或交易型主意图,以及preferred_sources来源列表。

数据具有清晰的测量用途:商业型画像占17.4%,其查询可组成行业化推荐探针;来源偏好可与引擎引用溯源比较。FinTech试验中,150条查询的97.3%回答提及品牌,平均每答5.01个品牌,说明查询库能够触发推荐。但研究也明确承认合成数据、行业头部集中和意图单标签的局限。它提供的是可复用的需求侧仪器,而不是现实市场的无偏估计。

深度分析

研究背景

GEO研究关注生成式引擎回答中的品牌出现率。Aggarwal等人提出GEO;相关供应侧研究分析引用来源和品牌份额。已有工作表明,12,933个回答中查询语言解释26.5%的单次回答方差,品牌身份仅1.5%;因此只用研究者设计的固定问题会人为决定测量结果。传统画像规模小,PersonaHub虽达十亿级,却没有分阶段购买意图、信任来源和查询集。

核心问题

核心问题是如何构造可按行业、市场和购买阶段抽样的需求侧查询,并把它与供应侧的品牌推荐和引用数据连接。困难包括约4000万原始描述的重复、合成画像的结构化一致性、搜索意图 taxonomy 对生成式对话的适配,以及查询措辞、语言、轮次和随机性造成的回答波动。

核心创新

  • �� 将primary_intent、typical_queries和preferred_sources放入同一画像记录。
  • �� 用511行业和四类市场提供分层抽样框架。
  • �� 用词法MinHash与语义嵌入两阶段去重,兼顾速度和意义等价。
  • �� 用命名来源列表而非六值媒体枚举连接引用溯源。
  • �� 发布14,955条PersonaGen-15K子集,支持协议、字段和验证复现。

方法详解

  • �� 输入:四个HuggingFace公开语料,约4000万原始描述。
  • �� 词法去重:128 permutations、8 bands×16 rows、Jaccard θ=0.9,500,000条分块,降至约420万。
  • �� 语义去重:KaLM-Embedding-Gemma3-12B,4-bit量化、Flash Attention 2;余弦相似度>0.9的近重复删除,约保留100万。
  • �� 富集:Grok-4-1-fast强制JSON,temperature 0.7、每批100条;首次合规98.5%,重试后99.8%。
  • �� 验证:完整性、归一化Shannon熵、卡方检验和Cramér’s V;最终剔除1.5%不一致记录。

实验设计

统计在全量1,031,732画像上完成,报告行业、市场、性别和意图熵,以及维度关联。应用试验筛选FinTech商业型画像,随机抽取30个画像的150条查询,以temperature 0.7调用一个商业生成引擎,回答限制120词。Gemini-3.5-flash和Gemini-2.5-flash独立抽取品牌并取共识;研究没有进行真实日志基准或受控推荐份额因果实验。

结果分析

行业归一化熵仅0.37,显示强烈头部集中;性别为0.73。行业×意图V=0.299,且B2B商业意图32.0%,高于B2C的12.4%,说明富集并非完全通用模板。试验产生751次品牌提及、530个不同品牌;两抽取器仅36.0%完全一致,但平均Jaccard为0.737,提示品牌识别仍有测量误差。

应用场景

研究者可按行业筛选17.4%的商业画像,建立买家措辞查询库并重复探测品牌推荐份额。企业可比较preferred_sources与引擎真实引用,发现内容和公信力缺口。前提是把查询当作合成测试仪器,报告重复运行、释义变化和置信区间,而不能把结果直接解释成市场份额。

局限与展望

合成查询缺少真实行为校准;行业和市场分布受四个上游语料影响,General与EdTech占比过高。单一primary_intent覆盖约五条查询,无法表达跨阶段、多目的对话。语义去重和Grok富集依赖具体模型,品牌抽取仅用同一供应商模型家族。未来需接入真实日志、跨语言和跨供应商验证,并开展预注册的推荐份额实验。

通俗解读 非专业人士也能看懂

把这项研究想成给一家大型商场制作“顾客模拟器”。研究者先从四个公开仓库收集约4000万张粗略顾客卡片,再删掉几乎一模一样的卡片,之后删掉虽然说法不同、其实想法相同的卡片。最后,电脑为每位顾客补充年龄、职业、烦恼、想买什么、会问哪些问题,以及最信任哪些信息来源。

成品有103万张卡片,覆盖511种行业。每张卡片还标记顾客是在了解知识、比较商品还是准备购买。这样,研究者不必只问“某品牌好吗”,而能模拟不同顾客真正可能提出的一组问题,再观察聊天机器人会推荐哪些品牌。

它像一套商场测试仪,而不是人口普查。卡片是电脑写出的,不是真实顾客;有些行业卡片很多,有些很少。因此它适合发现问题、设计测试,不适合宣称“所有人都这样想”。

简单解释 像给14岁少年讲一样

想象你在玩一个“推荐品牌”的游戏:你输入“30人的设计公司该用哪个项目管理软件?”,AI会直接说出几个名字。问题是,如果每个人问法不同,AI的答案也可能不同。研究者因此制作了一个超大的虚拟顾客库,让电脑模拟不同职业、行业和购物阶段的人。

他们从约4000万张旧卡片开始,先删除重复卡片,再删除“换了说法但其实一样”的卡片,最后得到103万张。每张卡片都有可能提出的搜索问题,还标记他是在学习、比较,还是马上购买,并写出他信任评论、社区或分析报告等哪些来源。

研究者从FinTech里抽了30个人的150个问题,让一个AI回答。97.3%的回答至少说出了一个品牌,平均每个回答提到5.01个品牌,所以这套问题确实能让AI做推荐。不过,这些顾客是电脑生成的,不是真人;而且两个程序找品牌时完全一致的答案只有36%。所以它像训练场,不是现实世界的最终成绩单。

术语表

Generative Engine Optimization(生成式引擎优化)

让品牌更可能出现在ChatGPT、Gemini等生成式回答中的方法。其成功单位是回答中的推荐,而不是传统搜索结果中的链接排名。

论文将PersonaGen-1M作为GEO需求侧测量工具。

MinHash LSH(最小哈希局部敏感哈希)

用签名和分桶快速寻找高Jaccard相似文本的近似算法。论文采用128置换、8×16分桶和阈值0.9。

用于从约4000万描述中进行第一阶段词法去重。

Semantic deduplication(语义去重)

通过文本嵌入和余弦相似度删除含义相同但文字不同的记录。它补足词法去重无法发现的近重复。

使用KaLM-Embedding-Gemma3-12B,余弦阈值为0.9。

Primary intent(主搜索意图)

覆盖一个画像查询集合的单一主要阶段标签,包括informational、commercial、transactional和navigational。它不是逐条查询的多标签标注。

商业型17.4%画像用于推荐探测。

Preferred sources(偏好来源)

画像所信任的来源类型命名列表,如分析报告、同行评论、社区和出版物。它描述需求侧信任,可对照引擎引用来源。

用于与供应侧citation provenance连接。

Cramér’s V(克莱姆V)

衡量两个分类变量关联强度的效应量,适合大样本下避免只看显著性。数值越大表示关联越强。

行业×意图V=0.299,市场×意图V=0.164。

开放问题 这项研究留下的未解疑问

  • 1 合成查询是否像真实商业搜索?论文尚未与同产业搜索日志进行系统语义、意图和品牌覆盖率对照。
  • 2 preferred_sources是否能预测引擎引用仍未知;需要将画像偏好与按行业、语言和模型分层的引用溯源配对。

应用场景

近期应用

行业化GEO探针库

GEO团队筛选目标行业的商业型画像,使用其3至10条买家查询重复调用多个引擎,统计品牌出现率、回答波动和引用来源。应固定模型、语言、轮次与重复次数。

信任—引用缺口分析

内容团队汇总某行业的preferred_sources,再与引擎实际引用的第三方网站比较,识别买家重视但引擎较少引用的来源类型,并据此规划评测、社区或分析内容。

远期愿景

需求—供应联合测量平台

将画像查询、品牌推荐份额和引用溯源统一为分层实验平台,控制释义、语言和重复采样,最终检验买家意图与品牌被推荐概率之间的关系。

原文摘要

Generative engines such as ChatGPT, Gemini, and Perplexity answer buyer questions directly and name a shortlist of brands inside the answer. Studying how brands enter or fail to enter that shortlist requires demand-side data: what buyers in a category ask, what information they need, and which sources they trust. Existing large persona corpora are built for training-data diversity and carry neither a staged search-intent label nor a preferred-sources field, so they cannot be joined to supply-side recommendation measurements. We built and validated PersonaGen-1M, a corpus of 1,031,732 synthetic buyer personas spanning 511 industry labels and 4 market contexts, carrying 19,416,821 structured behavioral attributes, 5,160,046 of them search queries. Each persona carries a single primary_intent label covering its query set (78.3% informational, 17.4% commercial, 4.3% transactional) and a preferred_sources field naming the source types that buyer would trust. The corpus was built from roughly 40 million raw persona descriptions drawn from four public datasets through GPU-accelerated MinHash LSH plus semantic deduplication, then enriched to a fixed schema. The intent field selects the commercial-evaluation personas whose queries drive recommendation, and the preferred_sources field pairs against citation-provenance data; that join is the primary intended use, and its controlled empirical estimate is future work. Among million-scale persona corpora surveyed in August 2026, one other carries a source-preference attribute, as a six-value media-channel enum; PersonaGen-1M pairs named per-persona source lists with a staged commercial search-intent label and an attached query set. The full corpus is shared on request for non-commercial research; a stratified subset is published openly so the protocol, the schema and the validation can be inspected and reused without asking us.

cs.IR cs.CL