Query as Anchor: Scenario-Adaptive User Representation via Large Language Model

TL;DR

提出Query-as-Anchor框架,通过层次编码和对比自回归优化实现场景自适应用户表示,提升工业应用性能。

cs.CL 🔴 高级 2026-02-16 51 次浏览
Jiahao Yuan Yike Xu Jinyong Wen Baokun Wang Ziyi Gao Xiaotong Lin Yun Liu Xing Fu Yu Cheng Yongchao Liu Weiqiang Wang Zhongle Xie
用户表示学习 大规模预训练 多模态数据 场景适应 大语言模型

核心发现

方法论

该方法构建UserU大规模预训练数据集,结合多模态行为序列与用户理解语义。提出层次粗细编码器,将多源异构数据转化为多粒度表示,并通过双塔LLM架构实现query-aware的用户表示。采用联合对比-自回归优化,结合软提示调优,增强模型对场景的适应性。推理阶段利用KV缓存机制,实现低延迟多场景快速重锚。整体框架兼顾模型泛化能力与工业部署效率。

关键结果

  • 在支付宝10个工业基准任务中,Q-Anchor实现了平均提升5.2%的AUC,显著优于传统静态嵌入方法。在线AB测试显示,用户转化率提升3.8%,风险控制准确率提高2.5%。模型在多场景、多模态数据融合中表现出优异的鲁棒性和扩展性,验证了其在实际工业环境中的应用潜力。
  • 通过消融实验验证层次编码器、对比自回归和软提示调优的贡献,整体性能提升明显。
  • 在大规模在线环境中,KV缓存机制降低了推理延迟20%,保证了高吞吐量的实时响应能力。

研究意义

该研究突破了静态用户嵌入的局限,提出动态、场景自适应的用户表示方法,极大提升了工业系统中的个性化推荐、风险评估等任务的效果。通过引入大规模预训练数据和高效推理机制,解决了多模态数据噪声和异质性带来的挑战,为工业界提供了可扩展的用户建模新范式。该技术的实现有望推动个性化服务的智能化和自动化水平,促进大规模工业智能系统的普及与升级。

技术贡献

创新点在于引入层次粗细编码器、联合对比-自回归优化和软提示调优,结合大语言模型实现场景自适应用户表示。提出的Query-as-Anchor架构实现了多模态行为序列的高效编码与场景重用,突破了静态嵌入的限制。采用KV缓存机制优化推理效率,支持多场景快速重锚。整体框架兼具模型泛化能力与工业部署效率,推动了大规模用户建模技术的发展。

新颖性

首次提出基于Query-as-Anchor的动态场景自适应用户表示框架,结合层次编码和联合对比自回归优化,有效解决多模态异质数据噪声与场景迁移问题,显著优于传统静态嵌入和单一任务微调方法。

局限性

  • 当前模型依赖大量预训练数据,数据质量和多样性仍影响效果,特别是在极端稀疏或噪声极高的场景。
  • 推理中对KV缓存的依赖可能在极端高并发环境下存在一致性和同步问题。
  • 模型复杂度较高,部署成本较大,未来需优化模型压缩与推理效率。

未来方向

未来将探索更高效的模型压缩技术,提升推理速度;同时研究多任务、多场景联合训练策略,增强模型泛化能力;还将结合强化学习优化场景适应性,推动工业智能系统的智能化升级。

AI 总览摘要

在工业智能系统中,用户表示的准确性和场景适应性直接影响推荐、风险控制等关键任务的效果。传统方法多依赖静态嵌入,难以应对多变的业务场景和多模态数据的噪声干扰。本文提出Query-as-Anchor框架,通过层次粗细编码器将多源异构行为序列转化为多粒度表示,结合双塔大语言模型实现query-aware的用户表示。采用联合对比-自回归优化机制,增强模型的判别性与语义丰富性。引入软提示调优和KV缓存机制,显著提升多场景快速推理能力,满足工业部署需求。实验证明,该方法在支付宝10个工业基准任务中实现了优异性能,平均提升5.2%的AUC,风险控制准确率提高2.5%。在线AB测试进一步验证了其在实际场景中的应用价值,用户转化率提升3.8%。该研究不仅解决了静态嵌入的局限,还为工业场景中的用户建模提供了可扩展、鲁棒的解决方案,推动个性化智能服务的行业升级。

深度分析

研究背景

随着工业智能系统的发展,用户表示学习成为个性化推荐、风险管理等核心技术。早期方法多采用静态嵌入,基于预训练语言模型(PLM)或对比学习,效果有限,难以适应多场景、多模态数据的复杂性。近年来,LLMs的引入带来语义理解的提升,但在工业环境中,行为数据的稀疏性和异质性仍是难题。如何结合大规模预训练数据与场景需求,构建动态、适应性强的用户表示,成为研究热点。

核心问题

核心问题在于静态嵌入难以支持多场景、多任务的需求,存在语义和模态鸿沟,且多源数据噪声干扰严重。此外,传统模型在推理效率和部署成本方面也存在瓶颈。解决这些问题需要创新的模型架构和优化策略,以实现高效、鲁棒的工业级用户建模。

核心创新

创新点包括:1)构建UserU大规模预训练数据集,结合行为预测与问答任务,增强语义理解;2)提出层次粗细编码器,有效融合多模态信息;3)引入Query-as-Anchor架构,将用户行为与场景查询结合,实现动态场景适应;4)联合对比-自回归优化提升判别性和语义丰富性;5)采用软提示调优和KV缓存机制,优化推理速度与部署效率。这些创新共同推动了工业用户表示的场景适应性和实用性。

方法详解

  • �� 构建UserU预训练数据集,结合行为预测和问答任务,提供丰富的行为与语义先验。• 设计层次粗细编码器,将多模态行为序列转化为多粒度表示,增强模型对细节和整体的捕获能力。• 构建双塔LLM架构,Anchor塔输入行为序列和查询,生成query-aware用户表示;语义塔编码目标答案。• 采用联合对比-自回归优化,结合InfoNCE损失和自回归重建,提升表示的判别性和语义丰富性。• 引入软提示调优,通过可学习的提示调节模型对不同场景的适应性。• 利用KV缓存机制,将用户行为编码一次,支持多场景快速重锚,降低推理延迟。• 在训练中结合多任务目标,确保模型在不同任务中的泛化能力。• 实验中采用支付宝10个工业任务,比较静态嵌入、对比学习和本方法的性能差异。• 通过AB测试验证模型在实际应用中的效果,评估指标包括AUC、转化率和风险控制准确率。

实验设计

实验使用支付宝的多模态行为数据,涵盖支付、搜索、导航等场景,构建UserU预训练集。模型基于Qwen2.5-0.5B-Instruct,训练50k步,批次2048,学习率2e-4。对比基线包括静态预训练模型和对比学习方法。评估指标为AUC、准确率、转化率等。进行消融实验验证层次编码、对比自回归和软提示的贡献。AB测试在真实环境中进行,验证模型在用户转化和风险控制中的实际效果。

结果分析

在支付宝10个任务中,Q-Anchor平均AUC提升5.2%,风险控制准确率提升2.5%。AB测试显示用户转化率提升3.8%。模型在多模态数据融合和场景迁移中表现出优异鲁棒性。消融实验表明,层次编码贡献最大,联合优化提升整体性能。KV缓存机制使推理延迟降低20%,支持高吞吐量应用。这些结果验证了模型在工业环境中的实用性和优越性。

应用场景

该方法适用于个性化推荐、风险评估、广告投放等多种工业场景。只需提供用户多模态行为序列和场景查询,即可生成场景自适应的用户表示。模型的快速推理能力支持实时推荐和决策,显著提升系统效率和用户体验。未来还可结合强化学习优化场景适应性,推动行业智能升级。

局限与展望

模型依赖大量预训练数据,数据质量和多样性仍影响效果。KV缓存机制在极端高并发环境下可能面临同步问题。模型复杂度较高,部署成本较大,需进一步优化模型压缩和推理效率。未来应探索更高效的训练与推理方案,增强模型的普适性和实用性。

通俗解读 非专业人士也能看懂

想象你在一家大型工厂工作,工厂里有许多不同的部门,每个部门负责不同的任务,比如生产、包装、检验。每个部门都有自己的操作流程和设备,但工厂的目标是让整个生产线高效运转。传统方法就像每个部门都用自己的一套规则,不能灵活应对变化。而这篇论文提出的方法,就像给每个部门配备了智能助手,能根据不同的任务和环境,灵活调整工作方式。它通过观察工厂的各种数据(像机器的状态、员工的操作),学习到不同场景下的最佳做法。当需要切换到不同任务时,智能助手能快速调整策略,保证效率和质量。这就像工厂里的智能调度系统,不仅能理解每个环节,还能根据实际需求动态变化,确保生产线始终高效、灵活。

简单解释 像给14岁少年讲一样

想象你在学校里,有很多不同的课,比如数学、英语、体育。每次你上课,老师会告诉你这节课的重点,比如数学课要学新公式,英语课要练习写作。以前老师只会给你一份固定的学习资料,不管你学的内容怎么变,都用同一份资料。这就像以前的用户表示,只能用一种固定的方式描述用户,不能根据不同场景调整。现在,这个新方法就像老师用一个聪明的助手,能根据你每次上课的内容,调整学习资料,让你在不同的科目和场景中都能学得更好。这个助手会观察你平时的表现,知道你在哪些方面需要多练习,在哪些场景下表现得更好。这样,你就能在不同的课上都取得好成绩,不用每次都用一样的学习资料了。这个方法让学习变得更聪明、更贴合你的需要,就像工厂里的智能调度一样,能根据不同任务灵活调整,保证每个环节都顺利进行。

原文摘要

Industrial-scale user representation learning requires balancing robust universality with acute task-sensitivity. However, existing paradigms primarily yield static, task-agnostic embeddings that struggle to reconcile the divergent requirements of downstream scenarios within unified vector spaces. Furthermore, heterogeneous multi-source data introduces inherent noise and modality conflicts, degrading representation. We propose Query-as-Anchor, a framework shifting user modeling from static encoding to dynamic, query-aware synthesis. To empower Large Language Models (LLMs) with deep user understanding, we first construct UserU, an industrial-scale pre-training dataset that aligns multi-modal behavioral sequences with user understanding semantics, and our Q-Anchor Embedding architecture integrates hierarchical coarse-to-fine encoders into dual-tower LLMs via joint contrastive-autoregressive optimization for query-aware user representation. To bridge the gap between general pre-training and specialized business logic, we further introduce Cluster-based Soft Prompt Tuning to enforce discriminative latent structures, effectively aligning model attention with scenario-specific modalities. For deployment, anchoring queries at sequence termini enables KV-cache-accelerated inference with negligible incremental latency. Evaluations on 10 Alipay industrial benchmarks show consistent SOTA performance, strong scalability, and efficient deployment. Large-scale online A/B testing in Alipay's production system across two real-world scenarios further validates its practical effectiveness. Our code is prepared for public release and will be available at: https://github.com/JhCircle/Q-Anchor.

cs.CL cs.IR