UniScale: Synergistic Entire Space Data and Model Scaling for Search Ranking

TL;DR

UniScale结合数据扩展与模型架构优化,提升搜索排名性能。

cs.IR 🔴 高级 2026-03-25 45 次浏览
Liren Yu Caiyuan Li Feiyi Dong Tao Zhang Zhixuan Zhang Dan Ou Haihong Tang Bo Zheng
工业搜索 数据与模型联合扩展 特征交互 层级采样 Transformer架构

核心发现

方法论

UniScale通过ES3系统实现全空间数据扩展,结合层级标签传播和跨域搜索化,丰富训练信号;HHSFT架构采用异质层级特征交互和用户兴趣融合,有效建模复杂异质数据分布。实验在大规模工业数据集上验证,模型性能显著提升,线上A/B测试显示GMV增长2.04%。

关键结果

  • 在淘宝搜索平台上线后,UniScale模型在用户购买转化率上提升1.70%,GMV增加2.04%,优于传统模型。离线评估的AUC指标提升0.32%,在300M参数规模下表现优异。数据扩展策略使训练样本丰富,模型泛化能力增强。架构创新突破了只依赖模型调优的性能瓶颈,验证了数据与模型的协同作用。
  • ES3系统实现了全空间样本扩展,有效缓解选择偏差和标签稀疏问题,提升了训练数据的质量和多样性。HHSFT通过异质特征交互和兴趣融合,增强模型对复杂数据分布的建模能力,超越了单纯结构调优的性能极限。
  • 实验还包括多项消融研究,验证层级标签传播和跨域搜索化的关键作用,显示联合优化策略在工业场景中的优越性。

研究意义

该研究突破了工业搜索中模型参数规模增长的边界,强调数据质量和多样性的重要性,推动模型与数据的协同设计。为大规模推荐系统提供了系统性解决方案,显著改善用户体验和商业指标。其创新架构和数据扩展策略,为未来工业AI模型的高效扩展提供了理论基础和实践路径。

技术贡献

提出ES3全空间样本系统,有效缓解偏差与标签稀疏问题;创新HHSFT架构,结合异质特征交互和用户兴趣融合,突破只调优模型结构的性能瓶颈。实现数据与模型的协同优化,提升模型泛化和表达能力,验证在大规模工业场景中的优越性。

新颖性

首次系统性结合全空间数据扩展与异质层级Transformer架构,提出层级标签传播与跨域搜索化机制,显著提升工业搜索模型性能。区别于传统只依赖模型调优或简单数据增强的方法,强调数据-模型的协同设计,具有较强创新性。

局限性

  • 当前方法依赖大量存储资源存放扩展样本,可能带来部署成本增加。模型复杂度提升导致训练和推理时间增长,需优化推理效率。对极端异质数据分布的适应性仍需验证,未来需探索更高效的模型压缩和在线更新策略。

未来方向

未来将结合更高效的样本压缩技术,提升模型推理速度;探索自监督和半监督学习策略,进一步丰富训练信号;扩展到多模态数据和多任务场景,增强模型泛化能力。

AI 总览摘要

在现代工业搜索系统中,模型性能的提升逐渐趋于瓶颈,单纯依赖参数规模扩大已难以带来显著改善。传统数据采样策略面临偏差和标签稀疏的挑战,限制了模型的潜力发挥。本文提出UniScale框架,通过全空间数据扩展(ES3)和异质层级Transformer(HHSFT)实现数据与模型的协同优化。

ES3系统采用层级标签传播和跨域搜索化机制,丰富训练样本,缓解偏差问题,提升数据质量。HHSFT架构结合异质特征交互和用户兴趣融合,有效建模复杂异质数据分布,突破了单纯模型调优的性能极限。大量工业数据实验验证,UniScale在淘宝搜索平台上线后,用户购买转化率提升1.70%,GMV增长2.04%,AUC指标提升0.32%。

该研究强调数据质量与模型架构的协同作用,为工业推荐与搜索系统提供了系统性解决方案。其创新的全空间样本扩展和层级特征交互机制,为未来大规模工业AI模型的设计提供了理论基础和实践路径。未来,将结合模型压缩和多模态学习,进一步提升系统效率和适应性。

深度分析

研究背景

随着推荐和搜索系统在互联网中的普及,模型性能不断依赖于参数规模和数据量的增长。代表性工作如OneRec、HSTU、RankMixer等,推动了大规模预训练和特征交互的发展。然而,参数规模的边际收益逐渐递减,数据的质量和多样性成为瓶颈。传统采样策略如负采样和启发式增强,难以充分利用复杂异质数据,限制了模型的泛化能力。工业场景中,偏差、标签稀疏和异质性问题亟待解决,促使研究转向数据与模型的联合优化。

核心问题

核心问题在于工业搜索中的数据偏差和标签稀疏,导致模型训练与实际推理存在差距。单纯扩展模型参数无法突破性能瓶颈,数据的多样性和质量不足限制了模型潜能的发挥。如何构建高质量、全空间的训练样本,兼顾异质性和偏差,是提升工业搜索模型性能的关键挑战。同时,模型架构需能有效建模复杂数据分布,避免性能极限。

核心创新

提出ES3系统,通过层级标签传播和跨域搜索化机制,丰富训练样本,缓解偏差和标签稀疏问题。创新HHSFT架构,采用异质特征块化、层级特征交互和用户兴趣融合,有效建模复杂异质数据。结合数据扩展与架构创新,突破只调优模型结构的性能极限,提升工业搜索模型的表达能力和泛化能力。

方法详解

  • �� 构建全空间训练集:采用层级标签传播,增强偏差样本;跨域搜索化,将非搜索行为转化为搜索样本。• ES3机制:包括在域内扩展未曝光样本,传播交叉场景信号,生成丰富样本;跨域搜索化,利用相似性和层次策略合成搜索样本。• HHSFT架构:特征块化处理不同语义空间的特征,采用异质注意力机制保持语义信息;多层全局特征交互,融合跨域用户兴趣。• 利用专家融合和门控注意力,动态调节跨域信息流。• 训练过程中采用特征预哈希、注意核融合等优化措施,保证效率。• 实验在淘宝大规模数据集上,比较不同采样策略、架构变体,验证性能提升。

实验设计

在淘宝搜索平台进行线上线下验证,使用亿级用户行为数据,指标包括AUC、转化率和GMV。对比基线模型,验证ES3和HHSFT的贡献。进行消融实验,分析标签传播和搜索化机制的作用。调优超参数如样本比例、层数和注意力头数,确保模型稳定性和性能。通过A/B测试,验证模型在实际场景中的效果,确保提升的商业价值。

结果分析

UniScale模型在淘宝平台上线后,用户购买转化率提升1.70%,GMV增长2.04%,优于传统模型。离线AUC指标提升0.32%,在300M参数规模下表现优异。数据扩展策略显著丰富训练样本,模型泛化能力增强。架构创新突破性能瓶颈,验证数据-模型协同优化的有效性。消融实验显示层级标签传播和搜索化机制是性能提升的关键因素。

应用场景

该方法适用于工业搜索、推荐系统和广告投放等场景,尤其在数据偏差严重、异质性高的环境中表现优越。可作为大规模模型训练的标准流程,提升模型的泛化能力和商业指标。未来可结合多模态信息和实时在线学习,推动行业智能化升级。

局限与展望

当前方法依赖大量存储资源存放扩展样本,增加部署成本。模型复杂度提升带来训练和推理时间的增加,需优化效率。对极端异质数据分布的适应性尚未充分验证,未来需探索更高效的模型压缩和在线更新策略。

通俗解读 非专业人士也能看懂

想象你在一家大型工厂里,生产各种不同的产品。过去,工厂只用一种简单的机器,生产效率受到限制。现在,工厂引入了更聪明的机器(模型),但这些机器只能根据已有的生产数据做决策。问题是,工厂的原材料(数据)不够丰富,导致新产品的质量难以提升。为了改善这个问题,工厂开始收集更多不同类型的原材料(数据扩展),并用更先进的机器(架构)来处理这些材料。通过让机器学习不同材料的特性(特征交互),以及了解工厂中不同工序的关系(兴趣融合),工厂的生产效率大大提高。这个过程就像用更丰富的材料和更聪明的机器一起工作,最终让工厂生产出更好、更快的产品。

简单解释 像给14岁少年讲一样

想象你在一个大厨房里做饭,平时只用一种食材和简单的厨具,做出来的菜也就一般。现在,你开始用各种新鲜的食材,还用不同的厨具组合,试图做出更好吃的菜。这就像在用更丰富的原料和更聪明的厨具来提升菜的质量。你还发现,把不同食材的味道结合起来,能做出新奇的味道(特征交互);而且,了解不同食材的搭配和厨具的用法(兴趣融合),让菜变得更丰富。通过不断试验和学习,你的厨艺变得更厉害,做出更受欢迎的菜。这就像论文中的方法,用丰富的数据和创新的架构,让搜索系统变得更聪明、更强大。

原文摘要

Recent advances in Large Language Models (LLMs) have inspired a surge of scaling research in industrial search, advertising, and recommendation systems. However, existing approaches focus mainly on architectural improvements, overlooking the critical synergy between data and architecture design. We observe that scaling model parameters alone exhibits diminishing returns, and that the performance degradation caused by complex heterogeneous data distributions is often irrecoverable through model design alone. In this paper, we propose UniScale, a novel co-design framework that jointly optimizes data and architecture to unlock the full potential of model scaling. UniScale includes two core parts: (1) ES$^3$ (Entire-Space Sample System), a high-quality data scaling system that expands the training signal beyond conventional sampling strategies through intra-domain expansion with hierarchical label attribution and cross-domain searchification; and (2) HHSFT (Heterogeneous Hierarchical Sample Fusion Transformer), a novel architecture that effectively models the complex heterogeneous distribution of scaled data via Heterogeneous Hierarchical Feature Interaction and Entire Space User Interest Fusion, thereby surpassing the performance ceiling of structure-only model tuning. Extensive experiments on large-scale industrial datasets demonstrate that UniScale achieves significant improvements and exhibits clear scaling trends. Online A/B tests on a real-world E-commerce search platform confirm that UniScale consistently outperforms strong production baselines, achieving 1.70% and 2.04% increases in user purchase and Gross Merchandise Value (GMV).

cs.IR cs.LG