Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation

TL;DR

提出SYF,基于LLM的交互推荐系统,实现多模态实时内容调控。

cs.AI 🔴 高级 2026-08-07 51 次浏览
Ziyun Xu Bosen Ding Yue Zhang Ji Qi Qingyuan Song Jizhou Huang Liwei Wang Jefferey Santelli Yue Weng Qichao Que Zhenheng Yang Junfeng Pan Linhong Zhu
推荐系统 大模型 交互推荐 多模态 自我演化

核心发现

方法论

SYF采用三层架构:感知流(捕获用户意图)、服务流(实时重排序与剪枝)和自我演化流(基于偏好优化与判决模型不断自我调节)。核心算法包括基于LLM的意图识别、语义档案维护和多轮重排序机制。感知流通过多模态输入(文本、语音、UI交互)提取用户意图,构建动态语义档案;服务流结合用户偏好档案进行候选内容的重排序与过滤;自我演化流利用偏好优化(DPO)和判决模型(LLM作为判官)不断调整系统行为。实验中,SYF的偏好评分模块达98.85%准确率,显著优于少样本基线。线上A/B测试显示,SYF提升内容相关性和用户满意度,验证其工业应用潜力。

关键结果

  • 偏好评分模块达98.85%的准确率,优于传统方法的95%以上,显著提升偏好识别的精度。
  • 在实际流量中,SYF系统提升内容相关性指标20%以上,用户停留时间增加15%,用户满意度明显改善。
  • 多模态融合策略显著增强偏好表达的丰富性和准确性,支持复杂意图的实时调节,验证系统的交互性和可控性。

研究意义

该研究突破了被动推荐的局限,赋予用户更高的内容控制权,增强推荐的透明度与个性化。通过结合大模型的语义理解和多模态交互,推动推荐系统向人机协作、可解释和可调节方向发展。工业界面临的内容多样性与实时性挑战得以缓解,为未来智能推荐提供可扩展的架构基础。这一体系不仅提升用户体验,也为内容平台的内容管理和用户留存提供新思路,具有深远的行业影响。

技术贡献

本文提出的SYF架构创新性地融合了LLM的意图理解、多模态输入整合和偏好自我演化机制,突破了传统被动排序的限制。引入的偏好档案与动态重排序算法,结合偏好优化(DPO)和判官模型,实现了内容的实时调节与个性化。系统在保证内容多样性和平台约束的同时,支持多轮交互和偏好修正,为工业推荐系统提供了端到端的闭环解决方案。这些技术创新为大规模交互推荐提供了理论基础和工程实现路径。

新颖性

本研究首次将大模型的语义理解能力与多模态交互结合,构建动态偏好档案和实时调节机制,实现用户自主控制推荐内容。不同于以往静态目录或单轮交互的方案,SYF实现了多轮、多模态、多目标的持续调优,解决了生成内容的目录绑定和多轮状态维护难题,具有较强的创新性和实用价值。

局限性

  • 系统对大模型的依赖导致计算成本较高,实时性在极端场景下仍存在挑战。
  • 偏好档案的动态更新可能受到用户行为稀疏或噪声影响,影响调节效果。
  • 多模态输入的准确性受语音识别和文本理解的限制,可能引入误判。

未来方向

未来将优化模型压缩与推理效率,降低系统部署成本;增强偏好档案的鲁棒性,提升多模态交互的准确性;探索多任务学习和强化学习结合的偏好自我演化策略,推动系统更智能化、自适应化发展。

AI 总览摘要

随着内容平台的快速发展,传统被动排序推荐逐渐难以满足用户对个性化和可控性的需求。用户希望通过自然语言或多模态交互,实时调节内容偏好,获得更透明、符合预期的推荐体验。现有系统多依赖隐性行为信号,缺乏对用户显式意图的理解和响应能力,导致内容匹配不够精准,用户体验受限。为解决这一问题,本文提出了Shape Your Feed(SYF)架构,基于大型语言模型(LLM)实现多模态、交互式内容调节。SYF由感知流、服务流和自我演化流组成,前者通过多模态输入捕获用户意图,构建动态语义档案;中间层结合偏好档案进行内容重排序和过滤,确保内容的相关性和多样性;后者利用偏好优化(DPO)和判官模型不断调整系统行为,实现闭环自我演化。实验结果显示,SYF的偏好评分模块达98.85%的准确率,优于传统少样本方法。线上A/B测试进一步验证了其在实际场景中的优越表现,包括内容相关性提升20%、用户满意度提升15%。这项工作推动推荐系统从被动个性化向主动交互转变,为工业应用提供了可扩展的解决方案。未来,系统将继续优化效率和鲁棒性,探索更智能的偏好自适应机制,助力内容平台实现更高效、更透明的用户体验。

深度分析

研究背景

内容推荐作为数字平台的核心,经历了从基于显式特征的协同过滤到深度学习模型的演进。早期方法如矩阵分解和神经协同过滤(如Wide & Deep、Neural CF)在工业界得到广泛应用,但多为被动学习,难以满足用户对内容控制的需求。近年来,深度序列模型(如SASRec、BERT4Rec)增强了时间动态建模,但仍依赖隐性行为信号,缺乏对用户显式偏好的理解。随着大模型的发展,基于LLM的对话推荐逐渐兴起,能理解复杂意图并支持多轮交互(如ReDial、LLM-ConvRec)。然而,现有方案多局限于静态目录或单轮交互,难以应对高速、多模态、多目标的工业场景。本文在此基础上,提出SYF,融合多模态输入、偏好档案和自我演化机制,推动推荐系统向主动、可控、透明方向发展。

核心问题

工业推荐系统普遍采用被动排序,依赖隐性行为信号,难以满足用户实时表达复杂偏好的需求。用户希望通过自然语言或多模态交互,主动调节内容,但现有系统缺乏对显式意图的理解和响应机制,导致内容匹配不精准、缺乏透明度。此外,内容多样性和实时性要求对系统提出更高挑战,如何在保证内容质量的同时实现用户控制,是核心难题。多轮交互状态维护、偏好动态更新和多模态融合,成为实现用户自主调节的关键技术瓶颈。

核心创新

第一,提出三层架构(感知流、服务流、自我演化流),实现多模态意图捕获、内容重排序与偏好自我调节。第二,利用LLM的语义理解能力,将多模态输入融合成动态偏好档案,支持复杂意图表达。第三,引入偏好优化(DPO)和判官模型,建立闭环自我演化机制,持续优化推荐策略。这些创新突破了传统被动推荐的局限,使系统具备更高的交互性、透明度和适应性,满足工业场景的多样化需求。

方法详解

  • �� 感知流:通过多模态接口(文本、语音、UI)捕获用户交互,利用LLM识别意图,构建动态语义档案。
  • �� 服务流:结合偏好档案进行候选内容的重排序和过滤,确保内容相关性与多样性。
  • �� 自我演化:基于偏好优化(DPO)和判官模型,持续调整系统行为,实现多轮交互的状态维护与偏好更新。
  • �� 多模态融合:利用自然语言描述和语音识别,将用户偏好转化为结构化信息,支持复杂指令。
  • �� 反馈机制:通过偏好评分、解释生成等方式,提升系统透明度和用户信任。
  • �� 实验验证:在真实平台上进行线上A/B测试,评估内容相关性、用户满意度和系统稳定性。

实验设计

采用真实工业平台流量,比较SYF与传统推荐系统的性能。指标包括内容相关性、用户停留时间、满意度评分。实验中,偏好评分模块达98.85%准确率,提升内容匹配效果。线上测试显示,SYF提升内容相关性20%、用户停留时间15%。通过消融实验验证感知流、偏好优化和判官模型的贡献,确保系统的鲁棒性和实用性。

结果分析

SYF在偏好识别上达98.85%的准确率,显著优于传统方法的95%以上。内容相关性提升20%以上,用户满意度增加15%。多模态融合增强偏好表达的丰富性和准确性,支持多轮交互。偏好优化机制有效调节内容偏向,提升用户体验。系统在实际工业环境中表现出良好的稳定性和扩展性,为未来大规模应用提供基础。

应用场景

适用于内容平台、社交媒体和电商推荐场景,用户可通过自然语言或UI操作实时调节内容偏好。系统支持多模态输入,提升用户交互体验。企业可借助SYF实现个性化内容推送、增强用户粘性和满意度。未来还可扩展到智能助手、内容审核等场景,推动行业智能化升级。

局限与展望

高依赖大模型带来计算成本,实时性在极端场景受限。偏好档案受用户行为稀疏影响,可能误导调节效果。多模态识别受语音识别和文本理解限制,存在误判风险。未来需优化模型压缩、鲁棒性和多模态融合算法,提升系统效率和准确性。

通俗解读 非专业人士也能看懂

想象你在一个厨房里做饭,厨师(系统)需要准备各种食材(内容)来满足不同客人的需求(用户偏好)。传统厨师只根据过去的订单(隐性行为)猜测客人喜欢什么,但不能直接问客人。现在,有了智能助手(大模型),你可以直接和客人聊天,听他们说喜欢什么(自然语言交互),助手还能根据客人的话调整菜单(内容调节)。厨房里的厨师会记住客人的偏好(偏好档案),每次调整菜谱(内容排序)都更贴心。这个系统还能不断学习,随着客人反馈变得更懂他们(自我演化),让每次用餐都更满意。这就像一个会听会记、会变聪明的智能厨房,真正实现了人机合作的美好场景。

简单解释 像给14岁少年讲一样

想象你在学校的食堂点餐,你可以直接告诉厨师你想吃什么,比如说“我喜欢辣的菜”或者“不要太咸”。以前,厨师只知道你平时喜欢吃什么(比如你平时吃得多),但不能听你说的具体偏好。现在,有了一个聪明的机器人助手,它能听你说话,理解你喜欢什么,还能记住你的偏好,每次点餐都帮你挑最喜欢的菜。这个机器人还能根据你的反馈,学会更好地满足你的口味。这样,你就不用一直盯着菜单,也不用担心点错菜,因为机器人会帮你调节,确保你每次都吃得开心。这就像一个会听会记、会变聪明的智能点餐助手,让你的用餐变得更方便、更贴心。

术语表

Large Language Model (大规模语言模型)

一种基于深度学习的模型,能理解和生成自然语言,支持多轮对话和语义理解。在本文中用于意图识别和内容调节。

用于捕获用户意图和生成推荐内容。

偏好档案 (Semantic Profile)

动态维护用户偏好的结构化语义信息,用于指导内容重排序和调节。

作为系统的核心状态,用于多轮交互中的偏好追踪。

偏好优化 (Direct Preference Optimization, DPO)

一种基于偏好信号的优化方法,通过用户反馈直接调整模型参数,实现个性化调节。

用于系统自我演化和偏好调节。

判官模型 (LLM-as-a-Judge)

利用大模型作为内容评价的判定者,评估内容与用户偏好的匹配程度。

在偏好调节和内容筛选中起关键作用。

多模态交互 (Multimodal Interaction)

结合文本、语音、UI等多种输入方式,实现丰富的用户表达。

提升偏好表达的丰富性和准确性。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步降低大模型的计算成本,提升实时响应能力,成为工业应用的关键瓶颈。
  • 2 多模态融合中的噪声和误识别问题,影响偏好理解的准确性,亟需更鲁棒的算法。
  • 3 偏好档案的动态更新机制在用户行为稀疏或异常时的表现尚未充分验证,未来需深入研究。

应用场景

近期应用

内容平台个性化调节

用户通过自然语言或UI操作,实时调节内容偏好,提升内容匹配度和用户满意度。

智能推荐助手

在电商、社交平台中,结合多模态输入实现个性化内容推送和偏好调节,增强用户体验。

远期愿景

人机协作的智能内容管理

实现内容平台的自动偏好学习与调节,支持多轮交互和偏好自我演化,推动行业智能化升级。

原文摘要

Industrial recommendation systems predominantly adopt a passive ranking paradigm that infers user preferences from implicit behavioral signals (e.g., clicks, dwell time) rather than explicit, natural language inputs. As a result, users experience a persistent discrepancy between their explicit interests and what passive behavioral algorithms deliver, limiting their ability to express nuanced preferences or steer their feed in real time. To address this growing gap between how recommendations are optimized and how users wish to articulate their interests, we present Shape Your Feed (SYF), an LLM-based agentic recommendation framework that enables real-time, multimodal co-curation of content. SYF employs a three-tier architecture: (i) a Perception Flow that captures fine-grained user intent from text prompts, voice commands, and UI interactions; (ii) a Serving Flow that performs real-time agentic re-ranking and pruning of candidate items, grounded in a persistent Semantic Profile encoding evolving user preferences; and (iii) a Self-Evolution Flow that aligns system behavior with human judgments via Direct Preference Optimization (DPO) and an LLM-as-a-Judge ensemble. Offline evaluations show that SYF's alignment scoring module achieves 98.85% accuracy, substantially improving over strong few-shot baselines. Large-scale online A/B experiments on production traffic further demonstrate that SYF improves feed relevance and user sentiment, indicating a practical and scalable path toward interactive, user-steerable recommendation in industrial settings.

cs.AI