NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model

TL;DR

NEXT框架通过NEXT-8B模型实现视频推荐,提升观看时长+0.53%,视频多样性+0.51%。

cs.IR 🔴 高级 2026-06-27 26 次浏览
Yuming Liu Hongye Yang Harrison Zhao Ellie Zhu Bokai Cao Lei Huang Lizhu Zhang Xiangjun Fan
视频推荐 视觉语言模型 推理 深度学习 用户行为分析

核心发现

方法论

NEXT框架采用Item-to-Intent-to-Item推理流程,通过NEXT-8B模型生成用户下一步兴趣意图并检索匹配视频。模型训练包括感知增强强化学习、分布对齐监督微调和相对策略优化。

关键结果

  • NEXT-8B在DocVQA任务中以97.28% ANLS达到单模型最佳表现,超越235B模型Qwen3-VL。
  • 在LLM评估中,逻辑质量提升3.3%,证据基础性提升4.0%。
  • 线上A/B测试显示观看时长提升+0.53%,视频多样性提升+0.51%。

研究意义

该研究解决了传统推荐系统中基于相关性和语义相似性导致的叙事连续性缺失问题,为短视频推荐提供了逻辑驱动的解决方案,提升了用户体验和内容探索能力。

技术贡献

提出了一个紧凑的8B视觉语言模型NEXT-8B,结合多阶段训练策略实现了高效的推理能力。模型在视觉证据提取和逻辑验证方面优于现有大规模模型。

新颖性

首次提出基于Item-to-Intent-to-Item的推荐框架,将推理引入视频推荐领域,并通过紧凑模型实现生产规模的推理能力。

局限性

  • 模型推理仍需离线计算,无法实时处理大规模内容库。
  • 对快速增长的内容库响应较慢,需优化推理效率。
  • 对多步推理的支持有限,需进一步扩展。

未来方向

未来将探索多步推理、实时行为信号的整合,以及推理与多样性之间的平衡,以进一步提升推荐系统的适应性和用户体验。

AI 总览摘要

传统短视频推荐系统主要依赖于用户行为的相关性和语义相似性,但往往忽略了用户的逻辑需求,例如连续剧集的后续部分或未解问题的答案。为解决这一问题,研究团队提出了NEXT框架,该框架通过Item-to-Intent-to-Item推理流程生成用户的下一步兴趣意图,并检索匹配的视频。

NEXT的核心是一个紧凑的8B视觉语言模型NEXT-8B,其通过感知增强强化学习、分布对齐监督微调和相对策略优化三阶段训练,能够高效提取视觉证据并进行逻辑验证。在DocVQA任务中,NEXT-8B以97.28%的ANLS分数达到单模型最佳表现,同时在视频推荐任务中显著提升逻辑质量和用户体验。

在生产环境中,NEXT作为额外的检索路径集成到推荐系统中,通过离线生成高精度的推荐边并在线插入,提升了观看时长(+0.53%)和视频多样性(+0.51%)。未来研究将致力于提升推理效率、支持多步推理以及优化逻辑与多样性之间的平衡。

深度分析

研究背景

短视频推荐系统近年来取得了显著进展,但大多依赖于协同过滤和语义相似性。这种方法虽然能捕捉用户的兴趣模式,但在叙事连续性和逻辑推理方面存在明显不足,例如用户观看了系列视频的第一部分,却无法推荐后续部分。

核心问题

现有推荐系统无法有效处理逻辑推理需求,导致叙事断裂、内容多样性降低以及用户体验受限。这种问题尤其在短视频平台上显得突出,因为用户期望快速获取相关内容。

核心创新

NEXT框架通过Item-to-Intent-to-Item推理流程重新定义推荐单元。其核心创新包括:1) 使用NEXT-8B模型生成下一步兴趣意图;2) 结合多阶段训练策略提升模型的推理能力;3) 在生产环境中实现高效的离线推理和在线推荐插入。

方法详解

  • �� 使用OCR和ASR提取视频中的显式线索,如“下一部分”标记。
  • �� 对于隐式需求,NEXT-8B生成下一步兴趣意图并检索匹配视频。
  • �� 通过感知增强强化学习优化视觉证据提取。
  • �� 使用分布对齐的监督微调增强模型对复杂布局的理解。
  • �� 采用相对策略优化提升模型的输出偏好。

实验设计

实验在DocVQA数据集上评估了模型的视觉证据提取能力,并通过LLM评估验证了视频推荐任务的逻辑质量提升。线上A/B测试在一个拥有1亿用户的短视频平台上进行,比较了NEXT与现有推荐系统的表现。

结果分析

NEXT-8B在DocVQA任务中以97.28%的ANLS分数达到单模型最佳表现。在LLM评估中,逻辑质量提升3.3%。线上测试显示观看时长提升+0.53%,视频多样性提升+0.51%。

应用场景

NEXT可用于短视频平台的推荐系统,特别适合需要逻辑连续性和叙事完整性的场景,如系列剧集、教育视频和问答内容。

局限与展望

NEXT的推理过程主要在离线完成,实时性较差;对快速增长的内容库响应较慢;多步推理能力有限,需进一步优化。

通俗解读 非专业人士也能看懂

想象你在看一部电视剧,刚看完第一集却找不到第二集。传统推荐系统可能会推荐类似主题的其他剧集,但NEXT会分析你刚看的内容,推测你想看的是第二集,然后直接推荐给你。它就像一个聪明的图书馆员,知道你需要什么,并迅速找到。

简单解释 像给14岁少年讲一样

想象你在刷短视频,看到一个实验视频的开头,结果却没看到结尾!传统推荐系统可能会推荐其他实验视频,但NEXT就像一个聪明的助手,它会分析你刚看的内容,猜到你想看的是实验的结果,然后推荐给你。是不是很酷?

术语表

Item-to-Intent-to-Item

一种推荐框架,先推测用户意图再检索匹配内容。

用于生成逻辑驱动的推荐路径。

NEXT-8B

一个8B参数的视觉语言模型,专为视频推荐设计。

负责生成兴趣意图和验证推荐结果。

DocVQA

一个视觉问答数据集,包含文档图像和问题。

用于评估模型的视觉证据提取能力。

感知增强强化学习

一种训练策略,优化模型的视觉证据提取能力。

用于提升NEXT-8B的感知能力。

分布对齐监督微调

一种训练方法,结合真实和合成数据增强模型性能。

用于提升模型对复杂布局的理解能力。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升模型的实时推理能力?
  • 2 如何支持多步推理以满足复杂需求?
  • 3 如何在逻辑推理和多样性之间找到最佳平衡?

应用场景

近期应用

短视频推荐

提升用户体验,推荐叙事连续的视频内容。

教育内容推荐

帮助用户快速找到相关的学习资源。

远期愿景

跨平台内容整合

实现多平台间的逻辑内容推荐,提升用户体验。

原文摘要

We present NEXT (Next-interest EXploration Transformer), a reasoning-driven video recommendation framework that reasons over the video a user has just watched, infers the viewer's next intent, and retrieves concrete follow-up videos. Explicit continuations such as episodes are linked directly; implicit cases are handled by generating intent queries and searching for matching candidates. This Item-to-Intent-to-Item formulation produces directed recommendations beyond co-engagement correlation or semantic similarity. To make this framework reliable at scale, we train NEXT-8B, a purpose-trained 8B vision-language model with a three-stage recipe: Perception-Enhanced Reinforcement Learning for query-agnostic evidence extraction, Distribution-Aligned Supervised Fine-Tuning over real and synthetic visual QA mixtures, and Group Relative Policy Optimization for last-mile alignment. NEXT-8B achieves the best single-model DocVQA performance, ranking second overall only behind a multi-agent system while surpassing a substantially larger 200B+ scale model, and improves next-intent logic-wise quality by 3.3% over the base model in a task-specific LLM-as-a-judge evaluation. We deploy NEXT as an additional retrieval path in a large-scale social media recommendation system and observe statistically significant production gains, including +0.53% watch time and +0.51% distinct video exposure. Overall, NEXT shows that a carefully trained compact vision-language model can serve as a practical reasoning engine for next-interest exploration at production scale.

cs.IR cs.CV cs.LG cs.MM