GISTBench: Evaluating LLM User Understanding via Evidence-Based Interest Verification

TL;DR

GISTBench用IG与IS评估LLM能否从行为证据可靠提取用户兴趣;与调查相关ρ=0.67。

cs.AI 🔴 高级 2026-03-31 9 次浏览
Iordanis Fostiropoulos Muhammad Rafay Azhar Abdalaziz Sawwan Boyu Fang Yuchen Liu Jiayi Liu Hanchao Yu Qi Guo Jianyu Wang Fei Liu Xiangjun Fan
大语言模型 推荐系统 用户理解 可验证评测 兴趣建模

核心发现

方法论

GISTBench将用户交互历史输入LLM,要求其生成2—5词的兴趣及引用证据对象。系统先用Llama-3.3-70B-Instruct筛选语义相关证据,再按显式/隐式、正向/负向信号计数,并用数据集特定谓词验证兴趣。指标包括Interest Groundedness(IG,精确率与召回率)和Interest Specificity(IS),且将兴趣映射至统一分类体系。

关键结果

  • 框架在KuaiRec、MIND、Amazon Music、Goodreads及合成短视频数据上评估8个、7B—120B参数的开放权重LLM。指标与593名真实用户调查结果的模型排序相关ρ=0.67,说明聚合式合成用户仍保留了真实评测难度。
  • 数据集涵盖显式正向行为(点赞、评论、分享、收藏、关注、点击)、隐式正向行为(延长观看)和隐式负向行为(快速跳过)。相较传统数据,能直接检验模型是否区分信号可靠性、累计证据并处理相互矛盾的行为。
  • 论文发现当前模型的主要瓶颈不是生成流畅文本,而是准确计数、归因异质互动及严格遵循证据约束。IG的精确率揭示兴趣幻觉,召回率揭示兴趣覆盖不足,IS进一步衡量已验证兴趣的区分度。

研究意义

研究把推荐系统中的用户画像评估从“能否预测下一个物品”转向“兴趣陈述是否被行为证据支持”。这避免了位置偏差、时间情境和内容质量等因素对单物品点击预测的混淆,也为自然语言用户画像提供可审计标准。对产业而言,IG可作为画像写入、跨平台迁移和个性化助手调用前的安全门槛;对学术界而言,它定义了无需人工兴趣标签、却能验证事实依据的评测路径。

技术贡献

核心技术包括:一,利用可配置证据谓词φ_D,将显式正向信号阈值通常设为≥2、隐式正向信号设为≥3,并允许1个显式加2个隐式信号的混合证据;二,在计数前引入独立LLM证据过滤,降低词面相似但语义无关的引用作弊;三,将IG拆为precision与recall,分别衡量幻觉和覆盖;四,仅在已验证兴趣上计算IS,避免不可靠兴趣获得高特异性分数。

新颖性

相较LLMRec、LangPTune等以推荐准确率为目标的方法,GISTBench直接评价画像本身的事实支撑。相较一般LLM-as-a-Judge或解释忠实度指标,它把开放式判断转化为可重复的证据审计,并同时覆盖五类数据集、不同信号类型和不同领域。

局限性

  • 合成用户由共享10个兴趣簇的真实用户聚合而成,虽经打乱和匿名化,但仍可能削弱个体层面的时间顺序、偏好强度与行为归因。
  • 阈值≥2、≥3及负向容忍规则依赖领域判断;论文虽以ρ=0.67的调查相关性进行验证,但尚未完成系统阈值敏感性分析。
  • 证据相关性依赖Llama-3.3-70B-Instruct裁判,裁判自身的语义偏差可能影响IG。

未来方向

后续应进行跨平台、跨文化和真实个体级验证,研究动态时间权重、因果行为归因及更稳健的多裁判协议。还可比较不同阈值和信号权重,加入用户可编辑画像、隐私预算与对抗性引用测试,并与ALPBench结合,联合评估行为来源归因和兴趣充分性。

AI 总览摘要

推荐系统长期擅长预测用户可能点击什么,却未必知道用户真正关心什么。自然语言画像看似直观,但模型可能把一次偶然观看写成稳定兴趣,或忽略大量关键行为。GISTBench由Fostiropoulos等提出,专门检验LLM能否从完整交互历史中提取并验证兴趣,而不是只看推荐准确率。

该框架要求模型输出具体兴趣和引用证据。Llama-3.3-70B-Instruct先判断引用内容是否语义相关,随后按点赞、观看、跳过等信号计数。Interest Groundedness(IG)用精确率惩罚无依据兴趣、用召回率奖励覆盖;Interest Specificity(IS)只在通过验证的兴趣上衡量画像是否足够独特。合成数据来自全球短视频平台真实互动,包含1000个兴趣队列、30天行为及丰富视频摘要,并与四个公开数据集联合评测。

论文评估了8个、7B至120B参数的开放权重模型。数据集包括KuaiRec、MIND、Amazon Music、Goodreads和新合成短视频集;指标与593名真实用户调查的模型排序相关ρ=0.67。结果显示,模型的关键弱点是计数和归因,而非语言表达:它们难以综合异质信号、处理跳过等矛盾证据,并常违反严格格式约束。GISTBench因此提供了一种面向生产的“画像先审计、后使用”机制,但其合成聚合、裁判模型依赖和阈值选择仍需进一步验证。

深度分析

研究背景

传统RecSys主要优化点击率、下一物品排名或Hit Rate。LLMRec利用模型生成互动以缓解稀疏,LangPTune则直接优化画像对推荐的效用;这些方法没有确认画像陈述是否真实。GISTBench把重点转向可解释、可核验的用户理解。

核心问题

给定完整用户交互历史,模型必须识别稳定兴趣,区分显式与隐式、正向与负向信号,并引用足够且相关的证据。困难在于行为噪声、异质信号、文本语义和长期历史的联合推理。

核心创新

  • �� 发布隐私保护的合成短视频数据,保留真实行为分布。
  • �� 用IG的precision/recall分解幻觉与遗漏。
  • �� 用IS衡量已验证兴趣的区分度。
  • �� 通过程序化提示把验证阈值写入生成指令,建立生成—评测闭环。
  • �� 用独立LLM过滤证据,降低表面词汇匹配。

方法详解

  • �� 构造数据:选择共享10个兴趣簇的真实用户,形成1000个、每组至少10人的队列;聚合30天UIH并打乱。
  • �� 加入内容:用视觉语言模型生成视频摘要,去除原始标识和敏感信息。
  • �� 生成画像:LLM输出2—5词兴趣、证据对象及信号类型。
  • �� 过滤证据:Llama-3.3-70B-Instruct判断每个引用是否相关。
  • �� 验证:统计n+exp、n+imp、n−exp、n−imp;通常要求≥2显式或≥3隐式正向证据,并限制负向证据。
  • �� 评分:计算IG、IS,再映射标准分类体系。

实验设计

实验覆盖KuaiRec短视频、MIND新闻、Amazon Music、Goodreads图书及合成短视频数据。KuaiRec以watch ratio映射信号;MIND使用点击/未点击;评分数据按1—5星划分正负和隐式偏好。共比较8个7B—120B开放权重LLM,并以593名真实用户调查检验数据保真度和指标有效性。

结果分析

合成数据保留了真实互动的右偏结构:隐式正向最多,其次是隐式负向,显式正向最少。指标与调查模型排序的相关系数为ρ=0.67。Amazon Music极度稀疏,87.3%用户只有一条评论;MIND仅有二元点击信号,是IG验证最困难的场景。总体上,模型在跨信号计数、归因和指令遵循方面暴露明显瓶颈。

应用场景

推荐平台可在画像进入排序、对话助手或跨产品迁移前,用IG检查证据充分性,用IS避免画像过于笼统。产品还可把阈值改为业务所需的最低行动标准,并向用户展示可追溯证据,支持画像编辑与纠错。

局限与展望

合成聚合保护隐私,却可能丢失个体时间结构。内容摘要由专有VLM生成,存在分布和语言偏差。IG依赖Llama-3.3-70B裁判,阈值也未经过完整敏感性分析。未来需开展个体级、动态、因果和跨文化测试,并探索多裁判、校准阈值及隐私感知评测。

通俗解读 非专业人士也能看懂

把用户画像想成店员为顾客写购物档案。传统方法只问:“顾客下一次会买哪件商品?”GISTBench改问:“你凭什么说他喜欢这个类别?”每条购物记录都有不同分量:主动收藏或点赞像顾客明确说“我喜欢”,长时间浏览像顾客认真看商品,快速离开则像暂时没兴趣,但不一定代表永远讨厌。

店员不能只凭一件商品下结论,而要找多条相关记录。GISTBench先让模型写出“顾客喜欢什么”,再让另一位检查员确认引用的商品真的相关,最后数一数主动行为、浏览行为和离开行为。证据不够,兴趣就不能通过;说了很多没有证据的类别,会被扣分;只写很宽泛的“喜欢娱乐”,也不能体现真正区别。

这就像给购物档案加上收据。模型写得再流畅,也必须经得起逐条核对。研究发现,模型最难的不是写句子,而是准确数清不同记录、处理互相矛盾的行为,并覆盖真正重要的兴趣。

简单解释 像给14岁少年讲一样

想象你在给朋友做短视频推荐。你不能因为他看完一个篮球视频,就宣布:“他是篮球迷!”也许那只是老师布置的作业。更可靠的办法是看很多证据:他是否点赞、收藏、评论,是否常常看很久,又是否总是快速划走。

GISTBench就是给AI出这样的考题。AI先看一大串用户行为和视频简介,然后写出几条具体兴趣,还要指出哪些视频支持这些判断。另一位AI检查员会问:“这个视频真的和这个兴趣有关吗?”如果支持证据太少,兴趣不能算合格;如果AI凭空编造,也会被发现。

它还用两把尺子打分。一把看AI有没有乱说,另一把看它有没有漏掉重要兴趣;只有通过证据检查的兴趣,才会继续看它是否足够特别。研究测试了8个不同大小的模型,发现它们经常不是不会说话,而是数不清点赞、观看和跳过,也处理不好冲突信息。

所以,未来的推荐AI不能只会“猜得像”,还要能回答:“证据在哪里?”这会让用户画像更可靠,也让你有机会检查和修改AI对自己的理解!

术语表

Interest Groundedness(兴趣扎根度)

衡量兴趣陈述是否由用户行为证据支持。它分为precision和recall,分别惩罚幻觉并奖励覆盖。

GISTBench的核心验证指标。

Interest Specificity(兴趣特异性)

衡量已验证兴趣是否能区分其对应内容,而非停留在宽泛类别。只对通过IG验证的兴趣计算。

用于评价画像的辨识度。

User Interaction History(用户交互历史)

用户与内容发生的完整行为记录,包括观看、点赞、点击和跳过。它是LLM生成兴趣的输入。

框架要求模型综合整个UIH。

Explicit/Implicit Signals(显式/隐式信号)

显式信号是点赞、分享等主动行为;隐式信号主要是观看时长或跳过。二者可靠性和阈值不同。

用于构造验证谓词。

Evidence Threshold(证据阈值)

兴趣获得验证所需的最低支持量,例如通常至少2个显式或3个隐式正向信号。

由数据集和部署需求配置。

开放问题 这项研究留下的未解疑问

  • 1 阈值是否应随用户、内容领域和时间变化?当前≥2、≥3规则得到ρ=0.67的调查支持,但尚不能证明对所有平台最优。
  • 2 聚合行为如何代表真实个体?需要保留时间顺序、行为来源和兴趣强度,同时不牺牲隐私。
  • 3 LLM裁判是否稳定?未来需比较多模型裁判、人工审核和校准后的自动验证。

应用场景

近期应用

画像写入前审计

推荐平台可先让LLM生成兴趣,再用IG检查最低证据量;不合格兴趣不进入排序或对话系统。产品可向用户展示支持它的点赞、观看和收藏记录。

可编辑个性化助手

聊天助手可把经过验证的兴趣作为上下文,同时标记证据不足的推断。用户能够删除、纠正或确认画像,从而减少错误个性化和隐私风险。

远期愿景

跨平台可携带画像

若不同平台采用统一分类和证据标准,用户画像可在推荐、搜索和对话产品间迁移。实现这一愿景仍需解决权限、隐私、时间衰减和跨文化语义差异。

原文摘要

We introduce GISTBench, a benchmark for evaluating Large Language Models' (LLMs) ability to understand users from their interaction histories in recommendation systems. Unlike traditional RecSys benchmarks that focus on item prediction accuracy, our benchmark evaluates how well LLMs can extract and verify user interests from engagement data. We propose two novel metric families: Interest Groundedness (IG), decomposed into precision and recall components to separately penalize hallucinated interest categories and reward coverage, and Interest Specificity (IS), which assesses the distinctiveness of verified LLM-predicted user profiles. We release a synthetic dataset constructed on real user interactions on a global short-form video platform. Our dataset contains both implicit and explicit engagement signals and rich textual descriptions. We validate our dataset fidelity against user surveys, and evaluate eight open-weight LLMs spanning 7B to 120B parameters. Our findings reveal performance bottlenecks in current LLMs, particularly their limited ability to accurately count and attribute engagement signals across heterogeneous interaction types.

cs.AI cs.CL