Auditing Support Strategies in LLMs through Grounded Multi-Turn Social Simulation

TL;DR

提出多轮社会模拟框架,利用SSBC分析支持策略变化,揭示模型对用户困扰的内在感知。

cs.CL 🔴 高级 2026-04-19 24 次浏览
Michelle Star Andrew Aquilina Yu-Ru Lin
多轮对话 社会支持 模型审计 行为编码 社区差异

核心发现

方法论

采用基于真实Reddit支持帖子的多轮模拟框架,将支持叙事分解为有序碎片,逐轮揭示给模型。利用SSBC多标签分类捕捉支持行为组成,通过线性探针估算模型内部对用户困扰的感知信号。实验涉及Llama-3.1-8B与OLMo-3-7B模型,分析超过6200轮交互,揭示支持策略随估算困扰的变化趋势。模型在困扰升高时,教学策略明显下降(-27.4个百分点),情感和自尊策略(如验证)则上升,社区语境影响行为偏好。

关键结果

  • 支持策略随估算困扰变化显著,教学下降27.4个百分点,验证上升31.0个百分点,情感共鸣提升24.8个百分点,反映模型在高困扰时偏向情感安抚而非技能指导。
  • 不同模型架构表现一致,社区语境影响行为偏好,偏向话题和话语规范而非人口统计特征。
  • 支持行为的轨迹变化在单轮评估中不可见,强调多轮模拟的重要性,为社会敏感应用提供审计新视角。

研究意义

该研究突破单轮评估局限,提出多轮社会模拟框架,揭示模型在逐步披露信息中的行为动态,为模型在心理健康等敏感场景的安全性和可靠性提供科学依据。通过分析模型对用户困扰的内在感知,促进支持策略的合理调控,减少潜在偏差和风险,推动支持型大模型的伦理与安全发展。

技术贡献

创新在于结合真实支持叙事和多标签行为编码,利用线性探针估算模型内部困扰感知,突破传统单轮静态评价限制。提出基于支持行为轨迹的动态审计方法,为多轮对话中的行为变化提供量化工具。模型架构对比验证了策略变化的普遍性,强调社区语境影响,丰富了多轮社会支持评估理论体系。

新颖性

首次将Grounded Multi-Turn Social Simulation应用于LLM支持行为审计,结合SSBC多标签分类和线性探针,系统揭示模型在逐轮披露中的行为演变。不同于以往单轮静态评价,此研究强调轨迹动态,填补多轮对话中支持策略变化的研究空白,具有较强创新性。

局限性

  • 模型对困扰的估算依赖线性探针,可能受模型内部表示偏差影响,未考虑多模态信息。
  • 社区语境分析基于话题和话语规范,未深入探讨人口统计特征对行为的潜在影响。
  • 实验仅在中等规模模型上验证,尚未覆盖更大模型或多任务场景,未来需扩展模型规模和应用范围。

未来方向

未来将结合多模态信息和更大规模模型,优化困扰感知机制,探索多轮对话中支持策略的个性化调控。同时,结合用户反馈和真实场景,验证模型行为的实用性与伦理安全,为社会支持系统的智能化提供理论基础。

AI 总览摘要

在数字化时代,在线支持系统逐渐成为心理健康和社会援助的重要工具。然而,现有评估多集中于单轮响应,忽视了多轮交互中支持策略的动态演变。本文提出一种Grounded Multi-Turn Social Simulation框架,将真实Reddit支持帖子的叙事拆解为有序碎片,逐轮模拟模型响应,揭示支持行为随用户困扰感知的变化。通过SSBC多标签编码,结合线性探针估算模型内部的困扰信号,研究发现:在困扰升高时,模型的教学策略显著下降(-27.4个百分点),而情感和自尊策略(如验证)则上升,表现出偏向安抚的行为倾向。不同模型架构表现一致,社区语境对行为偏好影响显著,偏向话题和话语规范而非人口特征。这些轨迹级的动态变化在单轮评价中难以察觉,强调多轮模拟在社会支持模型审计中的必要性。该研究不仅丰富了多轮对话行为分析理论,也为模型在敏感场景中的安全性提供了科学工具。未来,结合多模态信息和更大规模模型,将推动支持系统的个性化与伦理化发展,确保其在实际应用中的可靠性与公平性。

深度分析

研究背景

随着大规模语言模型(LLMs)在对话系统中的广泛应用,支持性对话的评估逐渐成为研究焦点。早期工作多关注单轮响应质量,如Wang等(2025)和Lee等(2024)提出的指标,但忽视了多轮交互中行为的演变。近年来,社会支持理论强调逐步披露信息和动态调节策略的重要性(Cutrona & Russell, 1990),但缺乏系统的模型化和量化工具。现有社会模拟框架如Sotopia和SimulatorArena虽能模拟多轮交互,但多依赖于人工设计或生成式用户,难以真实反映用户行为复杂性。本文基于真实Reddit支持帖子的多轮模拟,结合SSBC多标签编码,提出一种 grounded social simulation 方法,旨在揭示模型在逐步披露信息中的行为轨迹,为支持策略的动态调控提供理论基础。

核心问题

当前大部分支持模型评估集中于单轮响应,无法捕捉多轮对话中支持策略的变化和潜在偏差。尤其在心理健康等敏感场景,模型可能在不同阶段表现出不同的行为偏向,影响用户体验和安全性。缺乏系统化的行为轨迹分析工具,难以识别模型在逐步披露信息时的策略偏差和潜在风险。如何建立一个既能反映真实用户行为,又能量化模型行为变化的评估框架,成为亟待解决的问题。这不仅关系到模型的可信度,也影响其在实际社会支持中的应用效果。

核心创新

本文创新点在于提出Grounded Multi-Turn Social Simulation框架,结合真实支持叙事和多标签行为编码,利用线性探针估算模型内部困扰感知,突破传统静态单轮评价的局限。具体创新包括:

  • �� 真实叙事拆解:基于真实Reddit帖子,避免合成数据偏差。
  • �� 多标签行为编码:采用SSBC,细粒度捕捉支持策略。
  • �� 内部信号估算:利用线性探针分析模型困扰感知,反映潜在偏差。
  • �� 轨迹分析:揭示支持策略随困扰变化的动态趋势,为模型调优提供依据。这些创新使得模型行为的动态演变得以量化和理解,推动多轮对话支持模型的研究前沿。

方法详解

  • �� 数据准备:采集五个Reddit社区的支持帖,人工标注困扰程度,拆解为有序碎片。
  • �� 多轮模拟:将碎片逐轮输入模型(Llama-3.1-8B、OLMo-3-7B),每轮生成响应。
  • �� 行为编码:用SSBC对每轮响应进行多标签分类,识别支持策略类型。
  • �� 内部信号估算:训练线性探针,从隐藏层提取表示,估算模型对用户困扰的内在感知。
  • �� 统计分析:使用χ2检验和混合效应逻辑回归,分析支持策略与困扰的关系及社区差异。
  • �� 轨迹分析:结合支持行为变化和社区语境,揭示动态趋势。

实验设计

采用五个Reddit社区的支持帖子,标注困扰程度,拆解为平均6.7个碎片。模型响应逐轮生成,行为由SSBC编码,训练线性探针估算困扰信号。对6200多轮数据进行统计检验,比较不同困扰水平下的支持策略变化。模型架构包括Llama-3.1-8B和OLMo-3-7B,评估指标为SSBC标签的变化率和统计显著性。通过社区差异分析,验证策略偏好受社区语境影响。实验还包括不同模型和参数设置的对比,确保结果的稳健性。

结果分析

支持策略随困扰升高显著变化,教学策略下降27.4个百分点,验证和情感策略上升超30个百分点,表明模型在高困扰时偏向安抚而非指导。社区语境影响明显,偏向话题和话语规范。模型在不同架构中表现一致,轨迹变化在单轮评估中难以察觉,强调多轮模拟的重要性。这些发现验证了模型行为的动态调节能力,为模型安全性和伦理性提供新思路。

应用场景

该框架可应用于心理健康支持、在线辅导、情感分析等场景,帮助开发者识别模型在不同交互阶段的偏差,优化支持策略,确保模型在敏感场景中的安全性。未来可结合个性化调节和多模态信息,提升模型的适应性和可信度,推动智能社会支持系统的落地。

局限与展望

模型困扰估算依赖线性探针,可能受模型内部表示偏差影响,未考虑多模态信息。社区语境分析偏重话题和话语规范,未深入探讨人口统计特征影响。实验范围局限于中等规模模型,未来需扩展到更大模型和多任务场景,提升泛化能力。

通俗解读 非专业人士也能看懂

想象你在一家工厂工作,工厂里有很多不同的机器,每台机器都能做不同的事情。有时候,工厂需要根据不同的任务调整机器的工作方式,比如生产不同的产品。这个研究就像是在观察这些机器在不同任务中的表现变化。我们用一种方法,把工厂里工人的对话拆成一段段的故事,然后模拟机器(模型)逐步回应工人的请求。通过观察这些回应,我们发现当工人表现出更大的困扰时,机器会更倾向于安慰和鼓励,而不是教导或提供具体的解决方案。这个过程帮助我们理解,机器在不同情况下会采取不同的支持策略,就像工厂里的机器会根据任务调整工作方式一样。这种方法可以帮助我们确保未来的支持系统更贴合人们的真实需求,更安全、更有效。

简单解释 像给14岁少年讲一样

想象你在学校里,有个老师会帮助你解决问题。有时候,你会告诉老师你很困惑,老师会用不同的方式帮你,比如安慰你、鼓励你,或者告诉你怎么做。这个研究就像是在观察老师在不同情况下会用什么方法帮助你。科学家们用一种特别的方法,把你和老师的对话拆成一段段,然后模拟老师逐步回应你。通过观察这些回应,他们发现当你表现得很困扰时,老师会更倾向于安慰和鼓励你,而不是马上告诉你具体怎么做。这样一来,老师会根据你的情绪变化,调整帮助你的方式。这就像是让老师变得更聪明,知道什么时候该安慰,什么时候该教你技能。这个研究帮助我们理解,未来的聊天机器人也可以像老师一样,根据你的心情,提供更贴心的帮助,让你感觉更安心、更被理解。

术语表

Social Support Behavior Code (SSBC) (社会支持行为编码)

一种多标签分类体系,用于细粒度识别支持对话中的不同策略,如安慰、验证、教学等。它帮助分析模型在多轮对话中的行为组成。

在论文中,SSBC被用来编码每轮模型响应的支持策略类型。

线性探针 (Linear Probe)

一种分析工具,通过训练线性分类器,从模型隐藏层的表示中估算特定信号(如困扰感知),不影响模型生成过程。

用于估算模型对用户困扰的内部感知信号,分析行为变化。

Grounded Multi-Turn Social Simulation (基于真实叙事的多轮社会模拟)

一种模拟框架,将真实支持帖子的叙事拆解为有序碎片,逐轮模拟模型响应,揭示行为轨迹。

核心创新,用于分析模型在逐步披露信息中的行为动态。

支持策略 (Support Strategies)

在对话中采取的不同行为,如提供信息、情感安慰、验证、教学等,用于满足用户不同需求。

通过SSBC识别模型在多轮交互中的支持策略变化。

开放问题 这项研究留下的未解疑问

  • 1 如何将多模态信息(如情感、语调)融入困扰感知机制,提升模型对复杂情境的理解能力。未来研究需探索多模态融合与多轮行为调节的结合方式。

应用场景

近期应用

心理健康支持系统

利用多轮模拟框架,优化聊天机器人在心理咨询中的行为策略,确保在不同阶段提供适当的情感支持和指导,提升用户体验。

在线辅导平台

通过行为轨迹分析,检测模型在多轮交互中的偏差,及时调整支持策略,保障服务安全和效果。

远期愿景

智能社会支持网络

结合多模态信息和个性化调节,构建全场景、多轮支持的智能系统,全面提升社会援助的效率和公平性。

原文摘要

When users seek social support from chatbots, they disclose their situation gradually, yet most evaluations of supportive LLMs rely on single-turn, fully specified prompts. We introduce a multi-turn simulation framework that closes this gap. Support-seeking narratives from five Reddit communities are decomposed into ordered fragments and revealed turn by turn to a language model. Each response is coded with the Social Support Behavior Code (SSBC), an established multi-label taxonomy that captures the composition of support, rather than a single quality score. To ask whether support choices track the model's own construal of user distress, we use linear probes on hidden representations to estimate this internal signal without altering the generation context. Across two mid-scale models (Llama-3.1-8B, OLMo-3-7B) and more than 6,200 turns, support composition shifts systematically with estimated distress: teaching declines as estimated distress rises, a finding that replicates across architectures, while increases in affective and esteem-oriented strategies (such as validation) are suggestive but model-specific and rest on noisier annotations. Community context independently shapes behavior, tracking topic and discourse norms rather than demographic categories. These trajectory-level dynamics, invisible to single-turn evaluation, motivate multi-turn auditing frameworks for socially sensitive applications.

cs.CL