How Much Does Persuasion Strategy Matter? LLM-Annotated Evidence from Charitable Donation Dialogues

TL;DR

使用Qwen3:30b等LLM标注PersuasionForGood语料库,发现“内疚诱导”策略显著降低捐赠率(下降23个百分点)。

cs.CL 🔴 高级 2026-03-30 35 次浏览
Tatiana Petrova Stanislav Sokol Radu State
劝说策略 大语言模型 捐赠对话 情感分析 数据集标注

核心发现

方法论

研究采用Qwen3:30b、Mistral-Small-3.2和Phi-4三种开源LLM对10,600个劝说者对话轮次进行标注,使用41种劝说策略的分类体系。通过双变量检验和多变量逻辑回归分析策略与捐赠结果的关联性,并对结果进行多重比较校正。

关键结果

  • 结果1:内疚诱导策略显著降低捐赠率,含有该策略的对话捐赠率为32.7%,而未使用该策略的对话捐赠率为56.0%,下降23个百分点(p<0.001)。
  • 结果2:互惠策略显著提高捐赠率,使用该策略的对话捐赠率为72.2%,相比未使用的对话高出20.1个百分点(p=0.034)。
  • 结果3:目标情感和兴趣是捐赠发生的主要预测因素,捐赠对话的平均目标情感为0.44(正向),而未捐赠对话为0.27(p<0.001)。

研究意义

研究揭示了劝说策略在慈善捐赠对话中的实际效果,特别是内疚诱导策略的反效果。这为设计更有效的亲社会对话系统提供了重要参考,同时也为慈善筹款人员的培训提供了基于证据的方法论支持。

技术贡献

技术贡献包括:首次在完整语料库中使用细粒度的41种劝说策略分类体系;采用多种开源LLM进行标注以提高结果鲁棒性;发布完整标注的语料库作为公共资源。

新颖性

该研究首次全面分析劝说策略与捐赠结果的关联性,并揭示了内疚诱导策略的负面影响。这种细粒度的分类和多模型标注方法在领域内尚属首次。

局限性

  • 局限1:模型间对细粒度标签的一致性较低(κ=0.38-0.54),可能导致标注噪声。
  • 局限2:目标情感和兴趣是对话中的动态变量,无法确定因果关系。
  • 局限3:对话中可能存在多个策略,但每轮对话仅标注一个标签,可能遗漏共现策略。

未来方向

未来研究可探索策略的序列和组合对捐赠结果的影响,并进行因果中介分析以明确策略与目标反应之间的关系。

AI 总览摘要

劝说策略在慈善捐赠对话中的作用一直是研究的热点,但现有研究多局限于小规模数据集或粗粒度分类,难以揭示策略的真实效果。

本研究使用Qwen3:30b等三种开源LLM对PersuasionForGood语料库的10,600个劝说者轮次进行标注,采用细粒度的41种策略分类体系。通过统计检验发现,内疚诱导策略显著降低捐赠率,而互惠策略则显著提高捐赠率。此外,目标的情感和兴趣是捐赠发生的主要预测因素。

这些发现表明,单纯识别策略不足以解释劝说效果,且内疚诱导可能在亲社会场景中适得其反。研究发布了完整标注的语料库,为学术界和产业界提供了宝贵资源,同时为未来设计更有效的对话系统提供了新方向。

深度分析

研究背景

劝说策略研究在自然语言处理和心理学领域具有重要意义。早期研究如Wang等(2019)提出了10种策略分类体系,但未能全面分析策略与捐赠结果的关联性。后续工作如Saha等(2021)改进了分类器,但仍局限于小样本数据。

核心问题

核心问题是:哪些劝说策略与捐赠结果显著相关?现有研究未能在大规模语料库中进行细粒度分析,且缺乏多重比较校正,导致结果不够可靠。

核心创新

本研究的创新包括:1)定义了41种细粒度劝说策略分类体系;2)使用三种开源LLM进行标注以提高鲁棒性;3)首次在完整语料库中进行多变量分析并校正多重比较。

方法详解

  • �� 使用Qwen3:30b作为主要标注模型,Mistral-Small-3.2和Phi-4作为鲁棒性检查。
  • �� 对每轮对话进行两步标注:先选分类,再选具体策略。
  • �� 采用双变量检验和逻辑回归分析策略与捐赠结果的关联性。
  • �� 标注目标的情感和兴趣作为协变量。

实验设计

实验使用PersuasionForGood数据集,包含1,017个对话和10,600个劝说者轮次。基线包括未使用策略的对话,指标为捐赠率和捐赠金额。对41种策略进行多重比较校正。

结果分析

内疚诱导策略显著降低捐赠率(下降23个百分点),互惠策略显著提高捐赠率(增加20.1个百分点)。目标情感和兴趣是捐赠发生的主要预测因素,但与捐赠金额无显著关联。

应用场景

研究可用于设计亲社会对话系统,优化慈善筹款策略,并为心理学和社会学研究提供数据支持。

局限与展望

模型标注的一致性较低,可能导致噪声。目标变量是动态的,无法确定因果关系。单标签标注可能遗漏多策略共现。

通俗解读 非专业人士也能看懂

想象你在学校组织募捐活动。你试图说服同学捐款,但发现有些方法效果更好,比如告诉他们你会匹配他们的捐款(互惠策略)。但如果你试图让他们感到内疚,比如说“如果你不捐款,孩子们会挨饿”,他们可能会反感。这项研究就是通过分析大量对话,找出哪些策略有效,哪些可能适得其反。

简单解释 像给14岁少年讲一样

嘿,想象你在游戏里需要队友捐金币来完成任务。你发现,如果你说“我也会捐一点来帮助大家”,队友更愿意捐(互惠策略)。但如果你说“如果你不捐,我们就会失败”,他们可能会觉得你在逼迫他们。这项研究就是用AI分析了很多对话,找出哪些劝说方法最有效!

术语表

内疚诱导 (Guilt Induction)

通过让目标感到道德责任或内疚来促使行动。

用于劝说目标捐款,但被发现效果较差。

互惠策略 (Reciprocity)

通过提供某种回报来促使目标行动。

在捐赠对话中显著提高捐赠率。

目标情感 (Target Sentiment)

目标在对话中的情感状态(正向、负向或中性)。

被发现与捐赠发生显著相关。

PersuasionForGood语料库

包含1,017个慈善捐赠对话的公开数据集。

用于分析劝说策略与捐赠结果的关联性。

多重比较校正 (Multiple Comparison Correction)

统计方法,用于减少多次检验导致的假阳性。

在分析策略与捐赠结果时使用。

开放问题 这项研究留下的未解疑问

  • 1 尚未明确策略组合对捐赠结果的影响。
  • 2 目标情感与策略之间的因果关系仍需进一步研究。
  • 3 如何优化LLM标注的一致性仍是开放问题。

应用场景

近期应用

慈善筹款优化

为筹款人员提供基于证据的策略建议,避免使用内疚诱导。

亲社会对话系统

设计更有效的AI系统,促进慈善捐赠或其他亲社会行为。

远期愿景

心理学与社会学研究

为研究人类劝说行为提供大规模标注数据,推动理论发展。

原文摘要

Which persuasion strategies, if any, are associated with donation compliance? Answering this requires fine-grained strategy labels across a full corpus and statistical tests corrected for multiple comparisons. We annotate all 10,600 persuader turns in the 1,017-dialogue PersuasionForGood corpus (Wang et al., 2019), where donation outcomes are directly observable, with a taxonomy of 41 strategies in 11 categories, using three open-source large language models (LLMs; Qwen3:30b, Mistral-Small-3.2, Phi-4). Strategy categories alone explain little variance in donation outcome (pseudo $R^2 \approx 0.015$, consistent across all three annotators). Guilt Induction is the only strategy significantly associated with lower donation rates ($Δ\approx -23$ percentage points), an effect that replicates across all three models despite only moderate inter-model agreement. Reciprocity is the most robust positive correlate. Target sentiment and interest predict whether a donation occurs but show at most a weak correlation with donation amount. These findings suggest that strategy identification alone is insufficient to explain persuasion effectiveness, and that guilt-based appeals may be counterproductive in prosocial settings. We release the fully annotated corpus as a public resource.

cs.CL