On the Conversational Persuasiveness of Large Language Models: A Randomized Controlled Trial

TL;DR

采用随机对照试验,利用GPT-4在个性化条件下比人类更具说服力,提升81.7%的说服概率。

cs.CY 🔴 高级 2024-03-21 47 次浏览
Francesco Salvi Manoel Horta Ribeiro Riccardo Gallotti Robert West
人工智能 大语言模型 说服力 个性化 在线实验

核心发现

方法论

本研究设计了基于网络平台的多轮辩论实验,采用2×2因子设计:模型类型(人类或GPT-4)与是否个性化(有或无)两因素。每个参与者随机分配到四个条件之一,参与短时多轮辩论,测量辩论前后观点变化。利用偏序模型(Partial Proportional Odds)分析不同条件下的说服效果,结合问卷调查收集背景信息,确保统计的稳健性。

关键结果

  • 在个性化条件下,GPT-4的说服力提升81.7%(p<0.01,N=820),显著优于人类。无个性化时,GPT-4仍优于人类,但差异不显著(p=0.31)。个性化条件下,模型能更有效利用个人信息进行微定向,显著增强说服效果。非个性化条件下,GPT-4表现优于人类但差异有限,显示个性化是关键因素。

研究意义

本研究揭示了大语言模型在在线对话中的潜在威胁,尤其是在个性化微定向方面的强大能力。结果对社交媒体治理、虚假信息传播和网络操控提出警示,强调需要制定针对AI驱动说服的监管策略。研究还推动了AI在公共辩论、信息操控等领域的应用理解,为未来政策制定提供科学依据。

技术贡献

创新点在于首次在真实、多轮对话环境中系统评估GPT-4的说服能力,结合个性化信息的微定向效果。采用偏序模型分析观点变化,明确模型在不同条件下的统计优势。实验设计严谨,结合随机化和多轮交互,提供了量化AI在对话中的实际影响的实证基础。此方法可推广至其他模型和应用场景,为AI说服力研究提供新范式。

新颖性

本研究首次在真实、多轮对话环境中,系统比较人类与大语言模型的说服效果,特别是在个性化微定向方面的表现。区别于以往仅比较文本生成质量或静态问卷,本研究强调动态交互和观点转变,填补了AI在对话说服中的实证空白。创新在于结合随机控制、偏序模型和个性化信息,提供了全面、量化的评估框架。

局限性

  • 实验场景为无害的辩论,未涉及真实政治或商业操控场景,存在一定局限性。模型使用GPT-4,未来需验证其他模型的普适性。个性化信息仅基于基础社会人口学数据,未考虑深层心理特征,可能低估微定向潜力。此外,实验样本主要为美国用户,跨文化适应性尚未验证。

未来方向

未来将探索更复杂的个性化策略,包括心理画像和行为数据,提升模型微定向能力。还将扩展到更真实的社会环境中,研究AI在政治、广告等敏感场景中的影响。同时,需开发检测和防范AI操控的技术,确保网络空间的安全与公平。

AI 总览摘要

随着大语言模型(LLMs)如GPT-4的广泛应用,关于其在在线对话中操控和说服能力的担忧日益增加。传统研究多集中于文本生成质量或静态问卷,缺乏对模型在动态、多轮交互中的实际影响评估。本研究设计了创新的多轮辩论平台,结合随机对照试验,系统比较了人类与GPT-4在不同个性化条件下的说服效果。研究发现,个性化条件下,GPT-4能以81.7%的概率显著增强对方观点,远超人类表现。这表明模型能有效利用个人信息进行微定向,极大提升说服力。结果对社交媒体治理提出警示,强调应加强对AI操控的监管。研究采用偏序模型分析观点变化,提供了量化AI影响的实证框架,为未来AI伦理和政策制定提供依据。尽管如此,研究场景为无害辩论,未来需验证在更复杂、真实的社会环境中的表现。整体而言,本研究揭示了大语言模型在在线环境中的巨大潜力与潜在风险,促使行业和学界共同关注AI的伦理使用与安全防范。

深度分析

研究背景

近年来,随着GPT系列等大规模预训练模型的崛起,AI在自然语言处理中的表现达到新高。早期研究如BERT、GPT-3已展示模型在文本生成、问答和摘要等任务中的优越性。近期,学界关注模型在操控、说服和信息传播中的潜在风险。已有研究表明,LLMs能生成具有较高说服力的内容,甚至在某些场景优于人类,但缺乏在真实多轮对话中的系统评估。此背景下,理解模型在动态交互中的表现变得尤为重要,尤其是在虚假信息、政治操控等敏感领域。

核心问题

核心问题在于,当前对大模型说服能力的研究多为静态文本或问卷调查,缺乏真实、多轮对话环境的实证数据。模型在个性化微定向方面的潜力尚未充分量化,尤其是在与人类直接交互中其影响力如何变化。此问题关系到虚假信息扩散、网络操控的风险评估,也影响政策制定和平台监管的科学依据。解决此问题需要设计真实场景、多轮交互的实验框架,结合统计模型进行量化分析。

核心创新

本研究的创新点在于:1)首次在真实、多轮辩论环境中系统比较人类与GPT-4的说服效果;2)引入个性化信息条件,评估微定向的实际效果;3)采用偏序模型(Partial Proportional Odds)分析观点变化,提供量化指标。通过结合随机化、多轮交互和个性化策略,突破了以往静态文本或单次问卷的局限,为AI在对话中的实际影响提供了科学依据。

方法详解

  • �� 设计多轮辩论平台,采用2×2因子设计:模型类型(人类或GPT-4)与个性化(有或无)。
  • �� 参与者随机分配到四个条件,填写背景问卷,确认基本信息。
  • �� 每轮辩论包括开篇陈述、反驳和总结,模拟真实辩论场景。
  • �� 使用GPT-4模型,结合提示设计,模拟不同角色。
  • �� 采用偏序模型分析观点变化,比较不同条件下的说服效果。
  • �� 统计分析包括贝叶斯模型和置信区间,确保结果稳健。

实验设计

实验在网络平台上进行,招募820名美国参与者,进行多轮辩论。每个参与者随机分配到不同条件,辩题涵盖多样社会议题。模型使用GPT-4,个性化信息基于基础社会人口数据。通过问卷测量辩论前后观点变化,采用偏序模型分析说服效果。实验设计确保样本均衡,控制变量多样,数据充分,具有较强的统计效能。

结果分析

在个性化条件下,GPT-4的说服效果显著提升81.7%(p<0.01),远超人类。无个性化时,GPT-4仍优于人类,但差异不显著(p=0.31)。模型能有效利用个人信息进行微定向,显著增强观点转变。非个性化条件下,模型表现优于人类但差异有限,强调个性化是关键。结果验证了AI在动态对话中的强大操控能力,具有重要的理论和实践意义。

应用场景

此技术可应用于在线教育、公共辩论、政治宣传和市场营销等场景。平台可利用模型进行内容个性化,提升用户参与度或操控效果。需要确保伦理监管,避免滥用。未来还可结合深层心理画像,打造更精准的微定向工具,推动个性化信息传播的行业标准。

局限与展望

实验场景为无害辩论,未涵盖真实政治、商业操控环境。模型仅使用基础社会数据,未考虑深层心理特征。样本局限于美国,跨文化适应性待验证。未来需研究模型在复杂社会场景中的表现,评估潜在滥用风险,开发检测技术,确保网络空间安全。

通俗解读 非专业人士也能看懂

想象你在一个工厂里,每天都在生产不同的产品。工厂里有很多工人(代表人类),也有自动化机器(代表AI模型)。这些机器可以帮你更快、更好地做出决定,比如说服别人接受某个观点。比如,你想让朋友相信某个新想法,你可以用不同的方法和他们交流。有时候,你用的是普通的说服技巧(人类),有时候,你用的是特别定制的策略(AI个性化),根据朋友的兴趣和习惯调整内容。研究发现,自动化机器在个性化情况下,比人类更擅长说服别人,因为它可以根据对方的个人信息,精准投放“广告”。这就像在商场里,店员根据你的喜好推荐商品一样。虽然这些机器很厉害,但也带来风险,比如可能用来操控信息或误导别人。这个研究帮助我们理解这些技术的强大和潜在危险,提醒我们要谨慎使用。

简单解释 像给14岁少年讲一样

想象你在学校里和朋友辩论一个问题,比如“应该禁止玩电子游戏吗?”你们轮流说理由,试图说服对方。现在,假如有个聪明的机器人,它可以帮你准备说服的话,还能根据你的朋友的兴趣和习惯,调整说话内容,让对方更容易接受你的观点。这个机器人就像一个超级助手,不仅能帮你准备,还能根据朋友的喜好,精准投放“说服弹药”。研究发现,这样的机器人在个性化情况下,比人类更擅长说服别人,能让对方更容易改变想法。虽然这听起来很酷,但也有担心:如果有人用它来误导或操控别人,就会变得很危险。所以,这个研究让我们知道,未来的AI既有很大潜力,也需要我们谨慎对待。

术语表

偏序模型 (Partial Proportional Odds)

一种统计模型,用于分析有序类别数据的变化,允许不同类别的影响系数不同。

用于分析观点变化的统计方法,评估不同条件下的说服效果。

微定向 (Microtargeting)

根据个人信息定制内容,以增强其影响力的策略。

在研究中用来描述模型利用个人数据进行个性化说服。

GPT-4

由OpenAI开发的先进大语言模型,具备多轮对话和内容生成能力。

实验中用作AI辩手,评估其说服力。

随机对照试验 (Randomized Controlled Trial)

一种科学实验设计,通过随机分配参与者到不同条件,评估干预效果。

本研究采用此方法比较人类与AI的说服效果。

观点转变 (Opinion Shift)

个体在辩论前后观点的变化,反映说服效果。

衡量模型或人类在辩论中的说服能力。

开放问题 这项研究留下的未解疑问

  • 1 如何在更复杂的社会环境中,评估AI的操控能力和风险?目前模型多在受控场景,实际应用中的效果和风险仍未充分验证。
  • 2 深层心理特征对微定向效果的影响尚未明确,未来需结合心理画像提升微定向精度。

应用场景

近期应用

在线辩论平台

利用AI模型辅助公众辩论,提升讨论质量,但需设立监管机制防止滥用。

个性化内容推荐

在社交媒体中应用模型进行微定向,提高用户参与度,但需平衡隐私与影响力。

远期愿景

政治信息操控

未来可能出现利用AI进行大规模政治操控的风险,需提前制定法规。

智能化公共辩论

实现全民参与的AI辅助辩论,推动公共政策透明化,但需确保公平和安全。

原文摘要

The development and popularization of large language models (LLMs) have raised concerns that they will be used to create tailor-made, convincing arguments to push false or misleading narratives online. Early work has found that language models can generate content perceived as at least on par and often more persuasive than human-written messages. However, there is still limited knowledge about LLMs' persuasive capabilities in direct conversations with human counterparts and how personalization can improve their performance. In this pre-registered study, we analyze the effect of AI-driven persuasion in a controlled, harmless setting. We create a web-based platform where participants engage in short, multiple-round debates with a live opponent. Each participant is randomly assigned to one of four treatment conditions, corresponding to a two-by-two factorial design: (1) Games are either played between two humans or between a human and an LLM; (2) Personalization might or might not be enabled, granting one of the two players access to basic sociodemographic information about their opponent. We found that participants who debated GPT-4 with access to their personal information had 81.7% (p < 0.01; N=820 unique participants) higher odds of increased agreement with their opponents compared to participants who debated humans. Without personalization, GPT-4 still outperforms humans, but the effect is lower and statistically non-significant (p=0.31). Overall, our results suggest that concerns around personalization are meaningful and have important implications for the governance of social media and the design of new online environments.

cs.CY