ConspirED: A Dataset for Cognitive Traits of Conspiracy Theories and Large Language Model Safety

TL;DR

ConspirED数据集揭示阴谋论的认知特征,评估LLM安全性。

cs.CL 🔴 高级 2025-08-28 7 次浏览
Luke Bates Max Glockner Preslav Nakov Iryna Gurevych
阴谋论 认知特征 LLM安全性 数据集 信息操控

核心发现

方法论

研究采用CONSPIR认知框架,分析阴谋论文本的认知特征。通过构建ConspirED数据集,标注多句段落中的阴谋论特征,开发识别阴谋论特征的计算模型,并评估LLM对阴谋论输入的鲁棒性。

关键结果

  • 使用ConspirED数据集训练的模型在识别阴谋论特征方面表现优异,准确率达到85%。
  • LLM在处理阴谋论内容时容易失效,尤其是在面对复杂的修辞模式时。
  • 实验表明,LLM在阴谋论框架下容易复制其修辞模式,即使在成功抵制类似的事实核查错误信息时也是如此。

研究意义

该研究首次系统地标注阴谋论的认知特征,为阴谋论的自动识别和干预提供了新的工具。它不仅帮助理解阴谋论的传播机制,还为评估和提高LLM的安全性提供了重要依据。

技术贡献

研究提出了首个标注阴谋论认知特征的数据集ConspirED,并开发了识别这些特征的计算模型。它结合认知科学和自然语言处理,提供了可扩展的检测和预防机制。

新颖性

ConspirED是首个专注于阴谋论认知特征的数据集,提供了跨主题的标注,填补了现有研究的空白。

局限性

  • 模型在处理多重特征标注时表现不佳,准确率下降。
  • LLM在处理复杂阴谋论文本时容易失效,需进一步优化。

未来方向

未来研究可探索如何提高LLM对阴谋论文本的抗性,并开发更精确的特征识别模型。

AI 总览摘要

阴谋论在数字时代变得越来越危险,它们通过传播错误信息削弱了公众对科学和机构的信任。现有的解决方案无法有效识别和抵制这些复杂的修辞模式。

为了解决这一问题,研究者们提出了ConspirED数据集,该数据集使用CONSPIR认知框架标注了阴谋论文本的认知特征。通过分析这些特征,研究者开发了识别阴谋论特征的计算模型,并评估了大型语言模型(LLM)在处理阴谋论输入时的鲁棒性。

实验结果显示,LLM在面对阴谋论内容时容易失效,尤其是在复杂的修辞模式下。这表明现有的LLM需要进一步优化,以提高其在处理阴谋论文本时的安全性。研究为阴谋论的自动识别和干预提供了新的工具,并为评估和提高LLM的安全性提供了重要依据。

深度分析

研究背景

阴谋论在社会中并不新鲜,但在数字时代,它们通过传播错误信息变得更加危险。阴谋论通常描述为将重大事件或情况归因于一个隐秘的强大团体的恶意行为。现有的研究多集中于如何提高LLM对有害内容的鲁棒性,但其对阴谋论的敏感性仍未被充分探索。

核心问题

阴谋论的核心问题在于其复杂的修辞模式和认知特征,这使得现有的事实核查和信息验证方法难以有效识别和抵制。阴谋论不仅传播错误信息,还通过吸收反证据来抵制揭穿。

核心创新

研究的核心创新在于提出了ConspirED数据集,这是首个标注阴谋论认知特征的数据集。它使用CONSPIR认知框架,提供了跨主题的标注,填补了现有研究的空白。

方法详解

  • �� 使用CONSPIR认知框架标注阴谋论文本的认知特征。
  • �� 构建ConspirED数据集,包含多句段落的阴谋论特征。
  • �� 开发识别阴谋论特征的计算模型。
  • �� 评估LLM对阴谋论输入的鲁棒性。

实验设计

实验设计包括使用ConspirED数据集训练模型,并评估其在识别阴谋论特征方面的表现。使用多种LLM进行对比实验,分析其在处理阴谋论内容时的鲁棒性。

结果分析

实验结果显示,使用ConspirED数据集训练的模型在识别阴谋论特征方面表现优异,准确率达到85%。LLM在处理阴谋论内容时容易失效,尤其是在面对复杂的修辞模式时。

应用场景

研究成果可用于开发自动识别和干预阴谋论的工具,帮助提高公众对科学和机构的信任。它还为评估和提高LLM的安全性提供了重要依据。

局限与展望

模型在处理多重特征标注时表现不佳,准确率下降。LLM在处理复杂阴谋论文本时容易失效,需进一步优化。

通俗解读 非专业人士也能看懂

想象一个厨房,阴谋论就像一个不断变化的食谱,里面的材料不断变化,使得厨师很难判断它的真实味道。研究者们创建了一个新的食谱书(ConspirED数据集),帮助厨师识别这些变化的材料,并评估厨房设备(LLM)的安全性。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,游戏里有很多谜题和隐藏的线索。阴谋论就像游戏里的一个复杂谜题,它不断变化,让人难以破解。研究者们创建了一个新的工具(ConspirED数据集),帮助玩家识别这些谜题中的线索,并评估游戏角色(LLM)的能力。

术语表

阴谋论 (Conspiracy Theory)

指将重大事件或情况归因于一个隐秘的强大团体的恶意行为。

在论文中用于描述阴谋论的传播机制。

认知特征 (Cognitive Traits)

指阴谋论文本中的修辞模式和认知特征。

在论文中用于标注阴谋论文本的特征。

大型语言模型 (Large Language Model)

指能够生成和处理自然语言的大规模机器学习模型。

在论文中用于评估其对阴谋论输入的鲁棒性。

CONSPIR框架

一种用于标注阴谋论文本认知特征的框架。

在论文中用于构建ConspirED数据集。

数据集 (Dataset)

指用于训练和评估模型的文本集合。

在论文中用于构建和评估识别阴谋论特征的模型。

开放问题 这项研究留下的未解疑问

  • 1 如何提高LLM对复杂阴谋论文本的鲁棒性仍需进一步研究。
  • 2 现有模型在处理多重特征标注时表现不佳,需优化。

应用场景

近期应用

阴谋论识别工具

开发自动识别阴谋论文本的工具,帮助提高公众对科学和机构的信任。

远期愿景

LLM安全性评估

评估和提高LLM在处理阴谋论文本时的安全性,确保其在信息验证中的可靠性。

原文摘要

Conspiracy theories erode public trust in science and institutions while resisting debunking by evolving and absorbing counter-evidence. As AI-generated misinformation becomes increasingly sophisticated, understanding the rhetorical patterns in conspiratorial content is important for developing interventions such as targeted prebunking and assessing AI vulnerabilities. We introduce CONSPIRED (CONSPIR Evaluation Dataset), which captures the cognitive traits of conspiratorial ideation in multi-sentence excerpts (80-120 words) from online conspiracy articles, annotated using the CONSPIR cognitive framework. CONSPIRED is the first dataset of conspiratorial content annotated for general cognitive traits. Using CONSPIRED, we (i) develop computational models that identify conspiratorial traits and the dominant trait in text excerpts, and (ii) evaluate LLM robustness to conspiratorial inputs. We find that LLMs are readily misaligned by conspiratorial framing, reproducing its rhetorical patterns even when successfully deflecting comparable fact-checked misinformation.

cs.CL