LLM Agents Grounded in Self-Reports Enable General-Purpose Simulation of Individuals
本研究利用基于自我报告的LLM生成代理,结合访谈和问卷数据,能在无需任务特定训练的情况下,模拟个体多维行为与态度,达成83-86%的预测准确率。
核心发现
方法论
本研究采用基于大规模语言模型(GPT-4o)构建的生成代理,结合半结构化访谈(美国声音项目)、结构化问卷(包括GSS和大五人格问卷)以及两者结合,进行个体行为与态度的模拟。模型输入包括个体的访谈文本、问卷回答和专家反思,利用prompt设计引导模型模仿个体响应。评估指标采用归一化准确率,衡量模型预测与个体两周后自我重测响应的符合程度。研究还设计了对比基线(仅用人口统计信息和自我描述段落)以验证自我报告数据的有效性。模型在预测问卷题、人格特质、经济行为和实验反应方面表现优异,且在不同种族和意识形态群体中显著减少偏差。
关键结果
- 在未见测试集的GSS题目上,访谈型、问卷型和结合型生成代理的归一化准确率分别达到了83%、82%和86%,接近个体两周自我重测一致性(74%),优于仅用人口统计信息(74%),显示自我报告数据显著提升预测性能。
- 在预测大五人格维度方面,访谈型代理的归一化相关系数达0.80,优于人口统计(0.61)和单一问卷(0.65),结合模型表现最佳(0.77),验证了多源数据的协同作用。
- 在经济游戏行为预测中,访谈型代理的归一化相关系数为0.66,优于其他模型(问卷0.38,结合0.49),说明自我报告数据在行为模拟中的重要性。此外,模型在多项社会实验中也能较好复现效果,相关系数高达0.91-0.99,表明其在行为科学中的潜力。
研究意义
该研究突破了传统个体行为预测依赖大量结构化训练数据的局限,提出利用个体自我报告(访谈和问卷)作为模型输入,实现跨任务、跨领域的个体模拟。这不仅为社会科学提供了低成本、高效的个体建模工具,也推动了人工智能在个性化干预、政策模拟和偏差减少方面的应用。通过减少不同群体间的预测偏差,促进模型公平性,具有重要的理论和实践意义。
技术贡献
本研究创新性地将大规模语言模型(GPT-4o)与个体自我报告数据结合,提出多源信息融合的生成代理架构。模型通过prompt设计引导,结合专家反思,增强个体特征的表达能力。引入归一化准确率指标,基于个体自我重测一致性进行性能评估,提供了更合理的性能衡量标准。实验中验证了多源数据融合的优越性,推动了个性化模拟的技术边界,为未来个体建模提供了可扩展的框架。
新颖性
本研究首次系统性验证了基于深度访谈和结构化问卷的自我报告数据在大模型中用于个体行为模拟的有效性,打破了以往依赖大量标注数据的限制。提出的多源融合架构和归一化评估指标,为个体模拟提供了新思路,显著提升了模型在多任务、多场景下的泛化能力。这在社会科学和AI交叉领域具有开创性意义。
局限性
- 模型性能在某些偏见较强的群体(如少数族裔、极端政治立场)中仍存在差异,反映出数据代表性不足的问题。
- 访谈数据采集依赖语音识别和自然语言处理技术,存在噪声和偏差,影响模型预测的稳定性。
- 当前模型对复杂行为和深层次心理状态的模拟仍有限,未来需结合多模态数据和更丰富的个体背景信息。
未来方向
未来将探索多模态数据(如视频、行为轨迹)与文本信息的结合,提升模型对深层心理和行为的理解能力。同时,优化prompt设计和反思机制,增强模型的解释性和公平性。还将扩展到多语言、多文化背景,验证模型的跨文化适应性,为个性化干预和政策制定提供更精准的工具。
AI 总览摘要
在社会科学和人工智能的交叉研究中,个体行为和态度的模拟一直是一个核心难题。传统方法依赖大量结构化数据,训练成本高且难以迁移到新场景。近年来,大规模语言模型(如GPT-4)展现出强大的文本理解和生成能力,为个体模拟提供了新的可能性。本研究提出一种基于自我报告的生成代理架构,结合深度访谈和结构化问卷数据,利用prompt设计引导模型模仿个体响应。
通过在美国一千零五十二名样本上进行实验,研究验证了不同数据源对预测性能的影响。结果显示,结合访谈和问卷数据的模型在预测问卷题、人格特质和经济行为方面,归一化准确率分别达到了86%、77%和66%,均接近个体两周自我重测的稳定性(74%),显著优于仅用人口统计信息(74%)。这些结果表明,自我报告数据在个体行为模拟中具有极强的预测能力。
此外,模型在模拟人格特质和行为实验中表现优异,验证了其在行为科学中的应用潜力。研究还发现,结合多源数据可以减少不同族群间的偏差,提升模型公平性。这一创新架构为未来个性化干预、政策模拟和偏差减缓提供了理论基础和技术路径。
总之,本研究展示了利用深度学习和自我报告数据实现跨任务、跨领域个体模拟的可行性,为社会科学和人工智能的融合开辟了新方向。未来,结合多模态信息和增强模型解释性,将进一步推动个性化技术的发展,造福社会各界。
深度分析
研究背景
社会科学中,个体行为和态度的测量一直依赖问卷调查和深度访谈。问卷如GSS和大五人格量表提供标准化、可比性强的指标,但在个体层面预测中存在局限,尤其是在跨场景应用时。深度访谈能捕获个体的复杂心理和生活背景,但成本高、难以规模化。近年来,深度学习和大模型的发展,为模拟个体行为提供了新工具。已有研究多依赖结构化数据训练专用模型,缺乏跨任务泛化能力。本研究结合这两种传统数据源,探索利用大模型实现无任务特定训练的个体模拟,填补了现有方法在灵活性和普适性上的空白。
核心问题
现有个体行为预测模型普遍依赖大量标注数据,且多为任务特定,难以迁移到新场景或多任务环境中。这限制了模型在社会科学中的应用,尤其是在缺乏标注数据或需要快速模拟个体反应的场景中。此外,模型在不同族群中的偏差和公平性问题也未得到充分解决。如何利用个体的自我报告数据,建立具有跨任务适应性的生成模型,成为亟待解决的核心问题。该问题的难点在于如何有效融合多源信息,确保模型既能保持个体特征,又能在多任务中泛化。
核心创新
本研究提出多源自我报告数据融合架构,结合深度访谈文本和结构化问卷回答,利用prompt设计引导大模型(GPT-4o)模拟个体响应。创新点包括:1)引入专家反思机制,增强模型对个体特征的理解;2)设计归一化准确率指标,基于个体自我重测一致性进行性能评估;3)实现跨任务预测,从问卷、人格到行为实验,展现模型的广泛适应性。这些创新突破了传统个体模拟的局限,为多任务、多场景个体建模提供了新思路。
方法详解
- �� 数据采集:采用美国声音项目的深度访谈(平均2小时,产生6491字文本)、GSS问卷、Big Five人格问卷,以及行为实验数据。
- �� 生成代理构建:基于GPT-4o模型,设计prompt引导模型模仿个体,输入包括访谈文本、问卷回答和专家反思。
- �� 多源融合:分别构建访谈型、问卷型和结合型代理,比较其预测性能。
- �� 评估指标:采用归一化准确率(模型预测正确率/个体两周自我重测一致性)和相关系数。
- �� 对比基线:使用仅含人口统计信息和自我描述段落的模型,验证自我报告数据的有效性。
- �� 实验设计:在不同任务(问卷、人格、行为)上测试模型,确保评估的全面性。
实验设计
- �� 数据集:包括美国成人样本的GSS、Big Five、行为游戏和社会实验数据。
- �� 评估指标:对分类题用准确率,连续变量用相关系数,归一化后比较模型性能。
- �� 实验流程:每个参与者完成两次测试(间隔两周),模型用第一次数据预测第二次响应。
- �� Ablation研究:删除部分访谈内容,测试内容摘要模型的性能变化。
- �� 比较模型:访谈型、问卷型、结合型、人口统计基础模型,验证数据融合效果。
结果分析
- �� 预测准确率:访谈型模型在GSS题目上的归一化准确率达0.83,明显优于仅用人口统计信息(0.74),结合模型最高(0.86)。
- �� 人格预测:大五人格的归一化相关系数达0.80,优于基线模型,结合模型表现更佳。
- �� 行为模拟:经济游戏中的归一化相关系数为0.66,表现优异,验证了自我报告数据在行为预测中的作用。
- �� 多任务泛化:模型在不同任务中均表现出较强的适应性,验证了架构的通用性。
应用场景
- �� 立即应用:可用于政策模拟、个性化干预设计、偏差检测与减缓、社会科学研究中的大规模个体模拟。
- �� 长期愿景:实现跨文化、多模态、多任务的个体行为全景建模,推动个性化社会干预和智能决策系统的发展,促进公平性和透明度。
局限与展望
- �� 数据偏差:模型在少数族裔和极端群体中表现仍有差异,反映数据代表性不足的问题。
- �� 语音识别与自然语言处理:访谈数据存在噪声,影响模型稳定性。
- �� 模型深层理解:对复杂心理状态和深层行为的模拟仍有限,需结合多模态信息和更丰富背景。
通俗解读 非专业人士也能看懂
想象你有一个非常聪明的机器人朋友,它可以通过听你讲述自己的人生故事和填写问卷,学会理解你的性格、兴趣、偏好和行为习惯。这个机器人朋友不需要你每次都教它新东西,只要你告诉它一些关于你的事情,它就能在不同场合帮你预测未来可能的反应,比如你在投票时会怎么想,或者在经济游戏中会做出什么选择。
这个机器人利用了最新的人工智能技术,特别是类似GPT-4这样的超级大脑。它会听你讲故事、看你的问卷答案,然后用它的“脑袋”模拟你的想法和行为。研究发现,只要给它足够关于你的信息,它就能非常准确地预测你在不同场合的反应,甚至比传统的统计模型还要厉害。
这就像你有一个可以预知你未来行为的“虚拟你”,它可以帮助科学家、政策制定者和企业更好地理解不同人的需求和反应,从而设计出更公平、更有效的方案。最棒的是,这个方法不需要花费大量时间和金钱去收集复杂的数据,只要你愿意分享一些故事和问卷,它就能帮你“画出”一个真实的你。
简单解释 像给14岁少年讲一样
想象你有一个超级厉害的机器人朋友,它能听你讲自己的故事,还能让你填一些问卷,然后学会理解你。这个机器人就像一个非常聪明的学生,听了你的故事后,它可以猜出你平时会怎么想、怎么做。比如,你喜欢什么、害怕什么、在游戏里会怎么选择。这个研究就是在做这样的事情,把人们的故事和问卷变成机器人可以理解的东西,然后让它帮忙预测你在不同场合的反应。
科学家发现,只要给机器人足够关于你的信息,它就能非常准确地猜出你会怎么反应,比起只用你的年龄、性别这些简单信息要好得多。这就像你告诉朋友你的喜好和生活经历,他就能猜出你在投票、做决定时会怎么想。这个技术可以帮助我们更好地理解人们的行为,设计更公平的政策,甚至帮忙改善社会问题。
最酷的是,这个方法不需要花费很多时间去收集复杂的数据,只要你愿意讲讲自己的故事和填填问卷,机器人就能“画出”一个比较真实的你。这意味着我们可以用更少的努力,得到更准确的人类行为模型,未来还能用在很多地方,比如个性化教育、心理治疗、甚至智能助手。
术语表
Large Language Model (大规模语言模型)
一种基于深度学习的模型,能理解和生成自然语言,广泛应用于文本处理和模拟任务。
本文中用GPT-4o作为生成代理的核心技术。
Self-Report Data (自我报告数据)
个体主动提供的关于自己态度、行为和特征的描述,包括访谈和问卷回答。
模型以自我报告数据为基础,模拟个体响应。
Normalized Accuracy (归一化准确率)
模型预测正确率除以个体两周自我重测的响应一致性,用于衡量模拟的相对性能。
用以评估模型在不同任务中的表现。
American Voices Project (美国声音项目)
一项收集美国不同背景个体深度访谈的研究项目,用于社会科学研究。
本研究采用其访谈数据作为模型输入。
Big Five Inventory (大五人格问卷)
测量个体五大人格维度(开放性、责任心、外向性、宜人性、神经质)的标准化问卷。
用以评估模型对人格特质的预测能力。
Generative Agents (生成代理)
基于大模型和个体数据构建的虚拟个体,用于模拟和预测人类行为。
本研究中的核心技术架构。
Prompt Engineering (提示设计)
设计输入文本(prompt)以引导模型生成符合预期的响应。
用于引导模型模仿个体行为。
Test-Retest Reliability (重测信度)
同一测量工具在不同时间点对同一对象的测量一致性。
用作模型预测性能的基准。
Ablation Study (消融实验)
通过逐步去除模型部分,分析各部分对性能的贡献。
验证访谈内容对模型预测的影响。
Bias and Fairness (偏差与公平性)
模型在不同群体中的表现差异,反映潜在偏见。
研究中分析模型在不同族群中的偏差。
Behavioral Economics (行为经济学)
研究人类在经济决策中的心理和行为偏差的学科。
模型预测经济游戏中的行为。
Social Science Experiments (社会科学实验)
设计用以验证社会行为和态度的实验方法。
模型在模拟实验反应中的应用。
Effect Size (效应量)
衡量变量之间关系强度的统计指标。
用以评估模型预测与实际反应的相关性。
Cross-Task Generalization (跨任务泛化)
模型在不同任务中保持性能的能力。
验证模型的多任务适应性。
Expert Reflection (专家反思)
由社会科学专家撰写的关于个体特征的简短评述,用于增强模型理解。
模型输入的一部分,提升模拟效果。
开放问题 这项研究留下的未解疑问
- 1 尽管模型在多个任务中表现优异,但在深层心理状态和复杂行为的模拟方面仍存在局限。未来需要结合多模态数据(如视频、行为轨迹)和更丰富的背景信息,以提升模型的理解深度。此外,模型在不同文化背景和语言环境中的泛化能力仍未充分验证。如何确保模型在多样化人群中的公平性和准确性,也是未来研究的重要方向。
应用场景
近期应用
政策模拟与干预设计
利用个体生成代理模拟不同政策对群体行为的影响,帮助决策者优化方案,减少试错成本。
偏差检测与公平性提升
通过模拟不同族群的反应,识别模型偏差,指导数据采集和模型调整,促进公平性。
社会科学研究工具
为研究者提供低成本、高效率的个体行为模拟平台,加速理论验证和假设检验。
远期愿景
个性化社会干预与智能助手
未来可实现基于个体模型的定制化干预方案,提升心理健康、教育和职业辅导的效果。
跨文化、多模态个体建模
实现全球范围内多语言、多模态数据融合,推动个性化社会科学和智能系统的普及。
原文摘要
Machine learning can predict human behavior well when substantial structured data are available for well-defined outcomes. Such models are typically outcome-specific, however, requiring training data for each target outcome, limiting their applicability to new domains. We test whether large language models (LLMs) can relax these requirements by using self-report data to build attitudinal and behavioral simulations, or "generative agents," that can predict responses across outcomes without outcome-specific training data. Using data from a diverse national sample of 1,052 Americans, we built agents from (i) two-hour, semi-structured interviews elicited using the American Voices Project interview schedule, (ii) structured surveys including General Social Survey items and the Big Five personality inventory, or (iii) both sources combined. On held-out General Social Survey items, interview-only, survey-only, and combined agents achieved accuracies equal to 83%, 82%, and 86% of participants' own two-week test-retest consistency benchmark, respectively, compared with 74% for demographics-only agents. Combining interviews and surveys produced the highest accuracy, though gains over either source alone were modest, suggesting that predictive benefits from data begin to asymptote once the model has observed sufficient evidence within a domain. We find that these agents also predict personality traits, economic-game behavior, and experimental responses, while reducing accuracy disparities across racial and ideological groups relative to demographics-only agents. Together, these results show that LLM agents grounded in qualitative or quantitative self-reports can support general-purpose simulation of individuals across outcomes, without requiring task-specific training data.
被引用 (20)
AI Agents and the Future of Deliberation: Designing Human–AI Collaboration for Democratic Dialogue
RADIUS: Ranking, Distribution, and Significance - A Comprehensive Alignment Suite for Survey Simulation
Synthetic Personalities: How Well Can LLMs Mimic Individual Respondents Using Socio-Economic Microdata?
Digital Life Models and Transformative Choices: Could AI Simulations of Individual Minds (AI SIMs) Help us Make Important Life Decisions More Rationally and Authentically?
AI and Collective Decisions: Strengthening Legitimacy and Losers' Consent
MicroVerse: An Instrument for Measuring Self-Authored Identity Drift in Long-Horizon Multi-Agent Language-Model Simulations
The Third Ambition: Artificial Intelligence and the Science of Human Behavior
Synonymix: Unified Group Personas for Generative Simulations
Large language models simulate intersectional synthetic identities with a budget of one to two dimensions
Sycamore: Characterizing Synthetic Personas for Evaluating Genomics Visualization Retrieval
Mimetic Alignment with ASPECT: Evaluation of AI-inferred Personal Profiles
Fund2Persona: A Framework for Building and Refining Financial Advisor Personas from Fund Disclosure Data
IntervenSim: Intervention-Aware Social Network Simulation for Opinion Dynamics
Correcting Mode Collapse in Silicon Sampling with Semantic Similarity Rating
Video games help push the boundaries of AI
Automating and Scaling Behavioral Scientific Research on AI Agents
Emulate or Estimate? The Divergent Strengths of Base and Post-Trained Language Models for Opinion Simulation
Distributional Validity and Calibration of a Korean Synthetic Persona Panel for Digital and AI Service Use: A Secondary-Data Validation Against the Korea Media Panel Survey
Measuring the Behavioral Fidelity of Long-Horizon Human Activity Simulations
Network Effects and Agreement Drift in LLM Debates