Benchmarking large language model agent societies against human behavioural distributions

TL;DR

SILICA工具评估大型语言模型代理社会的行为,发现其仅在初始阶段与人类数据一致。

physics.soc-ph 🔴 高级 2026-08-28 4 次浏览
Raad Bin Tareaf
大型语言模型 社会模拟 行为验证 数据污染 实验社会学

核心发现

方法论

本文引入了SILICA工具,旨在评估大型语言模型代理社会的行为是否与人类相符。SILICA在五个环境中测试模型,包括重复囚徒困境和公共物品游戏等,使用扰动库和固定提议计划来检测模型的鲁棒性和污染。

关键结果

  • 在11个模型中,8个模型的首次公共物品贡献与人类数据相符,但无模型能匹配最终状态贡献。
  • 仅有一个模型在固定提议计划中正确设置接受阈值,其余模型表现不佳。
  • 交换行动顺序导致一个模型合作分数下降58点。

研究意义

这项研究为验证大型语言模型在模拟社会中的有效性提供了新的工具。通过与人类行为的对比,揭示了模型在复杂社会互动中的局限性,强调了在社会科学实验中使用这些模型的谨慎性。

技术贡献

SILICA工具提供了一个系统化的方法来评估模型的行为一致性和鲁棒性。通过扰动和污染测试,揭示了模型在不同条件下的行为变化,提供了新的验证标准。

新颖性

SILICA是首个同时评估多代理交互模拟与人类基准的工具,区别于以往只关注单一响应的评估方法。

局限性

  • 模型仅在初始阶段与人类数据一致,后续阶段表现不佳。
  • 扰动测试显示模型对信息呈现方式敏感,影响结果。

未来方向

未来研究应关注提高模型在复杂社会互动中的一致性,并探索更广泛的扰动条件。

AI 总览摘要

大型语言模型代理社会正被用于模拟实验,但其有效性受到质疑。SILICA工具通过五个环境测试模型的行为一致性和鲁棒性,发现模型仅在初始阶段与人类数据一致,后续表现不佳。扰动测试揭示了模型对信息呈现方式的敏感性,影响其行为一致性。研究强调了在社会科学实验中使用这些模型的谨慎性,并为未来研究提供了新的验证标准。

研究显示,模型在复杂社会互动中的表现存在显著局限,尤其是在应对信息变更时。通过固定提议计划的测试,只有一个模型能正确设置接受阈值,其他模型表现不佳,表明模型在处理复杂决策时的不足。

SILICA工具为验证大型语言模型在模拟社会中的有效性提供了新的方法。未来研究应关注提高模型在复杂社会互动中的一致性,并探索更广泛的扰动条件,以提升模型的适用性和可靠性。

深度分析

研究背景

大型语言模型(LLM)代理社会被用于模拟社会行为,提供了无需招募参与者的实验室。然而,其有效性受到质疑,尤其是在模型能否真实反映人类行为方面。现有研究主要关注单一响应的评估,缺乏对多代理交互模拟的系统验证。

核心问题

核心问题在于LLM代理社会能否真实模拟人类行为,尤其是在复杂社会互动中。模型在不同条件下的行为一致性和鲁棒性是关键挑战。

核心创新

SILICA工具通过引入扰动库和固定提议计划,首次系统评估多代理交互模拟与人类基准的行为一致性。这一创新为验证模型的有效性提供了新的标准。

方法详解

  • �� SILICA工具测试五个环境,包括重复囚徒困境和公共物品游戏。
  • �� 使用扰动库改变信息呈现方式,评估模型行为变化。
  • �� 固定提议计划测试模型在不同决策条件下的表现。

实验设计

实验设计包括五个环境测试和扰动库的应用。使用固定提议计划评估模型在不同条件下的接受阈值设置。实验在单个消费级显卡上运行,确保可重复性。

结果分析

结果显示,模型仅在初始阶段与人类数据一致,后续表现不佳。扰动测试揭示了模型对信息呈现方式的敏感性,影响其行为一致性。

应用场景

SILICA工具可用于验证LLM在社会科学实验中的有效性,帮助研究人员评估模型在模拟社会中的适用性。

局限与展望

模型在复杂社会互动中的表现存在显著局限,尤其是在应对信息变更时。未来研究需探索更广泛的扰动条件以提升模型的适用性。

通俗解读 非专业人士也能看懂

想象一个模拟社会的实验室,里面有许多智能机器人,它们被用来模拟人类的行为。研究人员想知道这些机器人能否像人类一样做出决策。SILICA工具就像一个测试仪器,帮助研究人员评估这些机器人的表现。通过改变实验条件,比如调整机器人接收信息的方式,研究人员可以观察到机器人行为的变化。这就像在厨房里做实验,调整不同的调料,看看菜的味道会有什么变化。SILICA工具帮助研究人员找到机器人表现不佳的原因,并为未来的改进提供方向。

简单解释 像给14岁少年讲一样

想象一下你和朋友在玩一个复杂的角色扮演游戏。游戏中有很多角色,每个角色都有自己的任务和决策方式。研究人员想知道这些角色能否像真实的人一样做出决策。SILICA工具就像一个超级游戏测试器,帮助研究人员评估这些角色的表现。通过改变游戏规则,比如调整角色接收信息的方式,研究人员可以观察到角色行为的变化。这就像在游戏中加入新的挑战,看看角色能否适应。SILICA工具帮助研究人员找到角色表现不佳的原因,并为未来的改进提供方向。

术语表

大型语言模型 (Large Language Model)

一种基于深度学习的模型,能够生成和理解自然语言。

用于模拟社会行为的代理。

扰动库 (Perturbation Library)

一组用于改变实验条件的工具,以测试模型的鲁棒性。

用于评估模型在不同条件下的表现。

固定提议计划 (Fixed Offer Schedule)

一种测试方法,提供固定的提议以评估模型的决策能力。

用于测试模型在不同决策条件下的表现。

行为一致性 (Behavioral Consistency)

模型在不同条件下保持相似行为的能力。

评估模型的有效性和鲁棒性。

数据污染 (Data Contamination)

模型因训练数据中的偏差而表现异常的现象。

影响模型的行为一致性和有效性。

开放问题 这项研究留下的未解疑问

  • 1 如何提高模型在复杂社会互动中的一致性?现有方法对信息变更敏感,需探索更鲁棒的解决方案。
  • 2 如何在不影响模型性能的情况下,减少数据污染对结果的影响?

应用场景

近期应用

社会科学实验

SILICA工具可用于验证LLM在社会科学实验中的有效性,帮助研究人员评估模型在模拟社会中的适用性。

远期愿景

智能代理开发

通过提高模型在复杂社会互动中的一致性,推动智能代理的开发和应用,改善人机交互体验。

原文摘要

Populations of large language model agents are increasingly used as experimental societies. Three doubts shadow every such result: whether the agents behave like the humans they stand in for, whether a finding survives changes to the apparatus that leave the rules untouched, and whether apparent social dynamics are interaction at all rather than the reproduction of experiments the models have read. This article introduces SILICA, an open instrument that tests all three. Five environments carry published human anchors, each paired with perturbations that re-render the same rules and with variants whose payoffs point away from the memorised result. Twelve open-weight models were run through it on a single consumer graphics card. Agreement with human data is confined to starting points: first-round public-goods contributions fall inside the equivalence margin for eight of eleven models, while no model matches end-state contributions or the human corridor of cooperation. Merely swapping the order in which two actions are listed costs one model 58 points of cooperation. Presenting responders with a fixed schedule of offers shows that only one model, the sole reasoning-trained one, places its acceptance threshold where the incentive requires; two move theirs part of the way, two move them the wrong way, and three never acquire one. Conventions form through a shared prior over the names rather than through negotiation, though negotiation reappears once that prior is disrupted. On the certification ladder defined here, current silicon societies support exploratory claims and no more.

physics.soc-ph cs.CL