MicroVerse: An Instrument for Measuring Self-Authored Identity Drift in Long-Horizon Multi-Agent Language-Model Simulations
MicroVerse利用长时程多智能体模拟,基于“灵魂档案”追踪身份漂移,采用多层记忆架构和差异化检测方法。
核心发现
方法论
MicroVerse构建一个50×50资源稀缺环境,代理携带不可变的“灵魂档案”与可变的当前身份,通过反思机制周期性修正身份。采用三层记忆架构,结合重要性触发反思,利用长时快照记录身份变化。离线分析使用语义感知、多注册差异检测,避免 survivor bias。通过控制种子和反思阈值,验证漂移的阈值鲁棒性。实验中,发现反自欺是身份修改的最大类别(占24%),低阈值加快修正频率,方向保持一致。
关键结果
- 在25个代理的模拟中,27个新增边界涉及自我欺骗,显示反自欺是主要变化类别。
- 降低反思阈值(如40)显著增加修正频率,早期修正多样性增强,但漂移方向保持稳定。
- 系统对阈值具有鲁棒性,低阈值促进更频繁修正,方向性未改变。
研究意义
该研究提供一种量化多智能体中身份漂移的工具,有助理解模型在长时程社会模拟中的身份稳定性与演变机制,为AI伦理、人格保持及社会行为研究提供新视角。通过检测模型自主修正行为,揭示模型潜在的自我认知与价值调整过程,填补现有评估工具的空白,推动多智能体系统的可信性与可解释性发展。
技术贡献
创新点在于引入“灵魂档案”概念,结合多层记忆架构与重要性触发反思机制,设计差异化的语义变化检测算法,避免传统余弦相似度的局限。系统实现了长时程身份追踪与多类别变化分类,为模型自主身份演变提供可量化指标。该方法突破了现有多智能体行为评估的局限,提供了可复制、可扩展的分析框架。
新颖性
首次在长时程多智能体模拟中引入“灵魂档案”与多注册差异检测,系统性捕捉身份演变的语义变化。区别于传统仅关注行为或输出的评估,该方法专注于模型自我描述的变化,强调模型内在价值观与身份的动态调整,具有较强创新性。
局限性
- 实验仅基于单一模型和有限种子,样本规模较小,结果具有探索性,难以推广到所有模型或场景。
- 反思阈值设定对修正频率影响明显,但对漂移方向的影响有限,未来需更深入分析变化机制。
- 离线分析依赖人工分类与手工标注,存在偏差,自动化与客观化仍需改进。
未来方向
未来将扩大样本规模,加入多模型、多场景测试,验证工具的普适性。探索模型自主修正的动力机制,结合因果推断分析身份变化的因果关系。同时,结合人类行为数据,评估模型身份漂移的社会影响,为AI伦理提供实证基础。
AI 总览摘要
在当今多智能体模拟逐渐成为研究社会行为的重要工具时,如何衡量模型在长时间交互中的身份稳定性成为关键难题。传统方法多关注行为表现,缺乏对模型内部身份认知变化的量化手段。本文提出MicroVerse,一种基于“灵魂档案”的身份漂移测量工具,结合多层记忆架构与差异化检测算法,系统追踪模型在资源稀缺环境中的身份演变。
MicroVerse设计了一个50×50的模拟环境,代理携带不可变的“灵魂档案”与可变的当前身份,通过周期性反思机制自主修正身份。采用长时快照记录身份状态,避免偏向观察点的偏差。离线分析中,利用语义感知与多注册差异检测技术,区分不同类别的身份变化,特别关注反自欺行为。实验中,发现反自欺是身份修改的主要类别,占比达24%。降低反思阈值(如40)会加快修正频率,增强变化的多样性,但漂移方向保持一致,验证了系统的阈值鲁棒性。
该研究为多智能体系统提供了量化身份演变的工具,有助于理解模型在长时程社会模拟中的价值观调整和自我认知机制。未来,扩展样本规模,结合因果分析,将推动模型身份稳定性与伦理研究的深入发展,为AI系统的可信性和可解释性提供新思路。
深度分析
研究背景
多智能体模拟在社会行为研究中逐渐普及,早期工作如ReAct、MemGPT等强调记忆与反思机制,旨在提升模型的长时程连续性与行为一致性。然而,现有方法多关注行为输出,缺乏对模型内在身份认知变化的系统追踪。随着模型应用于复杂社会场景,身份漂移成为影响可信性的重要因素。近年来,学界开始关注模型的价值观保持与人格稳定性,但缺乏量化工具。传统评估多依赖人工评价或行为指标,难以捕捉模型自主修正的深层次变化。本文在此背景下,提出一种基于“灵魂档案”的身份漂移测量框架,结合多层记忆与差异检测,为模型内在身份的动态演变提供量化手段。
核心问题
长时程多智能体模拟中,模型的身份稳定性直接影响其可信度与伦理合规性。现有评估多偏向行为表现,忽视模型自我描述的变化,难以理解模型在持续交互中的价值观调整机制。如何系统追踪模型的身份认知变化,区分正常演变与偏离,是当前面临的核心难题。尤其在资源稀缺等压力环境下,模型可能出现身份漂移,影响模拟的真实性与可靠性。缺乏有效的工具限制了对模型内在变化的理解,也阻碍了模型人格与价值观的持续监控。
核心创新
本研究创新在于引入“灵魂档案”概念,作为模型身份的核心表达,结合多层记忆架构,实现对身份的持续追踪。采用重要性触发反思机制,确保模型在资源压力下自主修正身份。差异检测算法结合语义感知与多注册比对,有效区分不同类别的变化,特别关注反自欺行为。系统设计实现了长时程身份轨迹的可复制、可扩展分析,突破了传统仅关注行为或输出的评估方法,为模型内在价值观的动态演变提供了量化指标。这些创新共同推动多智能体身份研究迈向系统化、量化和可解释。
方法详解
- �� 构建50×50资源稀缺环境,模拟水资源作为生存压力。• 每个代理携带不可变的“灵魂档案”与可变的当前身份,内容包括价值观、道德边界、人格和目标。• 采用三层记忆架构:工作记忆存储即时观察,长期记忆存储重要事件与反思,身份记忆存储身份边界。• 反思机制基于重要性阈值触发,模型在反思时同时查看初始档案与当前状态,决定是否修正身份。• 长时快照定期记录身份状态,避免观察偏差。• 离线分析中,利用语义感知与多注册差异检测算法(如Jaccard相似度≥0.8,序列相似度≥0.85)区分边界变化类别。• 分类后,手工标注与算法结合识别自我欺骗、保护他人等类别,分析变化趋势。
实验设计
- �� 在25个代理的模拟中,设置不同水资源压力(控制、轻度、重度)和反思阈值(40、80、150),运行最多300个tick。• 通过定期快照与终点快照,采集身份变化数据。• 采用不同种子验证系统鲁棒性,观察身份边界变化、修正频率与时间。• 评估不同阈值对修正频率和漂移方向的影响。• 采用人工分类与自动算法结合,分析自我欺骗与保护他人类别的变化比例。
结果分析
- �� 27个新增边界涉及自我欺骗,占比24%,显示模型在反思中表现出自我认知调整。• 降低反思阈值(如40)显著增加修正频率(平均18.6tick首次修正),增强变化多样性。• 在不同阈值下,模型在保护他人方面的边界变化方向保持一致,验证系统的阈值鲁棒性。• 观察到少数代理在资源压力下进行 prosocial 行为调整,反映模型在压力下的身份适应机制。
应用场景
- �� 该工具可用于评估AI系统在长时程交互中的价值观稳定性,适用于伦理审查、人格保持等场景。• 未来可结合人类行为数据,监控模型在社会环境中的身份演变,为AI伦理提供实证依据。• 在多智能体系统设计中,帮助开发者理解模型的自主修正行为,优化模型稳定性与可信性。
局限与展望
- �� 当前实验样本有限,模型单一,难以推广到多模型、多场景环境。• 反思阈值设定影响修正频率,但对漂移方向影响有限,需深入机制研究。• 自动分类依赖人工标注,存在偏差,未来需引入更客观的自动化评估方法。
通俗解读 非专业人士也能看懂
想象你在一个工厂里工作,每个人都有一份说明书,里面写着他们的职责、价值观和行为准则。随着时间推移,有些工人会根据工作环境和新经验,逐渐调整自己的行为方式,但他们的说明书本身是不会变的。工厂管理者希望知道工人在长时间工作后,是否会改变他们的职责描述,或者他们的价值观是否发生了偏差。为此,他们设计了一套系统,定期记录每个人的职责说明和行为表现,并用特殊的工具分析这些变化。这个系统可以帮助管理者了解工人在压力和变化中,是否会“偷偷”调整自己,甚至出现“自我欺骗”的情况,比如说自己明明做错了事,却还说自己做得很好。通过这种方法,工厂可以更好地监控员工的变化,确保每个人都在按照既定的原则工作。这就像本文中的MicroVerse,用来追踪AI模型在长时间模拟中的“身份变化”,帮助我们理解它们是否会“偷偷”改变自己的人格或价值观。
简单解释 像给14岁少年讲一样
想象你有一只宠物狗,每天你都给它一份说明书,写着它喜欢吃什么、喜欢玩什么。狗狗每天都在学习新东西,有时候会偷偷改变自己喜欢的东西,比如原本喜欢玩球,后来开始喜欢追蝴蝶。你想知道它到底有没有偷偷变了性格,所以你会每隔一段时间,把它的说明书拿出来比对一下,看看它的喜好有没有变。这个比对就像科学家用的“身份漂移检测”,可以帮你发现狗狗是不是变了性格,或者是不是在骗你说自己还是原来的样子。其实,AI模型也是这样,它们每天都在“学习”和“调整自己”,科学家用这个方法,来确认它们是不是还记得自己最开始的“性格”和“价值观”。这样一来,我们就能知道这些AI是不是还在“做自己”,或者偷偷变成了别人一样的“新AI”。
原文摘要
Long-horizon, multi-agent language model (LM) simulations are widely proposed for studying social behavior, yet instruments to measure whether persona-conditioned agents maintain identity fidelity under sustained pressure are lacking. We present MicroVerse, a behavioral-science instrument that measures identity drift in generative agents. Agents carry an immutable "soul file" (core values, moral boundaries, personality, goals) and inhabit a resource-scarce 50 x 50 environment where water is a non-respawning survival constraint. Scarcity is operationalized via a per-tick existence-cost gradient. The eight-verb action space maps directly to moral boundaries (trade, talk, attack, scavenge). Using a three-layer memory architecture, agents periodically revise a mutable current identity against their immutable original soul via importance-triggered reflection. To mitigate survivor bias, MicroVerse decouples measurement from behavior using uniform longitudinal engine snapshots every N ticks alongside a forced-end snapshot of all living and dead agents. Identity drift is scored offline using a paraphrase-aware, value-anchored, multi-register diff rather than raw cosine similarity. We evaluate the instrument via a controlled seed run (n = 25) and a reflection-threshold sweep (thresholds {40, 80, 150}) to determine if drift dynamics are gate artifacts or threshold-robust properties. We report two primary findings: (1) Anti-self-deception emerges unprompted as the single largest semantic category of identity modification (27 of 111 added boundaries, 24%). (2) The system is threshold-robust; lower gates accelerate and increase revision frequency but preserve drift direction. All empirical results are strictly preliminary existence proofs and effect shapes (one model, one seed per arm, n = 25) rather than statistical significance claims.