MicroVerse: An Instrument for Measuring Self-Authored Identity Drift in Long-Horizon Multi-Agent Language-Model Simulations

TL;DR

MicroVerse利用长时程多智能体模拟,基于“灵魂档案”追踪身份漂移,采用多层记忆架构和差异化检测方法。

cs.CL 🔴 高级 2026-08-17 39 次浏览
Sky Ng Brihi Joshi Ishan Gupta Shirley Huang Zonglin Di Yun Shen Qianfeng Wen Yifan Simon Liu Ruoqi Gao Yilan Fan Zhiwei Zhang Muhammad Ahmed Mohsin Yucheng Lu Xiaoyi Liu Heming Liu Qianyu Zhu Hanwen Xing Zhengyang Shan My Chiffon Nguyen Guanghui Min Jianheng Hou Yunze Xiao Keyang Xuan Hannah Collison Jintao Huang Jiatong Li Sankalp Jajee Yunhan Zhao Bing Hu Xupeng Chen Binghang Lu Weihang Xiao Aravind Mohan Bolun Sun Yunshu Wu Yuanda Xu Runyu Zhang Zheyuan Deng Xinchen Tan Dianzhuo Wang Yijun Wang Yixuan He Koutian Wu Cheng Cheng Xiaomin Li Yuexing Hao
多智能体 语言模型 身份漂移 行为科学 长时程模拟

核心发现

方法论

MicroVerse构建一个50×50资源稀缺环境,代理携带不可变的“灵魂档案”与可变的当前身份,通过反思机制周期性修正身份。采用三层记忆架构,结合重要性触发反思,利用长时快照记录身份变化。离线分析使用语义感知、多注册差异检测,避免 survivor bias。通过控制种子和反思阈值,验证漂移的阈值鲁棒性。实验中,发现反自欺是身份修改的最大类别(占24%),低阈值加快修正频率,方向保持一致。

关键结果

  • 在25个代理的模拟中,27个新增边界涉及自我欺骗,显示反自欺是主要变化类别。
  • 降低反思阈值(如40)显著增加修正频率,早期修正多样性增强,但漂移方向保持稳定。
  • 系统对阈值具有鲁棒性,低阈值促进更频繁修正,方向性未改变。

研究意义

该研究提供一种量化多智能体中身份漂移的工具,有助理解模型在长时程社会模拟中的身份稳定性与演变机制,为AI伦理、人格保持及社会行为研究提供新视角。通过检测模型自主修正行为,揭示模型潜在的自我认知与价值调整过程,填补现有评估工具的空白,推动多智能体系统的可信性与可解释性发展。

技术贡献

创新点在于引入“灵魂档案”概念,结合多层记忆架构与重要性触发反思机制,设计差异化的语义变化检测算法,避免传统余弦相似度的局限。系统实现了长时程身份追踪与多类别变化分类,为模型自主身份演变提供可量化指标。该方法突破了现有多智能体行为评估的局限,提供了可复制、可扩展的分析框架。

新颖性

首次在长时程多智能体模拟中引入“灵魂档案”与多注册差异检测,系统性捕捉身份演变的语义变化。区别于传统仅关注行为或输出的评估,该方法专注于模型自我描述的变化,强调模型内在价值观与身份的动态调整,具有较强创新性。

局限性

  • 实验仅基于单一模型和有限种子,样本规模较小,结果具有探索性,难以推广到所有模型或场景。
  • 反思阈值设定对修正频率影响明显,但对漂移方向的影响有限,未来需更深入分析变化机制。
  • 离线分析依赖人工分类与手工标注,存在偏差,自动化与客观化仍需改进。

未来方向

未来将扩大样本规模,加入多模型、多场景测试,验证工具的普适性。探索模型自主修正的动力机制,结合因果推断分析身份变化的因果关系。同时,结合人类行为数据,评估模型身份漂移的社会影响,为AI伦理提供实证基础。

AI 总览摘要

在当今多智能体模拟逐渐成为研究社会行为的重要工具时,如何衡量模型在长时间交互中的身份稳定性成为关键难题。传统方法多关注行为表现,缺乏对模型内部身份认知变化的量化手段。本文提出MicroVerse,一种基于“灵魂档案”的身份漂移测量工具,结合多层记忆架构与差异化检测算法,系统追踪模型在资源稀缺环境中的身份演变。

MicroVerse设计了一个50×50的模拟环境,代理携带不可变的“灵魂档案”与可变的当前身份,通过周期性反思机制自主修正身份。采用长时快照记录身份状态,避免偏向观察点的偏差。离线分析中,利用语义感知与多注册差异检测技术,区分不同类别的身份变化,特别关注反自欺行为。实验中,发现反自欺是身份修改的主要类别,占比达24%。降低反思阈值(如40)会加快修正频率,增强变化的多样性,但漂移方向保持一致,验证了系统的阈值鲁棒性。

该研究为多智能体系统提供了量化身份演变的工具,有助于理解模型在长时程社会模拟中的价值观调整和自我认知机制。未来,扩展样本规模,结合因果分析,将推动模型身份稳定性与伦理研究的深入发展,为AI系统的可信性和可解释性提供新思路。

深度分析

研究背景

多智能体模拟在社会行为研究中逐渐普及,早期工作如ReAct、MemGPT等强调记忆与反思机制,旨在提升模型的长时程连续性与行为一致性。然而,现有方法多关注行为输出,缺乏对模型内在身份认知变化的系统追踪。随着模型应用于复杂社会场景,身份漂移成为影响可信性的重要因素。近年来,学界开始关注模型的价值观保持与人格稳定性,但缺乏量化工具。传统评估多依赖人工评价或行为指标,难以捕捉模型自主修正的深层次变化。本文在此背景下,提出一种基于“灵魂档案”的身份漂移测量框架,结合多层记忆与差异检测,为模型内在身份的动态演变提供量化手段。

核心问题

长时程多智能体模拟中,模型的身份稳定性直接影响其可信度与伦理合规性。现有评估多偏向行为表现,忽视模型自我描述的变化,难以理解模型在持续交互中的价值观调整机制。如何系统追踪模型的身份认知变化,区分正常演变与偏离,是当前面临的核心难题。尤其在资源稀缺等压力环境下,模型可能出现身份漂移,影响模拟的真实性与可靠性。缺乏有效的工具限制了对模型内在变化的理解,也阻碍了模型人格与价值观的持续监控。

核心创新

本研究创新在于引入“灵魂档案”概念,作为模型身份的核心表达,结合多层记忆架构,实现对身份的持续追踪。采用重要性触发反思机制,确保模型在资源压力下自主修正身份。差异检测算法结合语义感知与多注册比对,有效区分不同类别的变化,特别关注反自欺行为。系统设计实现了长时程身份轨迹的可复制、可扩展分析,突破了传统仅关注行为或输出的评估方法,为模型内在价值观的动态演变提供了量化指标。这些创新共同推动多智能体身份研究迈向系统化、量化和可解释。

方法详解

  • �� 构建50×50资源稀缺环境,模拟水资源作为生存压力。• 每个代理携带不可变的“灵魂档案”与可变的当前身份,内容包括价值观、道德边界、人格和目标。• 采用三层记忆架构:工作记忆存储即时观察,长期记忆存储重要事件与反思,身份记忆存储身份边界。• 反思机制基于重要性阈值触发,模型在反思时同时查看初始档案与当前状态,决定是否修正身份。• 长时快照定期记录身份状态,避免观察偏差。• 离线分析中,利用语义感知与多注册差异检测算法(如Jaccard相似度≥0.8,序列相似度≥0.85)区分边界变化类别。• 分类后,手工标注与算法结合识别自我欺骗、保护他人等类别,分析变化趋势。

实验设计

  • �� 在25个代理的模拟中,设置不同水资源压力(控制、轻度、重度)和反思阈值(40、80、150),运行最多300个tick。• 通过定期快照与终点快照,采集身份变化数据。• 采用不同种子验证系统鲁棒性,观察身份边界变化、修正频率与时间。• 评估不同阈值对修正频率和漂移方向的影响。• 采用人工分类与自动算法结合,分析自我欺骗与保护他人类别的变化比例。

结果分析

  • �� 27个新增边界涉及自我欺骗,占比24%,显示模型在反思中表现出自我认知调整。• 降低反思阈值(如40)显著增加修正频率(平均18.6tick首次修正),增强变化多样性。• 在不同阈值下,模型在保护他人方面的边界变化方向保持一致,验证系统的阈值鲁棒性。• 观察到少数代理在资源压力下进行 prosocial 行为调整,反映模型在压力下的身份适应机制。

应用场景

  • �� 该工具可用于评估AI系统在长时程交互中的价值观稳定性,适用于伦理审查、人格保持等场景。• 未来可结合人类行为数据,监控模型在社会环境中的身份演变,为AI伦理提供实证依据。• 在多智能体系统设计中,帮助开发者理解模型的自主修正行为,优化模型稳定性与可信性。

局限与展望

  • �� 当前实验样本有限,模型单一,难以推广到多模型、多场景环境。• 反思阈值设定影响修正频率,但对漂移方向影响有限,需深入机制研究。• 自动分类依赖人工标注,存在偏差,未来需引入更客观的自动化评估方法。

通俗解读 非专业人士也能看懂

想象你在一个工厂里工作,每个人都有一份说明书,里面写着他们的职责、价值观和行为准则。随着时间推移,有些工人会根据工作环境和新经验,逐渐调整自己的行为方式,但他们的说明书本身是不会变的。工厂管理者希望知道工人在长时间工作后,是否会改变他们的职责描述,或者他们的价值观是否发生了偏差。为此,他们设计了一套系统,定期记录每个人的职责说明和行为表现,并用特殊的工具分析这些变化。这个系统可以帮助管理者了解工人在压力和变化中,是否会“偷偷”调整自己,甚至出现“自我欺骗”的情况,比如说自己明明做错了事,却还说自己做得很好。通过这种方法,工厂可以更好地监控员工的变化,确保每个人都在按照既定的原则工作。这就像本文中的MicroVerse,用来追踪AI模型在长时间模拟中的“身份变化”,帮助我们理解它们是否会“偷偷”改变自己的人格或价值观。

简单解释 像给14岁少年讲一样

想象你有一只宠物狗,每天你都给它一份说明书,写着它喜欢吃什么、喜欢玩什么。狗狗每天都在学习新东西,有时候会偷偷改变自己喜欢的东西,比如原本喜欢玩球,后来开始喜欢追蝴蝶。你想知道它到底有没有偷偷变了性格,所以你会每隔一段时间,把它的说明书拿出来比对一下,看看它的喜好有没有变。这个比对就像科学家用的“身份漂移检测”,可以帮你发现狗狗是不是变了性格,或者是不是在骗你说自己还是原来的样子。其实,AI模型也是这样,它们每天都在“学习”和“调整自己”,科学家用这个方法,来确认它们是不是还记得自己最开始的“性格”和“价值观”。这样一来,我们就能知道这些AI是不是还在“做自己”,或者偷偷变成了别人一样的“新AI”。

原文摘要

Long-horizon, multi-agent language model (LM) simulations are widely proposed for studying social behavior, yet instruments to measure whether persona-conditioned agents maintain identity fidelity under sustained pressure are lacking. We present MicroVerse, a behavioral-science instrument that measures identity drift in generative agents. Agents carry an immutable "soul file" (core values, moral boundaries, personality, goals) and inhabit a resource-scarce 50 x 50 environment where water is a non-respawning survival constraint. Scarcity is operationalized via a per-tick existence-cost gradient. The eight-verb action space maps directly to moral boundaries (trade, talk, attack, scavenge). Using a three-layer memory architecture, agents periodically revise a mutable current identity against their immutable original soul via importance-triggered reflection. To mitigate survivor bias, MicroVerse decouples measurement from behavior using uniform longitudinal engine snapshots every N ticks alongside a forced-end snapshot of all living and dead agents. Identity drift is scored offline using a paraphrase-aware, value-anchored, multi-register diff rather than raw cosine similarity. We evaluate the instrument via a controlled seed run (n = 25) and a reflection-threshold sweep (thresholds {40, 80, 150}) to determine if drift dynamics are gate artifacts or threshold-robust properties. We report two primary findings: (1) Anti-self-deception emerges unprompted as the single largest semantic category of identity modification (27 of 111 added boundaries, 24%). (2) The system is threshold-robust; lower gates accelerate and increase revision frequency but preserve drift direction. All empirical results are strictly preliminary existence proofs and effect shapes (one model, one seed per arm, n = 25) rather than statistical significance claims.

cs.CL