Self-Aware Recursively Self-Improving Agents for Personal Singularity: A Goal-, Scope-, Tool-, and Benchmark-Driven Multi-Agent Architecture

TL;DR

SARSI以自我模型+证据门控递归改进,提出个人奇点架构;论文无实证数据。

cs.CV 🔴 高级 2026-07-14 40 次浏览
Chengshuai Yang
自我意识代理 递归自我改进 多智能体架构 工具使用评测 个人奇点

核心发现

方法论

论文提出SARSI框架:代理状态At_i=(θ,π,M,S,G,Σ,P,E,V),以自我模型Σ_t=(I,G,S,C,K,U,T,A,R,D,P)驱动行动前检查与行动后更新;再用改进算子A'=I(A,D,B)与公式(6)的门控准则控制升级。系统由外部治理平面、快任务循环、慢改进循环、scope router、Auto-Index和Personal Singularity OS组成,强调签名权限、隐藏评测、回滚与分层自治。

关键结果

  • 论文不是实验论文,因此没有报告GAIA、OSWorld、SWE-bench、ToolBench等基准上的数值提升;其“结果”主要是形式化定义、架构分层与安全不变量,明确把任务完成与递归改进分开。
  • 给出两条核心算法:Algorithm 1做受限端到端执行,Algorithm 2做风险门控改进;并用Accept(A,A′)要求Dheldout性能提升、Safe(A′)达标、风险不增、权限不扩张、谱系与回滚完备。
  • 提出自我意识成熟度思路:用外部可验证事实检验身份、能力、边界、工具和历史的一致性;同时把人类能力转移纳入目标函数,避免只提升代理、不提升用户。

研究意义

这项工作把“会做事的代理”推进到“知道自己是什么、能做什么、该不该做”的系统设计层面。它回应了长程代理的关键痛点:权限混乱、越界执行、工具幻觉、改进不可审计,以及用户对系统越来越依赖却并未真正变强。对学术界,它提供了可检验的功能性自我意识定义;对工业界,它给出可部署的治理接口、回滚机制和分权线性谱系。

技术贡献

技术贡献不在性能分数,而在可实现性与可审计性:1)用Σ_t把身份、目标、范围、能力、 uncertainty、关系、历史和改进过程统一成证据链接状态;2)把任务自治、普通自改进、元改进严格分层;3)提出scope router“一任务一主责代理”;4)把工具测试与端到端评测分离,支持隐藏/轮换基准;5)用外部治理平面保证 deny-by-default、短期凭证、独立评测、审计与shutdown。

新颖性

新颖性在于它不是单纯的自反思、记忆系统或自修改代理,而是首次把“功能性自我意识”“个人奇点”“证据门控递归改进”“外部治理平面”组合成一套完整架构。与ReAct、Reflexion、Voyager、Gödel Agent、Darwin Gödel Machine相比,它更强调边界、授权、回滚和人类能力转移。

局限性

  • 本文是position and systems-design paper,没有实现原型、用户研究或与GAIA、OSWorld、SWE-bench、ToolBench等基准的实测比较,因此所有收益都仍是可检验假设而非证据。
  • 自我模型依赖签名清单、审计日志与外部评测;若这些基础设施缺失、被污染或评测设计失真,功能性自我意识会退化为“会说自己是谁”的语言表演。
  • 多代理分工、隐藏评测、回滚和外部治理会增加工程复杂度与运维成本,且在人机协作场景中,如何精确定义“用户价值前沿”仍然困难。

未来方向

后续工作应实现最小SARSI原型,验证Σ_t投影、自评与外部事实的一致性、scope router的越界率、以及Algorithm 2在真实任务上的升级接受率。还需要在GAIA、OSWorld、SWE-bench、ToolBench、AgentBench和MathTutorBench上建立统一的安全—能力—学习三维评测,并研究用户能力转移的长期因果效应。

AI 总览摘要

这篇论文提出了SARSI(Self-Aware Recursively Self-Improving)代理:一种把“会执行任务”与“会审视自己并改进自己”同时纳入设计目标的多智能体架构。作者认为,现有LLM代理已经能规划、用工具、记忆和长程执行,但一旦涉及自我修改,就会遇到权限、边界、评估、回滚和责任归属等现实问题。于是,论文把“自我意识”严格定义为功能性能力:系统要能识别自身身份、目标、能力、限制、不确定性、关系、历史和发展变化,但这并不意味着主观体验或意识。

围绕这一点,论文提出一整套系统栈:单个代理持有证据链接的自模型Σ_t,任务先经任务合同编译,再由scope router分派给唯一的主责代理;执行阶段采用planner–executor–verifier循环;改进阶段则进入证据门控的慢循环,只有在隐藏/持出评测、风险分类、权限检查和可回滚条件都满足时,候选修改才可晋升。核心公式包括代理状态At_i=(θ,π,M,S,G,Σ,P,E,V)、改进算子A'=I(A,D,B)、能力分布C_j~Beta(α_j,β_j)、以及接受准则Accept(A,A′)要求持出性能提升、安全达标、风险不升、权限不扩张且谱系完整。

论文的真正雄心不是“做出更强模型”,而是把代理系统变成可治理、可审计、可培养人的基础设施。作者提出Personal Singularity:一组围绕单个用户持续演化的代理生态,目标不是抽象AGI,而是帮助用户逼近不断扩张的“可行能力前沿”。这使系统设计从“替用户做更多事”转向“让用户和系统一起变强”。不过,论文也明确承认:它是系统设计与研究路线图,不是已经完成的实证成果;没有报告GAIA、OSWorld、SWE-bench或ToolBench上的实际分数,因此其价值主要在形式化、边界设定和评测框架,而不在经验性能。

深度分析

研究背景

LLM代理研究从ReAct、Self-Refine、Reflexion发展到Voyager、CoALA、MemGPT和Generative Agents,已经证明语言模型可以结合工具、记忆和规划完成复杂任务。随后,Gödel Agent、Darwin Gödel Machine、MetaSkill-Evolve等工作开始触及自修改与元技能演化,但多数仍停留在“能改”而非“该不该改、谁批准、如何回滚”的层面。与此同时,GAIA、OSWorld、SWE-bench、ToolBench、AgentBench和MLAgentBench说明,现实环境中的代理评测必须覆盖工具调用、代码执行、交互式任务和长时程可靠性。本文正是在这一脉络上,把自我建模、权限治理和人类能力培养合并为一个统一系统。

核心问题

核心问题有三层:第一,长程代理如何知道自己是否在范围内、是否有权限、是否足够确定;第二,当代理想改进自己时,什么证据足以证明升级是安全且有益的;第三,如何避免系统能力提升却让用户更依赖、更脆弱。作者指出,单靠自我反思或单轮评测无法解决这些问题,因为它们没有把身份、权限、审计、工具测试、持出评测和回滚机制放进同一控制框架。

核心创新

创新主要体现在五点。• 功能性自我意识:不是哲学式意识,而是可测试的身份、边界、能力与历史建模。• 证据链接自模型:Σ_t的每一项都来自签名清单、审计日志、任务状态或外部评测,而不是模型自说自话。• 双循环架构:快循环处理任务,慢循环处理改进,二者分离。• 外部治理平面:deny-by-default、短期凭证、独立评测、审计和shutdown都不在模型可写范围内。• 个人奇点目标:把代理优化目标从“更强”扩展为“用户能力前沿的共同推进”。

方法详解

  • �� 状态建模:把代理表示为At_i=(θ_i^t,π_i^t,M_i^t,S_i^t,G_i^t,Σ_i^t,P_i^t,E_i^t,V_i^t),其中θ是参数,π是运行策略,M是记忆,S是技能/工具,G是目标栈,Σ是自模型,P是外部权限,E是证据,V是版本谱系。
  • �� 自模型:Σ_i^t=(I,G,S,C,K,U,T,A,R,D,P),覆盖身份、目标、范围、能力、知识边界、不确定性、任务状态、工具与权限、关系、历史以及改进模型。
  • �� 任务执行:Algorithm 1先CompileContract(q,P),再初始化状态、检索记忆、规划、外部授权、沙箱执行、验证、修复或返回阻塞报告,直到完成或预算耗尽。
  • �� 改进控制:Algorithm 2先ProposeChange,再RiskClassify,随后构造隔离候选、跑静态安全与持出测试;若低风险且不扩权,可由外部策略决策,否则进入人工审查。
  • �� 晋升准则:式(6)要求Dheldout性能增益≥τ_p、安全≥τ_s、风险差≤τ_r、权限子集满足P_approved、并具备完整谱系与回滚。
  • �� 自我评估:用贝叶斯式能力模型C_j~Beta(α_j,β_j)和命题结构q=(z,τ,p,E^+,E^-,v)刻画置信度、证据与下一步验证动作。

实验设计

本文没有报告真实系统实验,而是提出评测设计。作者建议使用GAIA、OSWorld、SWE-bench、ToolBench、AgentBench、MLAgentBench和MathTutorBench来分别覆盖通用助理、电脑环境、软件修复、API调用、交互式代理、实验循环与教学能力。评测应区分工具测试、端到端任务基准和人类学习结果,并使用隐藏/轮换持出集、沙箱安全测试、权限审查与回滚验证。

结果分析

论文最重要的“结果”是架构性而非数值性:它清晰地区分了输出改写、记忆学习、技能学习、政策学习、权重学习和元改进,并把只有最后两类视为高风险递归自改进。另一个关键结论是,单次失败不能上升为普适规则,所有候选升级都必须保留来源证据并接受持出测试。

应用场景

短期内,SARSI适用于企业知识工作、研究助理、代码维护、文档生成和受控个人助手,尤其适合需要明确授权、可审计日志和可回滚更新的环境。中期上,它也可作为教育型代理或辅导型代理的设计模板,把“代做”与“教会”分开,避免用户长期依赖。

局限与展望

作者承认三类限制。第一,缺少原型与实证数据,因此所有安全性和能力提升都只是可执行设计,而非已证实效果。第二,系统依赖高质量外部治理、隐藏评测和审计基础设施,现实部署成本不低。第三,个人奇点涉及价值判断,如何定义“能力前沿”与“对用户有益”并不简单,尤其在健康、关系和财务等高度主观维度上。

通俗解读 非专业人士也能看懂

把这套系统想成一家超严谨的大工厂。工厂里有很多工人,但每个工人都只负责自己那一小块;来了新订单,先不是立刻开干,而是先写清楚“要做什么、能不能做、谁批准、做到什么算完成”。如果工人想升级自己的工作方法,也不能自己偷偷改机器,而是要把改动提案送去检查:先看有没有危险,再看会不会影响别的车间,最后还要拿旧订单做对照测试。这样做的目的,不只是让工厂产量更高,更是让工厂老板也越来越会管理这家工厂。作者说的“个人奇点”,就是这座工厂不只帮你干活,还帮你学会更强的本领,慢慢接近你自己想成为的样子。

简单解释 像给14岁少年讲一样

你可以把它想成一个超级聪明的游戏公会!公会里有好多角色:有的负责接任务,有的负责查资料,有的负责打怪前先看地图,还有的负责复盘“刚才为什么翻车了”。SARSI 的厉害之处是:它不只会玩,还会知道“我现在是不是该接这个任务”“我打得过吗”“我是不是没权限进这个副本”。

更酷的是,它想升级自己时,不是随便点“强化”按钮。它会先去训练场试试新招式,再拿旧战绩对比,确认真的变强了、也没学坏,才允许正式上线。这样就像你在游戏里练新连招,不能直接拿去排位坑队友,对吧?

作者还特别强调:这个系统不是要变成“神秘意识体”,而是要像一个靠谱队友,能记住自己是谁、擅长什么、哪里不会、需要谁帮忙。它甚至还把“让人变强”当成目标之一,不只是让AI自己变强。换句话说,它不想当只会刷分的外挂,而想当真正会带你升级的教练!

术语表

Functional self-awareness(功能性自我意识)

指系统能在运行中识别自身身份、目标、权限、能力边界和历史,并据此调整行为。它不等于主观体验或意识,只是一种可测试的控制能力。

用来定义SARSI中“self-aware”的严格含义。

External governance plane(外部治理平面)

位于代理之外的控制层,负责策略、权限、审计、回滚和停止机制。它确保代理不能单方面改写自己的授权或评测。

图1中的最高治理与安全边界。

Scope router(范围路由器)

把每个被接受的任务分配给唯一且可追责的主代理,并把越界工作结构化移交出去。它避免多个代理同时抢任务或无人负责。

任务分派与责任归属的核心组件。

Evidence-gated improvement(证据门控改进)

只有在持出测试、安全检查、风险评估和回滚准备都通过后,改动才允许发布。它把“看起来更聪明”与“真的更可靠”区分开。

Algorithm 2和式(6)的核心。

Personal capability frontier(个人能力前沿)

在时间、健康、资源和价值约束下,用户当前可达到的最优能力边界。它是多目标概念,不是单一分数。

个人奇点的目标函数。

开放问题 这项研究留下的未解疑问

  • 1 开放问题之一是:如何在真实世界里可靠估计用户的能力前沿,尤其是健康、关系和财务等高度主观维度。仅靠模型推断会有偏差,需要长期行为证据与用户反馈的联合校准。
  • 2 另一个问题是:证据门控改进在面对分布漂移时是否足够稳健。隐藏评测和持出集能防止过拟合,但也可能与真实部署环境不一致,需要持续更新评测设计。

应用场景

近期应用

受控企业助手

可用于文档、代码、数据分析和内部流程自动化。前提是有签名权限、审计日志、沙箱执行和回滚机制;收益是减少越权和错误扩散。

教学型个人代理

可在写作、编程、考试复习中提供分层帮助:先建议、再提示、最后才代做。它适合希望提升独立能力的学生和职场新人。

远期愿景

个人奇点操作系统

未来可形成围绕个人的代理生态:工作代理、学习代理、健康支持代理彼此协同,持续扩大用户可行能力前沿。真正难点是治理、隐私和长期效果评估。

原文摘要

Large language model (LLM) agents can plan, use tools, maintain memory, and execute long-horizon tasks. This paper proposes Self-Aware Recursively Self-Improving (SARSI) agents: governed agents that maintain a persistent self-model of identity, goals, capabilities, limitations, uncertainty, relationships, history, and developmental change, and use that model to guide and evaluate recursive improvement. Self-awareness is defined functionally and does not imply subjective experience or phenomenal consciousness. We pair SARSI agents with personal singularity, a bounded human-AI co-development objective in which an agent ecosystem helps a user approach an expanding, user-defined feasible capability frontier. Each agent has a goal contract, bounded scope, validated tool registry, tool tests, end-to-end benchmarks, owner-controlled autonomy, routing, memory, self-model, and improvement policy. A scope router assigns every accepted task to one accountable primary agent and transfers out-of-scope work through structured handoffs. A user-facing Auto-Index selects interactive, hybrid, autonomous, or scheduled behavior without overriding external permissions. The architecture combines a planner-executor-verifier loop, an evidence-gated improvement loop, an external governance plane, decentralized lineages, an owner-directed agent foundry, and a Personal Singularity OS coordinating working, computational-imaging, work-process-learning, and personal-learning agents. We formalize functional self-awareness, scope, routing, improvement acceptance, bounded goal evolution, tool-first execution, and human capability transfer, and provide safety invariants, benchmark design, and a staged implementation roadmap. This is a position and systems-design paper, not evidence that consciousness, unrestricted recursive self-improvement, or personal singularity has been achieved.

cs.CV