自主AI系统的递归自进化

一个保护自身——并可衡量地变得更好的系统。MAREF的递归进化引擎使用Lyapunov风格的启发式方法跟踪观察指标历史的收敛性。

什么是AI Agent的递归自进化?

递归自进化是一个闭环过程,AI系统观察自身性能、识别改进机会、生成和验证更改、部署它们,然后重复。与传统MLOps(人工发起重训练)不同,递归进化是自主的——系统持续适应,无需人工干预每个周期。

MAREF将其实现为Self-*管道:Self-Observer→Self-Diagnostician→Self-Architect→Self-Executor→Self-Healer→Self-Optimizer。每个组件都有不同的角色,管道由适用于所有Agent活动的相同安全约束管理。

MAREF的进化引擎如何在自修改期间保证安全?

自修改本质上是危险的。MAREF通过多层安全架构解决这个问题:

  • 宪法红线 — 任何进化周期都无法覆盖的不可变安全约束。在元治理层强制执行。
  • 规则冻结区 — 关键治理规则需要合格人工的HMAC签名批准才能更改。
  • AST沙箱 — 所有生成的代码在部署前都经过解析、验证和沙箱测试。格式错误或不安全的AST被拒绝。
  • 原子部署+回滚 — 更改原子部署。如果部署后验证测试失败,系统自动回滚到之前的已知良好状态。
  • 饱和检测 — 优化器检测改进何时达到平台期并停止进化周期,防止过拟合或退化。

什么是Lyapunov风格的收敛监控,为什么重要?

在控制理论中,Lyapunov稳定性是证明动态系统收敛到期望状态的数学框架。MAREF改编了该思想的精神作为运行时监控启发式方法:它从观察的误差指标历史计算稳定性指数,并观察这些指标是否随时间呈下降趋势。

这是运行时遥测,不是形式化证明。MAREF不声称误差率单调下降——它对指标进行检测,并让公共基准套件重现该趋势。可重现性使声明可检查而非营销主张,这对安全关键Agent部署很重要。

收敛监控:指标历史上的启发式Lyapunov指数(参见tests/benchmark/)

红蓝对抗进化如何工作?

红蓝进化将对抗攻击Agent(红)与防御Agent(蓝)置于结构化回合中。每个回合有五个阶段:侦察、利用、升级、持久化和渗透。红Agent在配置级别探测防御,蓝Agent从每次攻击中学习并加强防御,每回合对检测、缓解、恢复和适应进行评分。

收敛是被监控而非假设的:引擎跟踪误差指标是否跨回合呈下降趋势,并报告增量,您可以从公共基准套件重现。

运行红蓝防御回合
from maref.redblue import RedBlueEngine, PHASE1_ATTACKS
from maref.redblue import RedLevel, BlueLevel

engine = RedBlueEngine()
result = engine.run_round(
    round_id="learn-1",
    phase=1,
    attack=PHASE1_ATTACKS[0],
    red_level=RedLevel.R3,
    blue_level=BlueLevel.B2,
)

print(f"defense score: {result.total_score:.0f}/100")

什么是Self-*架构?

Self-*(Self-star)架构是MAREF递归进化的实现,组织为八个自主组件:

  • Self-Observer — 持续监控代码库更改、测试成功率和系统指标。
  • Self-Knowledge — 维护代码库、测试套件和架构的结构化知识。
  • Self-Diagnostician — 运行全系统健康诊断并识别改进领域。
  • Self-Architect — 为识别的改进生成架构提案。
  • Self-Executor — 实施更改:生成代码→AST验证→安全检查→原子部署→验证→失败回滚。
  • Self-Healer — 使用分区恢复策略检测和从故障中恢复。
  • Self-Optimizer — 运行变异→沙箱→接受/恢复优化周期,带饱和检测。
  • Self-Version — 管理依赖版本固定和API兼容性矩阵。

每个Self-*组件在治理层的安全约束内运行——没有组件可以修改宪法规则、跨越其声明的信任边界,或在没有审计日志的情况下操作。

可以在没有MAREF治理层的情况下使用递归进化吗?

技术上可以——Self-*模块可以单独导入。但是,强烈不建议在生产中没有MAREF治理层的情况下运行自主自修改。治理层提供断路器、漂移检测、宪法红线和审计跟踪,使自进化安全而非鲁莽。

深入了解Self-*实现,请参见进化功能页面。治理基础,请参见Agent治理

进化引擎规格

类型
带红蓝对抗训练的递归自进化
Self-*组件
8个(Observer、Knowledge、Diagnostician、Architect、Executor、Healer、Optimizer、Version)
收敛监控
指标历史上的Lyapunov风格启发式指数
对抗模型
红蓝回合,5阶段,可配置红/蓝级别
防御评分
检测/缓解/恢复/适应,0-100
安全约束
宪法红线、规则冻结区、AST沙箱、原子回滚