证明智能体在收敛:递归自演进的 Lyapunov 稳定性

作者 MAREF Engineering

Lyapunov 收敛 自进化 形式化方法 TLA+

递归自进化是智能体治理里最强大、也最危险的想法。让系统改进自己的防御,它就能每一轮都变好。但让它在没有刹车的情况下改进,它可能振荡、过拟合、甚至彻底发散。MAREF 的答案借自控制理论:一个Lyapunov 式稳定函数,让「收敛」成为一项被监控的性质,而不是一个愿望。

这是从 MAREF 技术白皮书收敛白皮书(英文)拆出的短文系列第三篇。


自进化需要刹车

自进化的朴素做法是:更新策略,测量,重复。失败模式不是理论上的——优化一个指标的策略可以悄悄牺牲另一个。错误率降下来了,误报却爆炸式增长。系统看起来在变好,实际上在失稳。

MAREF 把系统状态建模成真正重要的指标向量:St = (FNRt, FPRt, Et, Wt, ηt)——漏报率、误报率、错误熵、策略权重、学习率。然后跟踪这个向量是否在朝稳定盆地方向移动。

Lyapunov 思想

控制理论的经典稳定性检验用 Lyapunov 候选函数 V(S),它在全空间为正,并沿系统轨迹递减。MAREF 用同样的形状做启发式:一个指标加权和,V(St) = 2.0·FNRt + 1.0·FPRt + 0.1·Et + 1.0·KL(Wt ‖ W*),其中 KL 衡量策略相对目标分布的漂移。

形式化声明,来自收敛白皮书:当学习率 ηt ≤ 0.005 时,策略轨迹对 W* 形成收缩映射,在 O(1/ε) 轮内收敛到稳定盆地。更新步骤底下垫着两个安全层——熔断器和振荡修复环——防止发散。这是「我们相信它会收敛」和「存在一个 Lyapunov 函数说错误指标在下降」的区别。

200 轮的数字

可从公开基准测试套件复现。200 轮进化:

指标 初始 最终 提升
FNR0.100.04−60%
FPR0.060.02−66.7%
KL 漂移0.020.005−75%
饱和点约第 175 轮自动暂停

饱和检测:什么时候该停止改进

知道什么时候停止,和知道怎么改进一样重要。MAREF 在 |gaint| < 0.003 连续五个窗口时检测到饱和,自动暂停进化以防止过度优化。系统保住了赚来的收益,而不是硬磨进一个更差的局部最优。收敛白皮书报告多次运行的饱和点都在第 ~175 轮附近,并附 Pareto 前沿分析展示准确率与安全之间的权衡曲面。

监控着安全,不是相信安全

MAREF 的自进化和朴素循环的区别,是「我们希望它变好」和「有一个稳定函数、一条收敛定理、还有 200 轮可复现数据」的区别。Lyapunov 式监控是运行时遥测——你可以在 maref status 里实时看着这个指标——完整的证明梗概、经验表格和 TLA+ 检验在 收敛白皮书。40 秒看懂概念:E09:会自己进化的防御,还有数学保证

亲眼看收敛。

安装 MAREF,跑 demo,实时观察稳定指标。开源、Apache 2.0、不需要 GPU。

5 分钟部署 MAREF →