一个保护自身
并在变好的系统。

分阶段红蓝对抗演进。Lyapunov 式收敛监控跟踪防御是否逐轮变强。

收敛性

Lyapunov 收敛性证明

FNR -60%,200 轮自演进后的数学可证收敛

V(x)= xᵀPx , V̇(x)≤ -α‖x‖² Lyapunov 函数保证指数级收敛
-60%
FNR 降幅
从 10% 降至 4%,漏报率降 60%
数学可证
行为上界
Lyapunov 稳定性理论保证系统不会失控
每轮收敛
非经验调参
每次部署迭代都有向安全方向的数学保证
-67%
FPR 同步下降
从 6% 降至 2%,无安全盲区

大多数系统随时间变化。MAREF 的演进引擎硬化。 Lyapunov 式收敛监控根据观测到的指标历史计算稳定性指数,引擎跟踪错误指标是否下行——它在变好,而不是空转。

可度量的硬化。

指标历史上方的 Lyapunov 式指数显示防御是否在变强——收敛是被监控的,不是被假设的。

红蓝对抗。逐级升级。

分阶段攻击向量 + 五级红/蓝等级的红蓝对抗演进。每轮为防御打出 0-100 分。

用行动赢得的信任。

九因素 Trust Engine v2。每次交互重新校准信任度。反博弈检测阻止智能体钻空子。

可以度量的演进。

演进引擎用 Lyapunov 式启发式跟踪收敛:从观测到的指标历史计算稳定性指数,观察错误指标的下行趋势。 这是可复现的运行时遥测,不是一个被断言的数学证明。

红蓝对抗,一轮接一轮。

红蓝对抗演进让真实的安检门、状态机和熔断器面对分阶段攻击向量,跨越五级红方和五级蓝方。 每轮对检测、缓解、恢复和自适应打出 0-100 分——你可以看着防御一轮轮变强。

运行一轮红蓝防御
from maref.redblue import RedBlueEngine, PHASE1_ATTACKS
from maref.redblue import RedLevel, BlueLevel

engine = RedBlueEngine()
result = engine.run_round(
    round_id="demo-1",
    phase=1,
    attack=PHASE1_ATTACKS[0],
    red_level=RedLevel.R3,
    blue_level=BlueLevel.B2,
)

print(f"defense score: {result.total_score:.0f}/100")

信任是赢来的。每次交互。重新校准。

Trust Engine v2 每次交互加权九个因素:任务完成度、响应质量、延迟、错误率、合规遵守、 行为一致性、同伴声誉、时间稳定性和协作得分。Goodhart 反博弈检测阻止智能体为了优化信任指标而牺牲实际可信度。

技术规格

演进方式
红蓝对抗,分阶段攻击向量
红方等级
5(R1 脚本小子 → R5 自主 AI)
蓝方等级
5(B1 被动 → B5 完全自主)
防御评分
检测/缓解/恢复/自适应,0-100
信任因素
9 — 任务完成度、响应质量、延迟、错误率、合规遵守、行为一致性、同伴声誉、时间稳定性、协作得分
收敛监控
Lyapunov 式启发式指数,基于指标历史