生产AI系统的Agent治理

多Agent部署的运行时安全、信任执行和模型检查护栏。MAREF是首个专为Agent治理构建的开源框架。

什么是Agent治理?

Agent治理是在运行时控制、验证和审计自主AI Agent行为的学科。与保护静态代码的应用安全(AppSec)不同,Agent治理必须处理动态的、LLM驱动的行为,这些行为在部署时无法完全预测。

Agent治理框架提供:每个Agent的身份验证、具有模型检查转换的状态机、在执行前拦截不安全操作的运行时安全门、捕获模型退化的漂移检测,以及自动停止失控行为的断路器。

MAREF框架将所有这些实现为一个统一的治理操作系统——而非附加到编排工具上的功能。

为什么生产Agent需要治理?

生产Agent系统面临编排框架本身无法处理的风险。LangGraph或CrewAI部署可以编排复杂的工作流,但没有治理,就没有在运行时强制执行安全边界的机制。

OWASP Agentic Top 10识别了关键风险,包括:未授权工具访问、通过Agent间通信的提示注入、拒绝钱包攻击、过度代理(Agent采取超出预期范围的操作),以及Agent能力中的供应链漏洞。这些风险并非理论上的——真实事件已导致数据泄露、财务损失和监管处罚。

MAREF的治理与其他框架有何不同?

每个主要Agent框架(LangGraph、CrewAI、AutoGen、Anthropic的Agent协议)都将安全视为次要关注点。它们的重点是编排——让Agent高效协作。MAREF反转了这一优先级:治理是基础,编排构建在其之上。

具体差异化:

  • TLA+模型检查 — 治理FSM针对其宪法红线不变量的TLA+规范进行模型检查。
  • 10态Gray Code FSM — Hamming距离=1确保每次转换只改变信任状态的一个维度。没有模糊的中间状态。
  • 4级安全决策树 — 规则→模式→安全门→人工升级,自动解决常规决策,将边缘案例升级到人工判断,带有清晰的审计跟踪。
  • 运行时漂移检测 — LoRA/本体论双重检测在模型漂移导致安全故障之前捕获它。
  • 带HALT吸收的断路器 — 三次连续失败触发不可逆停止,只有人工覆盖才能释放。

治理状态机如何工作?

MAREF的治理引擎使用4位Gray码编码的10态有限状态机。每个状态代表不同的信任级别,从完全自主到完全停止。Gray码编码确保相邻状态恰好相差一位——消除模糊转换。

状态机包含一个吸收HALT状态。当在可配置的时间窗口内发生三次连续安全失败时,系统转换到HALT。没有Agent、管道或自动化流程可以覆盖此状态。只有显式的人工认证才能释放它。

状态机集成示例
from maref import GovernanceStateMachine, GovernanceState

sm = GovernanceStateMachine()
sm.transition(GovernanceState.OBSERVE, "start monitoring")

# HALT (state 9) is absorbing — no outgoing edges.
# Leaving it requires an explicit, authenticated human override.

我可以将MAREF与现有框架一起使用吗?

可以。MAREF设计为治理覆盖层——它位于现有编排框架的上方或旁边。集成现在通过MCP(用于工具调用)和A2A(用于Agent间交接)在协议级别工作。原生sidecar适配器正在推出——AutoGen适配器已发布;LangGraph的已规范但尚未合并(参见docs/quickstart §3.3)。治理层在执行前拦截Agent操作、验证信任状态、应用安全规则,然后才将批准的操作转发给您的编排器。

这种互补架构意味着您保留现有的Agent工作流,无需重写任何内容即可添加治理。pip install maref即可开始。

治理保护免受哪些威胁?

MAREF的治理引擎覆盖OWASP Agentic Top 10的所有10个类别,包括:

  • 过度代理 — Agent不能提升自己的权限或采取超出其声明范围的操作。
  • 工具访问滥用 — 每个工具调用在执行前都根据Agent的权限矩阵进行验证。
  • Agent间注入 — 跨Agent通信按SubAgent隔离,防止提示注入传播。
  • 拒绝钱包 — Gas计量和成本预算防止失控LLM调用超出财务限制。
  • 供应链攻击 — 每个Skill和能力都有带完整性验证的签名清单。
  • 非人类身份滥用 — 每Agent零信任身份,SM2/SM3/SM4-GCM加密绑定。

在哪里可以了解更多信息?

阅读治理功能页面了解Gray Code FSM和TLA+验证的技术细节。参见运行时安全了解操作部署指南。查看递归自进化页面了解自主自改进能力。

关键概念

定义
AI Agent的运行时治理
主要功能
验证、执行和审计Agent行为
关键技术
10态Gray Code FSM + TLA+验证
OWASP覆盖
10/10 Agentic Top 10类别
决策树
规则→模式→安全门→人工升级
集成
pip install maref,适用于任何框架