生产AI系统的Agent治理
多Agent部署的运行时安全、信任执行和模型检查护栏。MAREF是首个专为Agent治理构建的开源框架。
什么是Agent治理?
Agent治理是在运行时控制、验证和审计自主AI Agent行为的学科。与保护静态代码的应用安全(AppSec)不同,Agent治理必须处理动态的、LLM驱动的行为,这些行为在部署时无法完全预测。
Agent治理框架提供:每个Agent的身份验证、具有模型检查转换的状态机、在执行前拦截不安全操作的运行时安全门、捕获模型退化的漂移检测,以及自动停止失控行为的断路器。
MAREF框架将所有这些实现为一个统一的治理操作系统——而非附加到编排工具上的功能。
为什么生产Agent需要治理?
生产Agent系统面临编排框架本身无法处理的风险。LangGraph或CrewAI部署可以编排复杂的工作流,但没有治理,就没有在运行时强制执行安全边界的机制。
OWASP Agentic Top 10识别了关键风险,包括:未授权工具访问、通过Agent间通信的提示注入、拒绝钱包攻击、过度代理(Agent采取超出预期范围的操作),以及Agent能力中的供应链漏洞。这些风险并非理论上的——真实事件已导致数据泄露、财务损失和监管处罚。
MAREF的治理与其他框架有何不同?
每个主要Agent框架(LangGraph、CrewAI、AutoGen、Anthropic的Agent协议)都将安全视为次要关注点。它们的重点是编排——让Agent高效协作。MAREF反转了这一优先级:治理是基础,编排构建在其之上。
具体差异化:
- TLA+模型检查 — 治理FSM针对其宪法红线不变量的TLA+规范进行模型检查。
- 10态Gray Code FSM — Hamming距离=1确保每次转换只改变信任状态的一个维度。没有模糊的中间状态。
- 4级安全决策树 — 规则→模式→安全门→人工升级,自动解决常规决策,将边缘案例升级到人工判断,带有清晰的审计跟踪。
- 运行时漂移检测 — LoRA/本体论双重检测在模型漂移导致安全故障之前捕获它。
- 带HALT吸收的断路器 — 三次连续失败触发不可逆停止,只有人工覆盖才能释放。
治理状态机如何工作?
MAREF的治理引擎使用4位Gray码编码的10态有限状态机。每个状态代表不同的信任级别,从完全自主到完全停止。Gray码编码确保相邻状态恰好相差一位——消除模糊转换。
状态机包含一个吸收HALT状态。当在可配置的时间窗口内发生三次连续安全失败时,系统转换到HALT。没有Agent、管道或自动化流程可以覆盖此状态。只有显式的人工认证才能释放它。
from maref import GovernanceStateMachine, GovernanceState
sm = GovernanceStateMachine()
sm.transition(GovernanceState.OBSERVE, "start monitoring")
# HALT (state 9) is absorbing — no outgoing edges.
# Leaving it requires an explicit, authenticated human override. 我可以将MAREF与现有框架一起使用吗?
可以。MAREF设计为治理覆盖层——它位于现有编排框架的上方或旁边。集成现在通过MCP(用于工具调用)和A2A(用于Agent间交接)在协议级别工作。原生sidecar适配器正在推出——AutoGen适配器已发布;LangGraph的已规范但尚未合并(参见docs/quickstart §3.3)。治理层在执行前拦截Agent操作、验证信任状态、应用安全规则,然后才将批准的操作转发给您的编排器。
这种互补架构意味着您保留现有的Agent工作流,无需重写任何内容即可添加治理。pip install maref即可开始。
治理保护免受哪些威胁?
MAREF的治理引擎覆盖OWASP Agentic Top 10的所有10个类别,包括:
- 过度代理 — Agent不能提升自己的权限或采取超出其声明范围的操作。
- 工具访问滥用 — 每个工具调用在执行前都根据Agent的权限矩阵进行验证。
- Agent间注入 — 跨Agent通信按SubAgent隔离,防止提示注入传播。
- 拒绝钱包 — Gas计量和成本预算防止失控LLM调用超出财务限制。
- 供应链攻击 — 每个Skill和能力都有带完整性验证的签名清单。
- 非人类身份滥用 — 每Agent零信任身份,SM2/SM3/SM4-GCM加密绑定。