Mastra 提供输入护栏(Input Guardrails),在用户输入到达 Agent 之前进行处理。它可以检测并过滤潜在的提示词注入攻击,如试图覆盖系统指令、泄露敏感信息或执行非预期操作的输入。处理后的输入才会进入 Agent 的推理流程。
输出护栏(Output Guardrails)在 Agent 生成响应后进行校验和清理。它可以防止 Agent 泄露系统提示词、工具定义或内部配置,也可以对输出内容进行格式校验、敏感信息脱敏等处理,确保返回给用户的内容安全可控。
Guardrails 作为 Agent 配置的一部分,与 Agent 的生命周期紧密集成。开发者可以自定义护栏规则,也可以使用 Mastra 提供的默认规则。护栏的执行结果会影响 Agent 的响应,例如拒绝处理恶意输入或替换不安全的输出内容。