Guardrail 安全护栏
面向客户的 Agent 强烈建议开启,并列入 上线合规自查清单。
是什么
平台内置的机制层合规拦截能力,在输入和输出两端自动识别并处理风险内容。与 System Prompt 中的合规红线 (模型层约束) 配合,构成双重保险:提示词约束模型"该怎么说",Guardrail 保证越界内容"出不去"。
四项护栏
输入侧 (Chatflow 输入节点)
| 护栏 | 开启后的行为 |
|---|---|
| PII 打码 | 自动识别用户输入中的个人身份信息 (PII),以星号 (*) 替换;被隐藏的信息在后续会话中不再展示 |
| 屏蔽不良内容 | 识别涉及仇恨、骚扰、自残、暴力、色情、未成年人相关、违法及其他高风险内容,检测到即阻断响应,不再处理或返回结果 |
| 屏蔽不良金融领域内容 | 依据法律法规、监管要求及平台合规规则,识别非法交易建议类输入 —— 包括洗钱 (隐匿资金来源、分层交易、拆分交易)、逃税、证券欺诈、内幕交易、市场操纵、恐怖融资或规避制裁、使用被盗/伪造身份账户交易等金融犯罪,阻断响应并终止后续处理 |
输出侧 (LLM / Agent 输出节点)
| 护栏 | 开启后的行为 |
|---|---|
| 输出内容合法合规检查 | 输出时实时校验;识别到不合法或不符合金融合规要求的内容,立即停止输出并清空已生成的内容 |
怎么用
- 输入侧:在 Chatflow 的输入节点配置中打开对应开关
- 输出侧:在 LLM / Agent 节点的输出配置中打开「输出内容合法合规检查」
与提示词护栏的分工
| System Prompt 红线 | Guardrail | |
|---|---|---|
| 层级 | 模型层 (引导模型不说) | 机制层 (说了也拦下) |
| 覆盖 | 语气、表述方式、业务规则 | PII、高风险内容、金融犯罪、输出合规 |
| 失效场景 | 提示词被绕过、模型跑偏 | 不受提示词影响 |
结论:两者不是二选一,面向客户的 Agent 应同时启用。 提示词红线写法见 提示词编写技巧第三节。