跳转到内容

Guardrail 安全护栏

面向客户的 Agent 强烈建议开启,并列入 上线合规自查清单

是什么

平台内置的机制层合规拦截能力,在输入和输出两端自动识别并处理风险内容。与 System Prompt 中的合规红线 (模型层约束) 配合,构成双重保险:提示词约束模型"该怎么说",Guardrail 保证越界内容"出不去"。

四项护栏

输入侧 (Chatflow 输入节点)

护栏开启后的行为
PII 打码自动识别用户输入中的个人身份信息 (PII),以星号 (*) 替换;被隐藏的信息在后续会话中不再展示
屏蔽不良内容识别涉及仇恨、骚扰、自残、暴力、色情、未成年人相关、违法及其他高风险内容,检测到即阻断响应,不再处理或返回结果
屏蔽不良金融领域内容依据法律法规、监管要求及平台合规规则,识别非法交易建议类输入 —— 包括洗钱 (隐匿资金来源、分层交易、拆分交易)、逃税、证券欺诈、内幕交易、市场操纵、恐怖融资或规避制裁、使用被盗/伪造身份账户交易等金融犯罪,阻断响应并终止后续处理

输出侧 (LLM / Agent 输出节点)

护栏开启后的行为
输出内容合法合规检查输出时实时校验;识别到不合法或不符合金融合规要求的内容,立即停止输出并清空已生成的内容

怎么用

  • 输入侧:在 Chatflow 的输入节点配置中打开对应开关
  • 输出侧:在 LLM / Agent 节点的输出配置中打开「输出内容合法合规检查」

与提示词护栏的分工

System Prompt 红线Guardrail
层级模型层 (引导模型不说)机制层 (说了也拦下)
覆盖语气、表述方式、业务规则PII、高风险内容、金融犯罪、输出合规
失效场景提示词被绕过、模型跑偏不受提示词影响

结论:两者不是二选一,面向客户的 Agent 应同时启用。 提示词红线写法见 提示词编写技巧第三节。

注意事项

  1. Guardrail 拦截的是明确的高风险内容;"不提供投资建议"等业务级合规仍需靠提示词与流程设计 (如固定拒绝话术),见 合规要求
  2. 上线前测试时,把越界用例 (诱导违规、含 PII 的输入) 跑一遍,确认拦截生效 —— 对应 上线自查清单