Guardrail 安全護欄
面向客戶的 Agent 強烈建議開啟,並列入 上線合規自查清單。
是什麼
平臺內建的機制層合規攔截能力,在輸入和輸出兩端自動識別並處理風險內容。與 System Prompt 中的合規紅線 (模型層約束) 配合,構成雙重保險:提示詞約束模型"該怎麼說",Guardrail 保證越界內容"出不去"。
四項護欄
輸入側 (Chatflow 輸入節點)
| 護欄 | 開啟後的行為 |
|---|---|
| PII 打碼 | 自動識別使用者輸入中的個人身份資訊 (PII),以星號 (*) 替換;被隱藏的資訊在後續會話中不再展示 |
| 遮蔽不良內容 | 識別涉及仇恨、騷擾、自殘、暴力、色情、未成年人相關、違法及其他高風險內容,檢測到即阻斷響應,不再處理或返回結果 |
| 遮蔽不良金融領域內容 | 依據法律法規、監管要求及平臺合規規則,識別非法交易建議類輸入 —— 包括洗錢 (隱匿資金來源、分層交易、拆分交易)、逃稅、證券欺詐、內幕交易、市場操縱、恐怖融資或規避制裁、使用被盜/偽造身份賬戶交易等金融犯罪,阻斷響應並終止後續處理 |
輸出側 (LLM / Agent 輸出節點)
| 護欄 | 開啟後的行為 |
|---|---|
| 輸出內容合法合規檢查 | 輸出時即時校驗;識別到不合法或不符合金融合規要求的內容,立即停止輸出並清空已生成的內容 |
怎麼用
- 輸入側:在 Chatflow 的輸入節點配置中開啟對應開關
- 輸出側:在 LLM / Agent 節點的輸出配置中開啟「輸出內容合法合規檢查」
與提示詞護欄的分工
| System Prompt 紅線 | Guardrail | |
|---|---|---|
| 層級 | 模型層 (引導模型不說) | 機制層 (說了也攔下) |
| 覆蓋 | 語氣、表述方式、業務規則 | PII、高風險內容、金融犯罪、輸出合規 |
| 失效場景 | 提示詞被繞過、模型跑偏 | 不受提示詞影響 |
結論:兩者不是二選一,面向客戶的 Agent 應同時啟用。 提示詞紅線寫法見 提示詞編寫技巧第三節。