跳轉到內容

Guardrail 安全護欄

面向客戶的 Agent 強烈建議開啟,並列入 上線合規自查清單

是什麼

平臺內建的機制層合規攔截能力,在輸入和輸出兩端自動識別並處理風險內容。與 System Prompt 中的合規紅線 (模型層約束) 配合,構成雙重保險:提示詞約束模型"該怎麼說",Guardrail 保證越界內容"出不去"。

四項護欄

輸入側 (Chatflow 輸入節點)

護欄開啟後的行為
PII 打碼自動識別使用者輸入中的個人身份資訊 (PII),以星號 (*) 替換;被隱藏的資訊在後續會話中不再展示
遮蔽不良內容識別涉及仇恨、騷擾、自殘、暴力、色情、未成年人相關、違法及其他高風險內容,檢測到即阻斷響應,不再處理或返回結果
遮蔽不良金融領域內容依據法律法規、監管要求及平臺合規規則,識別非法交易建議類輸入 —— 包括洗錢 (隱匿資金來源、分層交易、拆分交易)、逃稅、證券欺詐、內幕交易、市場操縱、恐怖融資或規避制裁、使用被盜/偽造身份賬戶交易等金融犯罪,阻斷響應並終止後續處理

輸出側 (LLM / Agent 輸出節點)

護欄開啟後的行為
輸出內容合法合規檢查輸出時即時校驗;識別到不合法或不符合金融合規要求的內容,立即停止輸出並清空已生成的內容

怎麼用

  • 輸入側:在 Chatflow 的輸入節點配置中開啟對應開關
  • 輸出側:在 LLM / Agent 節點的輸出配置中開啟「輸出內容合法合規檢查」

與提示詞護欄的分工

System Prompt 紅線Guardrail
層級模型層 (引導模型不說)機制層 (說了也攔下)
覆蓋語氣、表述方式、業務規則PII、高風險內容、金融犯罪、輸出合規
失效場景提示詞被繞過、模型跑偏不受提示詞影響

結論:兩者不是二選一,面向客戶的 Agent 應同時啟用。 提示詞紅線寫法見 提示詞編寫技巧第三節。

注意事項

  1. Guardrail 攔截的是明確的高風險內容;"不提供投資建議"等業務級合規仍需靠提示詞與流程設計 (如固定拒絕話術),見 合規要求
  2. 上線前測試時,把越界用例 (誘導違規、含 PII 的輸入) 跑一遍,確認攔截生效 —— 對應 上線自查清單