跳转到内容

容灾能力

位置:模型配置与节点异常处理相关设置 生产环境的 Agent 不能因为某个模型厂商抖动、某次调用失败就整体不可用。平台提供一组容灾能力,让 Agent 在异常情况下仍能稳定输出。

模型跨厂商调用

是什么:同一个模型 (相同模型名) 往往在多个厂商/多个账号下都有部署。开启跨厂商调用后,当模型调用失败触发重试时,系统可切换到其他已启用厂商下相同模型名的账号继续调用。

  • 主账号所在厂商故障、限流时,自动切换备用厂商,用户侧几乎无感
  • 切换仅发生在相同模型名之间,不会悄悄换成别的模型 —— 输出能力和风格保持一致
  • 前提:目标厂商账号已在平台启用

适用场景:面向客户的生产 Agent 建议开启,单厂商故障不再是单点故障。

模型组合

是什么:系统提供预设的模型组合方案(如「高性价比组合」「高性能组合」),也支持自行选择单个模型。

容灾意义:模型组合在提升性价比之外,也降低了对单一模型的依赖 —— 组合内多模型互为备份,避免把所有节点绑死在一个模型上。

搭配建议:配合节点级模型配置使用 (不同节点选不同模型),关键链路与非关键链路分散到不同模型,进一步隔离风险。

失败时重试

是什么:模型或工具调用失败时,系统支持自动重试,而不是一次失败即终止。

  • 重试与「跨厂商调用」联动:开启跨厂商后,重试时可切换厂商账号,而不是在故障厂商上反复撞墙
  • 用量计费以实际发生的调用为准:已发送至模型的请求按实际 token 消耗计费,未发送的不计费

异常处理

调用失败后流程怎么走,由异常处理机制决定:

场景处理方式
LLM 调用失败流程可根据配置选择继续或中断执行;已发送部分按实际消耗计费,失败不触发额度回滚
Tool 调用失败工具失败本身不影响结算;未触发模型推理则不消耗用量
Iteration 单项失败配置错误处理后,单个元素失败不中断整体,其余元素正常产出 (见 Iteration 节点)
用户主动终止 / 系统异常中断已发生的消耗不回滚,未执行部分不计费,流程进入终止态可供审计

生产 Agent 的容灾配置清单

  • [ ] 核心模型开启跨厂商调用(确认备用厂商账号已启用)
  • [ ] 关键调用配置失败重试
  • [ ] 批量任务 (Iteration) 配置错误处理,单项失败不拖垮整体
  • [ ] LLM/Tool 失败时的分支行为已设计 (继续 / 中断 / 兜底话术),不让用户看到裸报错
  • [ ] 用三类异常用例实测过:厂商故障 (可用切换验证)、工具超时、批量任务部分失败

关联阅读