容灾能力
位置:模型配置与节点异常处理相关设置 生产环境的 Agent 不能因为某个模型厂商抖动、某次调用失败就整体不可用。平台提供一组容灾能力,让 Agent 在异常情况下仍能稳定输出。
模型跨厂商调用
是什么:同一个模型 (相同模型名) 往往在多个厂商/多个账号下都有部署。开启跨厂商调用后,当模型调用失败触发重试时,系统可切换到其他已启用厂商下相同模型名的账号继续调用。
- 主账号所在厂商故障、限流时,自动切换备用厂商,用户侧几乎无感
- 切换仅发生在相同模型名之间,不会悄悄换成别的模型 —— 输出能力和风格保持一致
- 前提:目标厂商账号已在平台启用
适用场景:面向客户的生产 Agent 建议开启,单厂商故障不再是单点故障。
模型组合
是什么:系统提供预设的模型组合方案(如「高性价比组合」「高性能组合」),也支持自行选择单个模型。
容灾意义:模型组合在提升性价比之外,也降低了对单一模型的依赖 —— 组合内多模型互为备份,避免把所有节点绑死在一个模型上。
搭配建议:配合节点级模型配置使用 (不同节点选不同模型),关键链路与非关键链路分散到不同模型,进一步隔离风险。
失败时重试
是什么:模型或工具调用失败时,系统支持自动重试,而不是一次失败即终止。
- 重试与「跨厂商调用」联动:开启跨厂商后,重试时可切换厂商账号,而不是在故障厂商上反复撞墙
- 用量计费以实际发生的调用为准:已发送至模型的请求按实际 token 消耗计费,未发送的不计费
异常处理
调用失败后流程怎么走,由异常处理机制决定:
| 场景 | 处理方式 |
|---|---|
| LLM 调用失败 | 流程可根据配置选择继续或中断执行;已发送部分按实际消耗计费,失败不触发额度回滚 |
| Tool 调用失败 | 工具失败本身不影响结算;未触发模型推理则不消耗用量 |
| Iteration 单项失败 | 配置错误处理后,单个元素失败不中断整体,其余元素正常产出 (见 Iteration 节点) |
| 用户主动终止 / 系统异常中断 | 已发生的消耗不回滚,未执行部分不计费,流程进入终止态可供审计 |
生产 Agent 的容灾配置清单
- [ ] 核心模型开启跨厂商调用(确认备用厂商账号已启用)
- [ ] 关键调用配置失败重试
- [ ] 批量任务 (Iteration) 配置错误处理,单项失败不拖垮整体
- [ ] LLM/Tool 失败时的分支行为已设计 (继续 / 中断 / 兜底话术),不让用户看到裸报错
- [ ] 用三类异常用例实测过:厂商故障 (可用切换验证)、工具超时、批量任务部分失败
关联阅读
- 模型与工具生态 — 模型池与节点级模型配置
- 运行调试与观测 — 通过 Logs 定位失败原因
- 流程编排模式与调试技巧 — 兜底分支设计