边界体系的第 7 章。前面讲的是「让 AI 少出错」,这一章面对现实:AI 一定会失效——模型超时、答错被投诉、成本超预算、供应商出故障。一个 AI 系统的成熟度,不看你 demo 多顺,看你在 AI 不行的那几分钟里,系统是什么表现。
降级不是「关了拉倒」,是一级一级地换服务
降级链按「服务降级、体验打折、不中断」设计,逐级往下:
L0 完整 AI 服务(检索 + 大模型 + 引用)
L1 简化模式(小模型 / 去检索直答 / 模板答案)
L2 只读兜底(返回知识库原文片段,不生成)
L3 人工接管(转人工队列 / 提示稍后再试)
- 触发条件要写死:模型超时率超阈值、P95 延迟破线、预算帽触发、供应商故障——每种条件对应降到哪一级,预案里写清楚。
- 降级要对用户可见:用户有权知道「当前是简化模式,复杂问题建议稍后/转人工」——悄悄降级又被发现答得差,比直接说明伤害更大(故障沟通的原则同样适用)。
- 降级要可恢复:条件恢复后自动回 L0,别降下去就忘了升回来。
人工接管:把「人」设计进系统,而不是事后补
边界体系里,「转人工」不是失败,是设计好的出口:
- 识别何时该交给人:模型不确定(拒绝分支)、高风险操作(任务分流的责任任务)、用户明确要求人工——三种情况都要有转人通道。
- 交得顺:转人工时把上下文一起带过去(用户问了什么、AI 试了什么、为什么转),别让用户对着客服再讲一遍——上下文移交做不好,转人工等于赶客。
- 接得住:人工队列要有 SLA 和值班 owner;没人接的「转人工」比 AI 硬答更伤信任。
用稳定性工程的做法对待 AI
AI 服务也是服务,该享受稳定性建设的待遇:
- 告警:模型错误率、超时率、降级触发率——降级本身也要告警(说明 L0 出问题了,要去查)。
- 演练:季度做一次「模型供应商故障」演练:断掉模型调用,看系统是否按预案降级、人工通道是否通畅——没演练过的降级链,等于没有。
- 熔断:连续失败自动熔断到 L1/L2,避免故障放大;熔断恢复要有半开探测。
一个完整的演示(客服场景)
- 正常:AI 检索知识库作答,带引用。
- 模型超时 3 次 → 自动熔断 → L1 小模型直答常见问题。
- 预算日额度耗尽 → L2 只返回知识库原文片段 + 提示。
- 用户问复杂纠纷 → 模型主动拒绝 → L3 转人工,上下文随行。
- 供应商故障 5 分钟 → 全站降级到 L2,值班收到告警,按预案排查。
落地清单
- 降级链 L0–L3 设计完,触发条件写死
- 降级状态对用户可见、可自动恢复
- 转人工带上下文,人工队列有 SLA 与 owner
- 降级/熔断告警 + 季度故障演练
- 故障复盘走既有机制(事故沟通)