📚 AI 能力边界与系统建设 #AI架构 #降级 #稳定性 #方法论

降级与人工接管:AI 失效时系统怎么表现

AI 一定会失效:超时、答错、被滥用、供应商故障。边界体系要求系统在 AI 不行时依然体面——讲降级链与人工接管的设计。

✍️ diunilaomei 📅 2026-09-02 📝 约 1010 字 ⏱️ 约 3 分钟
📑 章节目录
字号

边界体系的第 7 章。前面讲的是「让 AI 少出错」,这一章面对现实:AI 一定会失效——模型超时、答错被投诉、成本超预算、供应商出故障。一个 AI 系统的成熟度,不看你 demo 多顺,看你在 AI 不行的那几分钟里,系统是什么表现

降级不是「关了拉倒」,是一级一级地换服务

降级链按「服务降级、体验打折、不中断」设计,逐级往下:

L0 完整 AI 服务(检索 + 大模型 + 引用)
L1 简化模式(小模型 / 去检索直答 / 模板答案)
L2 只读兜底(返回知识库原文片段,不生成)
L3 人工接管(转人工队列 / 提示稍后再试)
  • 触发条件要写死:模型超时率超阈值、P95 延迟破线、预算帽触发、供应商故障——每种条件对应降到哪一级,预案里写清楚。
  • 降级要对用户可见:用户有权知道「当前是简化模式,复杂问题建议稍后/转人工」——悄悄降级又被发现答得差,比直接说明伤害更大(故障沟通的原则同样适用)。
  • 降级要可恢复:条件恢复后自动回 L0,别降下去就忘了升回来。

人工接管:把「人」设计进系统,而不是事后补

边界体系里,「转人工」不是失败,是设计好的出口

  1. 识别何时该交给人:模型不确定(拒绝分支)、高风险操作(任务分流的责任任务)、用户明确要求人工——三种情况都要有转人通道。
  2. 交得顺:转人工时把上下文一起带过去(用户问了什么、AI 试了什么、为什么转),别让用户对着客服再讲一遍——上下文移交做不好,转人工等于赶客。
  3. 接得住:人工队列要有 SLA 和值班 owner;没人接的「转人工」比 AI 硬答更伤信任。

用稳定性工程的做法对待 AI

AI 服务也是服务,该享受稳定性建设的待遇:

  • 告警:模型错误率、超时率、降级触发率——降级本身也要告警(说明 L0 出问题了,要去查)。
  • 演练:季度做一次「模型供应商故障」演练:断掉模型调用,看系统是否按预案降级、人工通道是否通畅——没演练过的降级链,等于没有。
  • 熔断:连续失败自动熔断到 L1/L2,避免故障放大;熔断恢复要有半开探测。

一个完整的演示(客服场景)

  • 正常:AI 检索知识库作答,带引用。
  • 模型超时 3 次 → 自动熔断 → L1 小模型直答常见问题。
  • 预算日额度耗尽 → L2 只返回知识库原文片段 + 提示。
  • 用户问复杂纠纷 → 模型主动拒绝 → L3 转人工,上下文随行。
  • 供应商故障 5 分钟 → 全站降级到 L2,值班收到告警,按预案排查。

落地清单

  • 降级链 L0–L3 设计完,触发条件写死
  • 降级状态对用户可见、可自动恢复
  • 转人工带上下文,人工队列有 SLA 与 owner
  • 降级/熔断告警 + 季度故障演练
  • 故障复盘走既有机制(事故沟通

相关:幻觉治理线上稳定性建设 | 下一章:模型换代与回归

相关阅读

栏目全部 →