《AI 能力边界与系统建设》最后一章。前面九章分别是边界的一块拼图,这一章把它们拼成一张上线验收清单——AI 项目能不能放生产,不是看 demo 多惊艳,是看这张清单能不能逐条打勾。
立项阶段用AI 项目 POC 评估清单判断「值不值得做」;本文的清单判断「能不能上线」——一张管决策,一张管交付。
一、边界与承诺(第 1、2 章)
二、任务与分流(第 3 章)
- 能走规则的任务没被 AI 抢走(成本与稳定性)
- 错不起的任务(钱/合规/安全)没有交给 AI 做主
- 运行时二次分流存在:规则优先 → 模型不确定转人 → 失败降级
三、效果度量(第 4 章)
- 真实评测集 ≥100 条、按难度分级、来源是真实日志
- 四类指标定义口径:成功率 / 拒绝率 / 错误模式 / 成本
- 基线已跑,承诺目标可验证
- 有评测责任人,报告周期已定
四、幻觉治理(第 5 章)
- 检索打底(混合检索/重排/切分质量)
- 强制引用,无引用不出答案
- 结构化输出 + 代码校验器(不是用模型拦模型)
- 高风险回答带人工确认标记,案例回流评测集
五、链路追踪(第 6 章)
- request_id 贯穿,检索/工具/模型各成 span
- 输入输出脱敏后落库,可回放定位
- 回放台能还原「当时它做了什么」
六、降级与人工接管(第 7 章)
- 降级链 L0–L3 定义完,触发条件写死
- 转人工通道带上下文、有 SLA 和值班 owner
- 降级告警 + 演练过至少一次(没演练过 = 没有)
七、安全与合规
八、升级与组织(第 8、9 章)
- 变更走「回归 → 灰度 → 锁定」,有回滚能力
- 三个角色认领:产品边界人 / 评测责任人 / 稳定性 owner
- AI 事故纳入既有复盘机制,加「边界为什么没拦住」三问
放生产的最后一问
清单全绿后,再问一次负责人三个问题,答得上来才真正放行:
- 它承诺了什么?(能一句话说清,而不是「效果挺好的」)
- 它不承诺什么?(知道边界在哪,才知道风险在哪)
- 它失效时会发生什么?(降级到哪、谁接管、用户怎么感知)
这三问其实贯穿了整个系列:边界清晰、效果可测、失效可控——做到这三点,AI 就从「玩具」变成了「系统的一部分」。