📚 AI 能力边界与系统建设 #AI架构 #验收清单 #方法论 #上线

从 POC 到生产:AI 项目的边界验收清单

AI 项目放生产的最后一道关:把前九章的承诺、度量、幻觉、降级、组织全部收成一张验收清单。逐条过线才能上线。

✍️ diunilaomei 📅 2026-09-02 📝 约 993 字 ⏱️ 约 2 分钟
📑 章节目录
字号

《AI 能力边界与系统建设》最后一章。前面九章分别是边界的一块拼图,这一章把它们拼成一张上线验收清单——AI 项目能不能放生产,不是看 demo 多惊艳,是看这张清单能不能逐条打勾。

立项阶段用AI 项目 POC 评估清单判断「值不值得做」;本文的清单判断「能不能上线」——一张管决策,一张管交付。

一、边界与承诺(第 1、2 章)

  • 功能已做能力分层,知道它在哪一层
  • 能力声明表写清:承诺 / 不承诺 / 度量目标 / 验证方式
  • 不承诺栏覆盖「最坏投诉场景」反推
  • 责任链条末端有人(AI 不背的锅有人背)

二、任务与分流(第 3 章)

  • 能走规则的任务没被 AI 抢走(成本与稳定性)
  • 错不起的任务(钱/合规/安全)没有交给 AI 做主
  • 运行时二次分流存在:规则优先 → 模型不确定转人 → 失败降级

三、效果度量(第 4 章)

  • 真实评测集 ≥100 条、按难度分级、来源是真实日志
  • 四类指标定义口径:成功率 / 拒绝率 / 错误模式 / 成本
  • 基线已跑,承诺目标可验证
  • 有评测责任人,报告周期已定

四、幻觉治理(第 5 章)

  • 检索打底(混合检索/重排/切分质量)
  • 强制引用,无引用不出答案
  • 结构化输出 + 代码校验器(不是用模型拦模型)
  • 高风险回答带人工确认标记,案例回流评测集

五、链路追踪(第 6 章)

  • request_id 贯穿,检索/工具/模型各成 span
  • 输入输出脱敏后落库,可回放定位
  • 回放台能还原「当时它做了什么」

六、降级与人工接管(第 7 章)

  • 降级链 L0–L3 定义完,触发条件写死
  • 转人工通道带上下文、有 SLA 和值班 owner
  • 降级告警 + 演练过至少一次(没演练过 = 没有)

七、安全与合规

  • 对照LLM 应用安全清单:注入/越权/数据外泄测试跑过
  • 数据出境与隐私合规(出海场景照出海清单
  • 未成年人/内容合规(陪伴等场景特别注意)

八、升级与组织(第 8、9 章)

  • 变更走「回归 → 灰度 → 锁定」,有回滚能力
  • 三个角色认领:产品边界人 / 评测责任人 / 稳定性 owner
  • AI 事故纳入既有复盘机制,加「边界为什么没拦住」三问

放生产的最后一问

清单全绿后,再问一次负责人三个问题,答得上来才真正放行:

  1. 它承诺了什么?(能一句话说清,而不是「效果挺好的」)
  2. 它不承诺什么?(知道边界在哪,才知道风险在哪)
  3. 它失效时会发生什么?(降级到哪、谁接管、用户怎么感知)

这三问其实贯穿了整个系列:边界清晰、效果可测、失效可控——做到这三点,AI 就从「玩具」变成了「系统的一部分」。

系列回顾(10 章地图)

  1. 能力边界总纲 → 2. 能力声明表 → 3. 任务分流 → 4. 效果度量 → 5. 幻觉治理 → 6. 全链路追踪 → 7. 降级与人工接管 → 8. 升级回归 → 9. 组织与流程 → 10. 本文

相关阅读

栏目全部 →