前几章反复提到「承诺要基于评测数据」,这一章把度量这件事讲透。AI 功能上线后最常被问的三个问题——「它到底行不行」「改了以后是变好还是变坏」「用户投诉说它错了,是偶发还是常态」——没有评测体系,一个都答不了。答不了,边界就是口号。
度量的三个组成部分
1. 评测集(地基):攒你自己的「真实问题集」
- 从线上日志/客服记录里攒 100–200 条真实问题(别用 AI 编的 demo 问题),覆盖:常见问题、边界问题(模糊问法)、易错问题(每类业务各留几条)。
- 按难度分级打标(简单/中等/困难),跑分时分开看——「简单全对、困难全错」和「全都 60 分」是完全不同的两个系统。
- 评测集要持续补充:每季度把新出现的投诉问题加进去——评测集不更新,指标再好看也是考古。
2. 指标(四类,缺一不可)
| 指标 | 回答什么 | 怎么测 |
|---|---|---|
| 成功率 | 任务做成了吗 | 人工标注/规则校验(如答案可引用则算通过) |
| 拒绝率 | 该说不知道的说了吗 | 不该答时转人工/明说的比例 |
| 错误模式 | 错在哪类问题 | 按问题类型统计错误分布 |
| 成本与延迟 | 代价多大 | token、P95、缓存命中(可观测) |
特别注意拒绝率:对不确定的问题,好的系统宁可拒绝也不硬答。评测时「拒绝得对不对」要单独标——拒绝率不是越低越好,是「该拒的拒了、不该拒的没拒」。
3. 基线(没有基线,一切对比都无意义)
- 上线前先跑一遍评测集,记录基线分数。
- 之后任何变更(换模型、改提示词、动检索)都重跑同一套评测集,和基线比——涨了才算改进,跌了就是回归(第 8 章的机制)。
两种评测方式:离线与在线
- 离线评测(发布前用):固定评测集 + 固定评判标准。评判可以用人抽检,也可以用更强的模型当裁判(judge),但裁判模型的判断要定期和人对齐,否则会「评错还自信」。
- 在线度量(上线后用):真实流量的代理指标:用户反馈率、转人工率、投诉率、功能留存。在线和离线要能对上——离线高分、在线翻车,说明评测集失真了,先修评测集。
谁来度量:度量要有「负责人」,不是「有空测测」
- 中高风险功能指定评测责任人:每个发布周期跑评测、出报告、拦回归。
- 报告要简短可读:一张表(成功率/拒绝率/成本/与上期对比)+ 一段结论(这期变好/变坏在哪类问题上)。
- 度量结果回到能力声明表:没到承诺线 = 功能不算完成。
落地清单
- 从真实日志攒 100+ 条分级评测集,季度补充
- 四类指标(成功/拒绝/错误模式/成本)全部定义口径
- 上线前跑基线,之后每次变更回归对比
- 指定评测责任人,报告一页纸
- 指标对不上承诺线,功能不上线