📚 AI 能力边界与系统建设 #AI架构 #效果度量 #评测 #方法论

效果度量:证明「做了什么、有什么效果」

没有度量的 AI 功能,边界就是口号。讲评测集怎么建、四类指标怎么定、基线怎么设——把「做了什么」变成数据。

✍️ diunilaomei 📅 2026-09-01 📝 约 1020 字 ⏱️ 约 3 分钟
📑 章节目录
字号

前几章反复提到「承诺要基于评测数据」,这一章把度量这件事讲透。AI 功能上线后最常被问的三个问题——「它到底行不行」「改了以后是变好还是变坏」「用户投诉说它错了,是偶发还是常态」——没有评测体系,一个都答不了。答不了,边界就是口号。

度量的三个组成部分

1. 评测集(地基):攒你自己的「真实问题集」

  • 从线上日志/客服记录里攒 100–200 条真实问题(别用 AI 编的 demo 问题),覆盖:常见问题、边界问题(模糊问法)、易错问题(每类业务各留几条)。
  • 按难度分级打标(简单/中等/困难),跑分时分开看——「简单全对、困难全错」和「全都 60 分」是完全不同的两个系统。
  • 评测集要持续补充:每季度把新出现的投诉问题加进去——评测集不更新,指标再好看也是考古。

2. 指标(四类,缺一不可)

指标回答什么怎么测
成功率任务做成了吗人工标注/规则校验(如答案可引用则算通过)
拒绝率该说不知道的说了吗不该答时转人工/明说的比例
错误模式错在哪类问题按问题类型统计错误分布
成本与延迟代价多大token、P95、缓存命中(可观测

特别注意拒绝率:对不确定的问题,好的系统宁可拒绝也不硬答。评测时「拒绝得对不对」要单独标——拒绝率不是越低越好,是「该拒的拒了、不该拒的没拒」。

3. 基线(没有基线,一切对比都无意义)

  • 上线前先跑一遍评测集,记录基线分数。
  • 之后任何变更(换模型、改提示词、动检索)都重跑同一套评测集,和基线比——涨了才算改进,跌了就是回归(第 8 章的机制)。

两种评测方式:离线与在线

  • 离线评测(发布前用):固定评测集 + 固定评判标准。评判可以用人抽检,也可以用更强的模型当裁判(judge),但裁判模型的判断要定期和人对齐,否则会「评错还自信」。
  • 在线度量(上线后用):真实流量的代理指标:用户反馈率、转人工率、投诉率、功能留存。在线和离线要能对上——离线高分、在线翻车,说明评测集失真了,先修评测集。

谁来度量:度量要有「负责人」,不是「有空测测」

  • 中高风险功能指定评测责任人:每个发布周期跑评测、出报告、拦回归。
  • 报告要简短可读:一张表(成功率/拒绝率/成本/与上期对比)+ 一段结论(这期变好/变坏在哪类问题上)。
  • 度量结果回到能力声明表:没到承诺线 = 功能不算完成。

落地清单

  • 从真实日志攒 100+ 条分级评测集,季度补充
  • 四类指标(成功/拒绝/错误模式/成本)全部定义口径
  • 上线前跑基线,之后每次变更回归对比
  • 指定评测责任人,报告一页纸
  • 指标对不上承诺线,功能不上线

相关:能力声明表幻觉的系统化治理大模型应用可观测性

相关阅读

栏目全部 →