AI 评测体系:从准确率到用户满意度

“这个模型好像变聪明了"“感觉回答质量下降了”——感觉是 AI 工程最大的敌人。模型、Prompt、参数每次改动都要有数据说话。AI 评测体系分三层:离线(评测集)→ 在线(A/B)→ 业务(最终效果)。

一、评测为什么难

A I " "

AI 评测的本质:把"主观质量"变成"可量化指标”,把"概率性输出"变成"统计性结论"。

二、第一层:离线评测(回归防线)

评测集建设

1 0 0 - 5 0 0 /

指标设计

指标 怎么算 测什么
准确率 标准题答对比例 知识正确性
幻觉率 陷阱题出现编造的比例 事实性
格式合规率 输出结构符合要求的比例 工程可控性
拒答准确率 该拒答的答拒(不该答的没乱答) 边界意识
LLM 评分 强模型按维度打分(相关性/完整性) 开放质量

每次改动必跑

P R r A o G m p t 线 线 线

离线评测是"回归测试"——它不能告诉你"变好了多少",但能告诉你"有没有变坏"。

三、第二层:在线评测(A/B 实验)

离线评测的盲区:评测集是造出来的,线上问题才是真的

1 0 % v s 线 9 0 % /

埋点设计

退 /

经典指标组合:点赞率(正反馈)+ 追问率(负反馈)+ 任务完成率(业务结果)。

四、第三层:业务指标(最终答案)

AI 的优化最终要落到业务:

A A I I / A A I A I I %

业务指标是 CEO 关心的,离线指标是工程师关心的——两层要能对得上:离线准确率提升 5% → 线上任务完成率提升几个点 → 业务指标变化多少。对不上,说明评测集和真实场景脱节了。

五、评估的评估:LLM-as-Judge

用强模型评弱模型是 2024 年后的主流做法,但有坑:

2 - 3 5 % 1 0 0 0 . 8 +

六、落地路线图

1 2 3 4 5 线 A B 1 0 + 0 线 A I / / C I / / /

七、踩坑记录

  1. 评测集被污染:拿线上问题当评测集,改版就是为了刷它 → 评测集固定版本,定期人工重审
  2. 只看准确率:准确率涨了,格式乱了(幻觉率没看)→ 多指标一起看,别单指标优化
  3. A/B 样本不足:1% 流量跑 1 小时就下结论 → 最小样本量估算(差异小需要更多样本)
  4. 离线在线脱节:离线涨、线上没变 → 检查评测集是否代表真实分布(线上问题采样入集)

总结

AI 评测体系的核心认知:

  1. 三层闭环:离线(回归防线)→ 在线(A/B 验证)→ 业务(最终价值)
  2. 评测集是基础设施:标准/开放/陷阱/边界四类,固定版本
  3. 多指标看齐:准确率 + 幻觉率 + 格式 + 业务指标,别单指标优化
  4. LLM 评分是杠杆:规模化评估,但要用人工校准

没有评测的 AI 优化是赌博。 有了三层体系,每次"感觉变好了"都能变成"数据证实了"。