AI 评测体系:从准确率到用户满意度#
“这个模型好像变聪明了"“感觉回答质量下降了”——感觉是 AI 工程最大的敌人。模型、Prompt、参数每次改动都要有数据说话。AI 评测体系分三层:离线(评测集)→ 在线(A/B)→ 业务(最终效果)。
一、评测为什么难#
AI 评测的本质:把"主观质量"变成"可量化指标”,把"概率性输出"变成"统计性结论"。
二、第一层:离线评测(回归防线)#
评测集建设#
指标设计#
| 指标 |
怎么算 |
测什么 |
| 准确率 |
标准题答对比例 |
知识正确性 |
| 幻觉率 |
陷阱题出现编造的比例 |
事实性 |
| 格式合规率 |
输出结构符合要求的比例 |
工程可控性 |
| 拒答准确率 |
该拒答的答拒(不该答的没乱答) |
边界意识 |
| LLM 评分 |
强模型按维度打分(相关性/完整性) |
开放质量 |
每次改动必跑#
离线评测是"回归测试"——它不能告诉你"变好了多少",但能告诉你"有没有变坏"。
三、第二层:在线评测(A/B 实验)#
离线评测的盲区:评测集是造出来的,线上问题才是真的。
埋点设计#
经典指标组合:点赞率(正反馈)+ 追问率(负反馈)+ 任务完成率(业务结果)。
四、第三层:业务指标(最终答案)#
AI 的优化最终要落到业务:
业务指标是 CEO 关心的,离线指标是工程师关心的——两层要能对得上:离线准确率提升 5% → 线上任务完成率提升几个点 → 业务指标变化多少。对不上,说明评测集和真实场景脱节了。
五、评估的评估:LLM-as-Judge#
用强模型评弱模型是 2024 年后的主流做法,但有坑:
六、落地路线图#
七、踩坑记录#
- 评测集被污染:拿线上问题当评测集,改版就是为了刷它 → 评测集固定版本,定期人工重审
- 只看准确率:准确率涨了,格式乱了(幻觉率没看)→ 多指标一起看,别单指标优化
- A/B 样本不足:1% 流量跑 1 小时就下结论 → 最小样本量估算(差异小需要更多样本)
- 离线在线脱节:离线涨、线上没变 → 检查评测集是否代表真实分布(线上问题采样入集)
AI 评测体系的核心认知:
- 三层闭环:离线(回归防线)→ 在线(A/B 验证)→ 业务(最终价值)
- 评测集是基础设施:标准/开放/陷阱/边界四类,固定版本
- 多指标看齐:准确率 + 幻觉率 + 格式 + 业务指标,别单指标优化
- LLM 评分是杠杆:规模化评估,但要用人工校准
没有评测的 AI 优化是赌博。 有了三层体系,每次"感觉变好了"都能变成"数据证实了"。
微信公众号「福清而不淡」
后端架构 · AI 工程 · 云原生的一线实践,扫码关注,不错过更新。
本文已同步发布到公众号,欢迎留言交流。