同一套测试每次都满分,业务部门却越来越不满意

企业助手上线前准备了一百道题,经过几轮优化,准确率稳定。半年后产品增加新套餐,服务边界改变,客户开始用新的说法提问。技术团队仍用原来的一百道题验收,分数没有下降,客服却不断遇到答不上来的真实问题。

评测集不是一次性交付物。它代表某个时间点的业务。产品变化、政策更新、渠道变化和用户习惯改变,都会让旧样本逐渐失真。系统可能越来越擅长通过考试,却离现场工作越来越远。

一套可长期使用的评测集,应由三部分组成

第一部分是核心回归样本,覆盖公司主体、产品服务、权限边界和高风险问题,长期保留;第二部分是近期真实问题,来自客服、销售、内部搜索和人工转交;第三部分是反例与异常问题,专门测试拒答、转人工和错误前提。

三部分比例可以按场景调整,但不能只保留容易量化的标准问答。真实用户会省略背景、写错名称、连续追问,也会把两个问题混在一起。评测样本要保留这种不整齐,不能全部修成模型最容易理解的格式。

  • 核心事实和风险边界长期回归。
  • 每月从真实使用中补充代表性问题。
  • 保留错误前提、模糊表达和连续追问。

新样本不能只挑失败案例,也要防止被个别投诉带偏

一次严重误答值得加入测试,但不能每来一个投诉就增加一条特殊规则。先判断问题是否高频、是否代表重要风险、是否已有同类样本,再决定加入核心集还是观察集。否则评测会越来越臃肿,系统为了少数边缘情况牺牲常见任务。

样本要保留来源、日期、适用版本和期望答案依据。业务规则变更后,更新期望答案,而不是简单删除所有旧题。需要测试历史订单时,可以保留旧规则样本并注明适用时间。

分数变化要能解释,不能只追求一个总准确率

按问题类型看引用正确、事实准确、边界遵守、任务完成和人工修改。总分上升可能只是新增了大量简单题,高风险问题反而退化。对于关键场景,宁可单独设置必须通过的底线,也不要让它被平均分掩盖。

人工评分也要校准。让两名业务人员独立评同一批样本,分歧大的地方说明标准本身不清楚。先统一业务判断,再要求 AI 稳定输出,否则团队会把内部意见不一致误认为模型问题。

评测集需要负责人,也需要固定的新陈代谢

每月或每次重大业务变更后,场景负责人审查新增问题、失效样本和评分标准。核心集保持稳定,近期集滚动更新,异常集根据风险长期保留。变更记录说明为什么增删,避免为了提升分数悄悄移走难题。

企业 AI 的质量不是上线那天测出来的,而是在业务变化中持续守住的。让评测跟着真实问题更新,团队才能早于投诉发现退化,也能知道下一次优化到底解决了什么。

本文根据一路凯歌在企业 AI 测试、业务样本整理和上线后复盘中的经验整理,重点讨论评测集如何跟上真实业务变化。

要点总结

  • 稳定场景可按月审查,产品、政策或流程发生重大变化时应立即补充和复测。
  • 核心事实和风险样本应保留,失效业务样本可归档并注明适用版本,不必全部参加当前评分。
  • 需要脱敏、去除无关个人信息,并由业务人员确认预期答案和适用范围。

参考来源说明

本文围绕“测试集一直没变,业务早就变了:企业 AI 评测样本也会过期”展开,结合 5 份公开资料及一路凯歌在“企业 AI 服务”方向的执行经验整理,重点看它对官网可引用结构、FAQ 设计和后续获客复盘的影响。

上一篇:AI 会写会议纪要,却没人推进任务:从摘要到责任人还差一段流程 下一篇:两个制度文件给出不同答案,AI 该听谁的?先建立规则优先级