评测集怎么建:没有它就只能凭感觉调

改了提示词感觉变好了,是最不可靠的判断。本文说明评测集该收集什么样的题、多少条够用、以及怎么处理没有标准答案的题。

要点速览
  • 凭感觉判断改动好坏不可靠,准确率掉一成通常察觉不到。
  • 题目应来自真实提问,自己编题会不自觉避开系统不擅长的表述。
  • 必须包含材料里没有答案的边界题,用来检验系统会不会硬答。
  • 几十条可发现明显回归,两三百条可给出稳定估计,过大反而会荒废。
  • 关注的不是绝对分数,而是与上次相比哪些题变差了。

AI 项目调优最常见的工作方式是:改一处、试几个问题、觉得变好了、提交。问题在于「试几个问题」每次试的不是同一批,而主观印象对变化的敏感度很低 —— 准确率从七成掉到六成,凭感觉基本察觉不到。

题目从哪里来

最好的来源是真实发生过的提问:客服记录、搜索日志、试用期间用户实际输入的内容。自己编的题目有一个系统性偏差 —— 编题的人知道系统能做什么,会不自觉地避开它不擅长的表述。

分布也要接近真实。如果线上八成是简单的常见问题、两成是复杂的,评测集也应当大致如此。全部用难题组成的评测集会让人低估系统的实际表现,反过来也一样。

必须包含的几类

  • 正常问题:覆盖主要业务场景,这是主体;
  • 边界问题:材料里没有答案的、信息不完整的、超出服务范围的。这类题检验的是系统会不会硬答;
  • 表述变体:同一个意思的不同问法、口语化表达、有错别字的输入;
  • 已经出过错的真实案例:每修复一个线上问题就把它加进来,形成回归保护。

多少条够用

几十条就能发现明显的回归,两三百条能给出比较稳定的准确率估计。规模不是越大越好 —— 评测集需要维护,每次业务变化都要复核期望答案,太大反而会荒废。从三五十条开始,随着发现问题逐步补充,是比较实际的路径。

没有标准答案的题怎么评

很多问题的答案不唯一,不能用逐字匹配。可行的做法是检查几个要点是否出现:必须提到的关键信息有没有、不应出现的内容有没有出现、格式是否符合要求。把这些要点写成清单,评判就从主观变成了可重复的核对。

用另一个模型来评分也是常见做法,但要清楚它本身也会出错,适合做初筛,不适合作为唯一依据。关键的那部分题仍然需要人工确认。

怎么用

每次改动提示词、换模型、调整检索参数之后,全量跑一遍并记录结果。重点不是绝对分数,而是和上一次比哪些题变好了、哪些变差了。变差的那几题往往比整体分数更有信息量。相关的验收口径见企业知识库解决方案与合作流程。

常见问题

AI 评测集需要多少条题目?

从三五十条起步即可发现明显回归,两三百条能给出较稳定的准确率估计。规模不宜过大,因为每次业务变化都要复核期望答案,维护不动的评测集很快会被弃用。随着线上问题的发现逐步补充更实际。

答案不唯一的问题怎么评分?

不要逐字匹配,改为检查要点:必须提到的关键信息是否出现、不应出现的内容是否出现、格式是否符合要求。把要点写成清单后,评判就从主观印象变成可重复的核对。用另一个模型初筛可行,但关键题目仍需人工确认。

评测集里要不要放答不上来的问题?

必须放。这类题检验的是系统在材料不足时会不会硬答,而硬答正是企业场景中代价最高的错误类型。期望输出应当是明确的「资料中没有相关说明」加上转人工提示,而不是任何形式的推测。

参考资料

  1. AI Risk Management Framework · NIST
  2. Transformers Documentation · Hugging Face
# 评测# 测试集# AI 质量# 项目管理
免费咨询

聊聊你的项目

留下联系方式,我们一个工作日内联系你。先沟通需求和现状,再给方案;报价当面沟通。

  • 一个工作日内回复
  • 需求沟通免费,不强推方案
  • 交付管理后台与文档,可自行维护
仅用于本次咨询联系,不会用于其他用途。