AI 问答库
一句话回答
诚实的回答是:脱离评测集谈准确率没有意义。「准确率」至少要拆成检索召回率、答案正确率、幻觉率、拒答率四个指标,口径各不相同;同一套系统在制度条文查找上表现很好,在跨文档汇总或需要计算的问题上会明显下降。任何供应商给出一个不说明评测集、问题类型和评分方式的百分比,都应该先要求他说明口径,再谈验收。
下面四个指标测的是完全不同的东西,任何一个单独达标都不能说明系统可用。实践中最常见的错误是只看最终答案对错:检索没召回到正确段落,工程师却一直去调提示词,问题永远修不好。
| 指标 | 它回答的问题 | 怎么测 | 常见误区 |
|---|---|---|---|
| 检索召回率 Recall@k | 正确答案所在的原文段落,有没有被召回进上下文 | 为每题人工标注「金标段落」,统计 top-k 命中率 | 只看最终答案对错,检索早就丢了却一直在调提示词 |
| 答案正确率 | 生成出来的答案在事实上对不对 | 人工或强模型对照标准答案分三档打分:对 / 部分对 / 错 | 用文本相似度自动打分,把「说得像」当成「说得对」 |
| 幻觉率 / 可溯源率 | 答案里有没有引用原文不支持的内容 | 逐句核对是否能在被引片段中找到直接依据 | 只要附了引用就当作没幻觉,从不核对引用是否真的支撑那句话 |
| 拒答率与误拒率 | 该说「知识库里没有」的时候有没有说出来 | 在评测集里混入知识库中根本不存在答案的问题,看是否被硬答 | 把所有拒答一律记为失败,逼系统必须给答案,反而拉高幻觉率 |
第一位是语料本身有问题:同一制度存在三个版本且没标时效、关键内容躺在扫描件图片里没做 OCR、内部黑话没有术语表。第二位是切分与检索策略不匹配:表格被从中间切断、长文档丢失章节上下文、只用向量检索导致精确名词(型号、编号、条款号)召不回。第三位是问题超出了检索范式:需要跨十几份文档汇总、需要做加减计算、需要判断「最新的那一版」,这类问题靠加大 top-k 是解决不了的。第四位是权限与时效:答了对方无权看到的内容,或答了已废止的旧版本。模型能力排在最后 —— 在大多数企业场景里,它不是主要瓶颈。
一、先治语料:去重、给每份文档定版本与生效时效、把扫描件补 OCR、建术语表。这一步通常带来最大提升,而且成本最低。二、改检索:混合检索(关键词 + 向量)加重排模型,按文档结构而不是固定字数切分,把标题层级带进片段。三、加约束:强制引用来源、答案不能超出引用范围、检索置信度低于阈值时直接拒答并转人工。四、最后才是换更大的模型或做微调 —— 在语料没治好之前做这一步,投入产出比最差。整个过程要有评测集在旁边,每改一步跑一遍,否则你不知道是变好了还是变差了。
适用边界
同义问法