AI 问答库

企业 RAG 知识库的准确率能做到多少?

一句话回答

诚实的回答是:脱离评测集谈准确率没有意义。「准确率」至少要拆成检索召回率、答案正确率、幻觉率、拒答率四个指标,口径各不相同;同一套系统在制度条文查找上表现很好,在跨文档汇总或需要计算的问题上会明显下降。任何供应商给出一个不说明评测集、问题类型和评分方式的百分比,都应该先要求他说明口径,再谈验收。

关键要点

  • 01「准确率」是复合概念,至少拆四个指标:检索召回率(Recall@k)、答案正确率、幻觉率(可溯源率)、拒答与误拒率。合成一个数字会掩盖问题出在哪一环。
  • 02决定上限的是语料质量,不是模型。过期文档、多个冲突版本、只有扫描图的 PDF、没有权限边界的混合语料 —— 这些情况下换任何模型都答不对。
  • 03问题类型决定难度,差距很大:单文档事实查找最容易,多文档汇总次之,需要计算、时序判断或推理的问题最难。评测集必须按类型分层,不能混在一起算总分。
  • 04评测集是甲方资产,不是乙方交付物。应由业务方出 100–300 条真实问题加标准答案,验收以此为准 —— 供应商自带的榜单分数不构成验收依据。
  • 05「宁可拒答」通常比「猜一个」更有价值。在医疗、法务、制度合规场景下,应把拒答率当作正向指标而不是缺陷 —— 逼系统硬答只会把错误率转成幻觉率。

先把「准确率」拆开

下面四个指标测的是完全不同的东西,任何一个单独达标都不能说明系统可用。实践中最常见的错误是只看最终答案对错:检索没召回到正确段落,工程师却一直去调提示词,问题永远修不好。

指标它回答的问题怎么测常见误区
检索召回率 Recall@k正确答案所在的原文段落,有没有被召回进上下文为每题人工标注「金标段落」,统计 top-k 命中率只看最终答案对错,检索早就丢了却一直在调提示词
答案正确率生成出来的答案在事实上对不对人工或强模型对照标准答案分三档打分:对 / 部分对 / 错用文本相似度自动打分,把「说得像」当成「说得对」
幻觉率 / 可溯源率答案里有没有引用原文不支持的内容逐句核对是否能在被引片段中找到直接依据只要附了引用就当作没幻觉,从不核对引用是否真的支撑那句话
拒答率与误拒率该说「知识库里没有」的时候有没有说出来在评测集里混入知识库中根本不存在答案的问题,看是否被硬答把所有拒答一律记为失败,逼系统必须给答案,反而拉高幻觉率

答不准的原因,按出现频率排序

第一位是语料本身有问题:同一制度存在三个版本且没标时效、关键内容躺在扫描件图片里没做 OCR、内部黑话没有术语表。第二位是切分与检索策略不匹配:表格被从中间切断、长文档丢失章节上下文、只用向量检索导致精确名词(型号、编号、条款号)召不回。第三位是问题超出了检索范式:需要跨十几份文档汇总、需要做加减计算、需要判断「最新的那一版」,这类问题靠加大 top-k 是解决不了的。第四位是权限与时效:答了对方无权看到的内容,或答了已废止的旧版本。模型能力排在最后 —— 在大多数企业场景里,它不是主要瓶颈。

提升准确率的顺序(按性价比)

一、先治语料:去重、给每份文档定版本与生效时效、把扫描件补 OCR、建术语表。这一步通常带来最大提升,而且成本最低。二、改检索:混合检索(关键词 + 向量)加重排模型,按文档结构而不是固定字数切分,把标题层级带进片段。三、加约束:强制引用来源、答案不能超出引用范围、检索置信度低于阈值时直接拒答并转人工。四、最后才是换更大的模型或做微调 —— 在语料没治好之前做这一步,投入产出比最差。整个过程要有评测集在旁边,每改一步跑一遍,否则你不知道是变好了还是变差了。

适用边界

什么情况下本答案不成立

  • 本文刻意不给出具体百分比。脱离评测集、问题类型分布与评分口径的准确率数字既不可比也无法验收,写出来只会造成误导。
  • 公开 RAG 榜单多基于通用问答语料,与企业内部制度、工艺、病历类文档的分布差异很大,榜单分数不能外推到你的场景。
  • 准确率高不等于可以直接对外。面向客户或涉及医疗、法务、生产安全的场景仍需保留人工复核环节,这是流程设计问题而非模型指标问题。
  • 语料一旦更新,历史评测结论即失效。评测应随语料版本重跑,并把评测集本身纳入版本管理,否则半年后没人说得清当初那个数字是怎么来的。

同义问法

  • RAG 的准确率有多高?
  • 企业知识库问答能不能做到不出错?
  • RAG 的幻觉问题怎么解决?
  • 知识库问答的准确率怎么评测?
  • 供应商说 RAG 准确率 95%,可信吗?
撰写YGG 臻星科技解决方案团队发布2026-08-01最近复核2026-08-01