AI 问答库

做 AI 项目之前,数据要准备成什么样?

一句话回答

最低要求是三件事:找得到、读得出、说得清归属。找得到指文档有统一存放位置和检索入口;读得出指不是扫描图片或加密文件,能稳定提取成文本;说得清归属指每份文档有版本、生效日期和可见范围。这三条做不到,换任何模型都答不准。但不需要先建数据中台 —— 把第一个场景涉及的那部分语料治理干净,就足够启动。

关键要点

  • 01语料质量决定准确率上限,模型只决定你离上限有多远。过期文档、多个冲突版本、扫描件图片,这三样能让任何模型的表现降到不可用。
  • 02「读得出」是硬门槛:扫描件必须先做 OCR、加密或受保护的文件要先解除限制、复杂表格与图表需要单独的解析策略,否则这些内容对系统等于不存在。
  • 03每份文档都要能回答三个问题:这是第几版、什么时候开始生效、谁可以看。缺了版本和时效,系统会理直气壮地引用已废止的旧制度;缺了可见范围,权限隔离无从做起。
  • 04数量远不如覆盖度重要。300 份覆盖了高频问题的准确文档,效果好过 3 万份混杂着草稿、旧版本和无关材料的文件堆。
  • 05内部黑话必须建术语表。同一个东西在不同部门叫不同名字、缩写在不同语境下含义不同 —— 这类问题检索层解决不了,只能靠术语表和同义词映射补。
  • 06不要为了「先把数据做好」而无限延后项目。正确顺序是选定第一个场景、只治理这个场景需要的语料、跑通、再按同样标准扩展。

按数据类型看要准备到什么程度

下表按企业里常见的几类数据拆开,给出「达到什么状态算可用」的判定标准和责任归属。判定标准写得尽量具体,是为了让它能直接当作立项前的检查清单 —— 每一行都能用一次抽样验证:随机抽 20 份,看有多少条满足。责任归属那一列同样重要:数据治理的活儿绝大部分落在业务方而不是技术方,技术团队既没有权限也没有判断力去决定哪一版制度是现行有效的。这一点如果在立项时不说清楚,项目会在中期卡住。

数据类型常见问题达到什么状态算可用谁来做
制度、流程、规章文档同一制度多个版本并存、没标生效日期、废止的还在流传每份有唯一现行版本 + 生效日期 + 废止标记,旧版归档不进检索制度归口部门,技术方无权判定哪版有效
产品资料、技术手册大量扫描件与图片版 PDF、表格结构复杂、型号参数散落在图里能稳定提取成文本,表格结构保留,关键参数可检索技术方做 OCR 与解析,业务方抽检结果对不对
历史工单、客服会话含大量个人信息、答案质量参差、有错误处置也被记进去完成脱敏,且只保留经人工确认为正确处置的样本业务方筛选正确样本,法务确认脱敏口径
业务系统结构化数据没有可调用接口、字段含义无人说得清、数据不实时有稳定接口或视图 + 字段说明文档 + 明确的时效口径系统负责人提供接口,业务方出字段口径说明
内部术语与缩写同物异名、同名异物、缩写在不同部门含义不同有一份术语表,含同义词映射与歧义词的消歧规则业务方牵头整理,随使用反馈持续补充
权限与可见范围文档没有可见范围标注,全员共享盘里什么都有每份文档标注可见部门/角色,且与检索层过滤条件对齐业务方定边界,技术方在检索层落实

一份可以直接照着做的启动检查清单

在立项评审时逐条过一遍,任何一条答不上来都是风险信号。一、第一个场景涉及哪些文档?能不能列出一个具体清单,而不是「共享盘里那些」。二、随机抽 20 份,有几份能直接提取出文本?低于 15 份就要先安排 OCR 与格式治理。三、这批文档里有没有同一主题的多个版本?如果有,谁能拍板哪一版现行有效。四、有没有个人信息或敏感数据?脱敏口径由谁确认。五、业务同事能不能写出 50–100 条真实问过的问题和标准答案?写不出来通常说明场景还没想清楚。六、这些问题的答案,是不是都能在第一条列出的文档里找到?找不到的部分要么补文档,要么把这类问题移出一期范围。七、每份文档谁可以看?八、这批数据多久更新一次,更新之后系统怎么知道。八条走完,技术方案的大部分不确定性就消掉了。

常被误解的两件事

第一,「必须先建数据中台」是个昂贵的误解。数据中台解决的是全公司数据的统一供给问题,周期长、投入大,而一个 AI 场景通常只需要其中很小的一块。正确顺序是先跑通一个场景、用真实使用暴露出数据缺口、再按需扩展治理范围 —— 反过来做,很可能中台建了两年而 AI 一个场景都没上线。第二,「数据越多越好」同样不成立。把所有历史文件一股脑倒进知识库,只会让检索被大量草稿、旧版本和无关材料淹没,准确率反而下降。更有效的做法是宁少勿滥:只放经过确认的现行有效文档,用得上再加。这两点在项目早期最容易被推翻,因为「先把基础打好」听起来永远比「先跑通一个小场景」更稳妥,但实践中前者的失败率更高。

适用边界

什么情况下本答案不成立

  • 本文按 RAG 知识库类项目写。若要做监督微调或训练,对数据的要求完全不同 —— 需要的是成对的输入输出样本与标注一致性,而不是文档可检索性。
  • 「多少数据算够」没有通用答案,取决于问题覆盖度而非条数。判定方式是拿评测集去试:真实问题的答案能在语料里找到,就够;找不到,再多无关文档也没用。
  • 涉及个人信息的语料在入库前应完成合规评估。脱敏口径、保留期限与删除能力属于法务议题,不应由技术团队单方面决定。
  • 数据治理不是一次性工作。文档会持续更新、废止、新增,如果没有把「更新后如何同步进知识库」设计成常态流程,系统的准确率会随时间自然衰减。

同义问法

  • 企业知识库的数据怎么准备?
  • AI 项目对数据质量有什么要求?
  • 扫描件 PDF 能直接做知识库吗?
  • 做 AI 之前必须先建数据中台吗?
  • 数据要多少条才够做 AI?
撰写YGG 臻星科技解决方案团队发布2026-08-01最近复核2026-08-01