AI 问答库

扫描件、复杂表格这类文档,知识库能处理吗?

一句话回答

能处理,但必须按文档类型分开做,不能指望全丢进去就有效果。扫描件要先过 OCR,版式复杂的还要做版面分析才能还原正确的阅读顺序;合并单元格、多级表头的表格如果按普通文本切分,几乎必错,要单独抽成结构化数据再入库。真正的成本在预处理管线和人工抽检,不在模型本身 —— 原件质量差时,先治理文档比换模型划算得多。

关键要点

  • 01先分类再处理。电子版 PDF、清晰扫描件、低质扫描件、复杂表格、图纸,五类文档的处理路径完全不同,用一套流程通吃必然有一类被牺牲。
  • 02表格是错误最集中的地方。合并单元格、多级表头、跨页续表在纯文本化之后会丢掉行列对应关系,模型看到的是一串错位的数字。
  • 03阅读顺序比字符识别更容易出问题。双栏排版、页眉页脚、侧边批注如果不做版面分析,OCR 出来的文本顺序是乱的,切分后语义完全断裂。
  • 04解析结果必须抽检,而且要业务方来抽。工程师看不出「这个数字对应的是哪个季度」,但业务同事一眼能发现。
  • 05有些文档不值得解析。低质传真件、大量手写、印章遮挡关键字段的材料,人工录入关键字段往往比反复调管线更省。

按文档类型给出可行做法

下表按「企业知识库入库」这一用途整理,难度一栏是相对判断而非绝对指标 —— 同样是扫描件,300 dpi 的合同扫描和手机拍歪的翻拍件差别极大。实践中的顺序应该是:先统计你的文档里各类型占比,把占比最高的那一两类做扎实,而不是一开始就追求全覆盖。

文档类型主要难点可行做法落地难度
电子版 PDF / Word / 网页基本没有识别问题,主要是切分粒度按标题层级切分,保留章节路径作为元数据低,成熟工具即可
清晰扫描件(300 dpi 以上、印刷体)字符识别可靠,但阅读顺序需要还原OCR + 版面分析,双栏与页眉页脚单独处理中,需要抽检校正
低质扫描件(手写、印章遮挡、倾斜翻拍)识别错误率高且不稳定,错在哪不可预测只抽取关键字段并强制人工复核,不做全文入库高,常常人工录入更划算
复杂表格(合并单元格、多级表头、跨页)文本化后行列对应关系丢失,数字全部错位单独走表格识别,转成结构化数据入库,问答时走查询而非检索高,且必须逐表验收
图纸、流程图、示意图语义在图形关系里,文本化会丢掉大部分信息用多模态模型生成结构化描述并入库,原图保留供人查阅高,准确性依赖人工确认

表格为什么最容易出错

普通文本切分默认「相邻的字属于同一句话」,而表格的语义是二维的 —— 一个数字的含义由它所在的行标签和列标签共同决定。一旦拉平成一行行文本,这层对应关系就没了,模型看到的是一堆孤立数字,它会按最近的词猜标签,于是「2025 年第三季度华东区销量」被答成了华南区的数字,而且答得很有信心。跨页续表更麻烦:第二页往往没有表头,拉平之后完全无法判断这些数字属于哪一列。可行的做法是把表格单独抽出来,转成结构化数据(比如数据库表或带完整表头的 JSON),问答时不走向量检索而走结构化查询;或者退一步,为每个表格生成一段带完整上下文的自然语言摘要再入库,牺牲精度换取覆盖。

上线前必须做的一轮抽检

解析管线跑完之后,随机抽一批文档,把「原件」和「解析结果」并排放给业务同事看,让他们标出哪里错了。这一步经常被跳过,因为看起来很土,但它是唯一能发现系统性错误的办法 —— 比如所有带印章的合同金额都少识别了一位、所有跨页表格的第二页都归错了表。抽检要按文档类型分层,每类至少几十份,而不是从全量里随机抽(否则占比小但重要的类型永远抽不到)。发现的错误要分类:是识别错、顺序错,还是切分错?三类的修法完全不同。最后把这批标注过的文档固化成回归集,之后每次调整管线都重跑一遍,否则你不知道这次改动修好了一个问题还是同时弄坏了两个。

适用边界

什么情况下本答案不成立

  • 本文不给具体识别准确率数字。同一套管线在 300 dpi 印刷体合同和手机翻拍的手写单据上表现差一个量级,任何脱离样本的百分比都没有参考价值 —— 应该用你自己的文档做抽样测试。
  • 涉及金额、剂量、参数等关键字段的文档,无论解析质量多好都应保留人工复核环节。解析错误在这类场景下的代价远高于多花的人力。
  • 如果文档本身存在多个冲突版本、大量过期内容或没有权限边界,解析做得再好也答不对。这是内容治理问题,不是技术问题。
  • 扫描件与影像资料常含个人信息或商业秘密,解析链路(尤其是调用外部服务的环节)必须一并做数据出域评估。

同义问法

  • 扫描版 PDF 能做知识库吗
  • 合并单元格的表格怎么进知识库
  • 知识库支持哪些文档格式
  • PDF 里的表格识别不准怎么办
  • 手写和盖章的文件 AI 能读吗
撰写YGG 臻星科技解决方案团队发布2026-08-01最近复核2026-08-01