AI 问答库
一句话回答
能处理,但必须按文档类型分开做,不能指望全丢进去就有效果。扫描件要先过 OCR,版式复杂的还要做版面分析才能还原正确的阅读顺序;合并单元格、多级表头的表格如果按普通文本切分,几乎必错,要单独抽成结构化数据再入库。真正的成本在预处理管线和人工抽检,不在模型本身 —— 原件质量差时,先治理文档比换模型划算得多。
下表按「企业知识库入库」这一用途整理,难度一栏是相对判断而非绝对指标 —— 同样是扫描件,300 dpi 的合同扫描和手机拍歪的翻拍件差别极大。实践中的顺序应该是:先统计你的文档里各类型占比,把占比最高的那一两类做扎实,而不是一开始就追求全覆盖。
| 文档类型 | 主要难点 | 可行做法 | 落地难度 |
|---|---|---|---|
| 电子版 PDF / Word / 网页 | 基本没有识别问题,主要是切分粒度 | 按标题层级切分,保留章节路径作为元数据 | 低,成熟工具即可 |
| 清晰扫描件(300 dpi 以上、印刷体) | 字符识别可靠,但阅读顺序需要还原 | OCR + 版面分析,双栏与页眉页脚单独处理 | 中,需要抽检校正 |
| 低质扫描件(手写、印章遮挡、倾斜翻拍) | 识别错误率高且不稳定,错在哪不可预测 | 只抽取关键字段并强制人工复核,不做全文入库 | 高,常常人工录入更划算 |
| 复杂表格(合并单元格、多级表头、跨页) | 文本化后行列对应关系丢失,数字全部错位 | 单独走表格识别,转成结构化数据入库,问答时走查询而非检索 | 高,且必须逐表验收 |
| 图纸、流程图、示意图 | 语义在图形关系里,文本化会丢掉大部分信息 | 用多模态模型生成结构化描述并入库,原图保留供人查阅 | 高,准确性依赖人工确认 |
普通文本切分默认「相邻的字属于同一句话」,而表格的语义是二维的 —— 一个数字的含义由它所在的行标签和列标签共同决定。一旦拉平成一行行文本,这层对应关系就没了,模型看到的是一堆孤立数字,它会按最近的词猜标签,于是「2025 年第三季度华东区销量」被答成了华南区的数字,而且答得很有信心。跨页续表更麻烦:第二页往往没有表头,拉平之后完全无法判断这些数字属于哪一列。可行的做法是把表格单独抽出来,转成结构化数据(比如数据库表或带完整表头的 JSON),问答时不走向量检索而走结构化查询;或者退一步,为每个表格生成一段带完整上下文的自然语言摘要再入库,牺牲精度换取覆盖。
解析管线跑完之后,随机抽一批文档,把「原件」和「解析结果」并排放给业务同事看,让他们标出哪里错了。这一步经常被跳过,因为看起来很土,但它是唯一能发现系统性错误的办法 —— 比如所有带印章的合同金额都少识别了一位、所有跨页表格的第二页都归错了表。抽检要按文档类型分层,每类至少几十份,而不是从全量里随机抽(否则占比小但重要的类型永远抽不到)。发现的错误要分类:是识别错、顺序错,还是切分错?三类的修法完全不同。最后把这批标注过的文档固化成回归集,之后每次调整管线都重跑一遍,否则你不知道这次改动修好了一个问题还是同时弄坏了两个。
适用边界
同义问法