跳到主要内容

导入排错

AI 知识库导入 PDF 失败?先判断扫描件、文本层与解析错误

从文本层、OCR、文件大小、解析错误和实际引用逐步排查 AI 知识库的 PDF 导入问题。

Qi-Xuan Lu更新 8 分钟阅读

文章封包

01

Workflows

02

PDF 显示已导入、被跳过或报错,但知识库里没有完整可用内容的简体中文用户

03

8 分钟阅读

01

先分清文本型 PDF 与扫描型 PDF,不要先调 embedding。

02

found、ingested、skipped 与 error 是排错信号,不是内容可用的证明。

03

用一段确定存在的文字及其来源,验证完整导入路径。

01

先说结论:确认 PDF 真的有文本层

先在 PDF 阅读器里选中并复制一段文字。如果整页只能作为图片选中,这就是扫描型或 image-only PDF,必须先做 OCR;Wenlan v1 不会自行 OCR。

完成 OCR 后,另存为可提取文字的 PDF,或转成干净的 `.md` / `.txt`。先抽查姓名、日期、数字、表格和阅读顺序,再交给知识库;能搜到文字不代表 OCR 结果一定正确。

02

把失败分成五类,不要都叫上传失败

Wenlan 的文件夹来源只处理 `.md`、`.txt` 和 `.pdf`。文本文件上限为 1 MB,PDF 上限为 10 MB;隐藏文件、symlink 和被排除的文件夹不会进入常规扫描。不同结果需要不同修法。

  • 完全找不到文件:先检查扩展名、大小、隐藏文件、symlink 和文件夹范围。
  • found 但没有内容:检查是否为扫描型 PDF、空文本层或只有极少可用文字。
  • skipped:可能是文件未变化、没有可提取文字,或内容未通过最低质量门槛。
  • error:可能是读取失败、截断、损坏或 PDF parser 无法解析;先用原阅读器重新导出一份干净副本。
  • 有文字但回答错误:抽查多栏、表格、页码和段落顺序,确认问题不是解析阶段造成的。

03

用一个最小来源重跑 Wenlan

不要用整个文档库测试。复制一份无敏感信息的代表性 PDF 到单独文件夹,完成平台与客户端设置后,注册或重新同步这个路径。

记录 found、ingested、skipped 与 error,但不要停在批次摘要。文档处理完成后,搜索一段只会出现在该 PDF 的句子,确认结果能回到正确文件或来源

注册或重新同步一个排错来源

wenlan status
wenlan sources add ~/Knowledge/pdf-diagnostic

04

用可回答和不可回答问题验收

准备一个文档中确实有答案的问题,以及一个来源完全没有答案的问题。第一个答案应能指出支持内容;第二个应保持未知,不能用流畅文字掩盖缺少证据。

如果 Markdown 或纯文本版本能通过,但原 PDF 不能,问题就在 PDF 提取路径,不是 embedding 或提示词。如果两者都失败,再检查来源范围、同步、检索和引用。

05

什么时候该停止硬救 PDF

对于重要合同、报表或表格,OCR 与重新导出仍可能破坏数字或结构。如果无法通过抽查证明结果可靠,就保留原 PDF 作为权威来源,改用人工校验的 Markdown 或文本摘要,并清楚记录来源和限制。

先验证一份 PDF,再扩大文档库

连接 Wenlan、加入一份可控文档,确认文字、来源和引用都通过后再导入其他资料。

FAQ

为什么 PDF 显示已处理,知识库却找不到内容?+
可能是文件只有图片、提取文字太少、解析失败,或批次摘要只代表注册/排程完成。用一段确定存在的文字验证实际检索结果。
Wenlan 会自动对扫描型 PDF 做 OCR 吗?+
不会。当前 v1 只提取已有文本层的 PDF;扫描件需要先在外部完成 OCR。
空内容时应该先换 embedding 模型吗?+
不用。没有成功提取的文字无法靠 embedding 补回来;先修正或转换来源,再重跑同一组验收。