导入排错
AI 知识库导入 PDF 失败?先判断扫描件、文本层与解析错误
从文本层、OCR、文件大小、解析错误和实际引用逐步排查 AI 知识库的 PDF 导入问题。
文章封包
Workflows
PDF 显示已导入、被跳过或报错,但知识库里没有完整可用内容的简体中文用户
8 分钟阅读
01
先分清文本型 PDF 与扫描型 PDF,不要先调 embedding。
02
found、ingested、skipped 与 error 是排错信号,不是内容可用的证明。
03
用一段确定存在的文字及其来源,验证完整导入路径。
01
先说结论:确认 PDF 真的有文本层
先在 PDF 阅读器里选中并复制一段文字。如果整页只能作为图片选中,这就是扫描型或 image-only PDF,必须先做 OCR;Wenlan v1 不会自行 OCR。
完成 OCR 后,另存为可提取文字的 PDF,或转成干净的 `.md` / `.txt`。先抽查姓名、日期、数字、表格和阅读顺序,再交给知识库;能搜到文字不代表 OCR 结果一定正确。
02
把失败分成五类,不要都叫上传失败
Wenlan 的文件夹来源只处理 `.md`、`.txt` 和 `.pdf`。文本文件上限为 1 MB,PDF 上限为 10 MB;隐藏文件、symlink 和被排除的文件夹不会进入常规扫描。不同结果需要不同修法。
- 完全找不到文件:先检查扩展名、大小、隐藏文件、symlink 和文件夹范围。
- found 但没有内容:检查是否为扫描型 PDF、空文本层或只有极少可用文字。
- skipped:可能是文件未变化、没有可提取文字,或内容未通过最低质量门槛。
- error:可能是读取失败、截断、损坏或 PDF parser 无法解析;先用原阅读器重新导出一份干净副本。
- 有文字但回答错误:抽查多栏、表格、页码和段落顺序,确认问题不是解析阶段造成的。
03
用一个最小来源重跑 Wenlan
不要用整个文档库测试。复制一份无敏感信息的代表性 PDF 到单独文件夹,完成平台与客户端设置后,注册或重新同步这个路径。
记录 found、ingested、skipped 与 error,但不要停在批次摘要。文档处理完成后,搜索一段只会出现在该 PDF 的句子,确认结果能回到正确文件或来源。
注册或重新同步一个排错来源
wenlan status
wenlan sources add ~/Knowledge/pdf-diagnostic04
用可回答和不可回答问题验收
准备一个文档中确实有答案的问题,以及一个来源完全没有答案的问题。第一个答案应能指出支持内容;第二个应保持未知,不能用流畅文字掩盖缺少证据。
如果 Markdown 或纯文本版本能通过,但原 PDF 不能,问题就在 PDF 提取路径,不是 embedding 或提示词。如果两者都失败,再检查来源范围、同步、检索和引用。
05
什么时候该停止硬救 PDF
对于重要合同、报表或表格,OCR 与重新导出仍可能破坏数字或结构。如果无法通过抽查证明结果可靠,就保留原 PDF 作为权威来源,改用人工校验的 Markdown 或文本摘要,并清楚记录来源和限制。
先验证一份 PDF,再扩大文档库
连接 Wenlan、加入一份可控文档,确认文字、来源和引用都通过后再导入其他资料。
FAQ