匯入排錯
AI 知識庫匯入 PDF 失敗?先判斷掃描檔、文字層與解析錯誤
從文字層、OCR、檔案大小、解析錯誤與實際引用逐步排查 AI 知識庫的 PDF 匯入問題。
文章封包
Workflows
PDF 顯示已匯入、被略過或出錯,但知識庫裡沒有完整可用內容的繁體中文使用者
8 分鐘閱讀
01
先分清文字型 PDF 與掃描型 PDF,不要先調 embedding。
02
found、ingested、skipped 與 error 是排錯訊號,不是內容可用的證明。
03
用一段確定存在的文字與其來源,驗證完整匯入路徑。
01
先說結論:確認 PDF 真的有文字層
先在 PDF 閱讀器中選取並複製一段文字。如果整頁只能當成圖片選取,這是掃描型或 image-only PDF,必須先做 OCR;Wenlan v1 不會自行 OCR。
完成 OCR 後,另存成可擷取文字的 PDF,或轉成乾淨的 `.md` / `.txt`。先抽查姓名、日期、數字、表格與閱讀順序,再交給知識庫;搜尋得到文字不代表 OCR 結果一定正確。
02
把失敗分成五種,不要全部叫做上傳失敗
Wenlan 的資料夾來源只處理 `.md`、`.txt` 與 `.pdf`。文字檔上限為 1 MB,PDF 上限為 10 MB;隱藏檔、symlink 與已排除的資料夾不會進入一般掃描。不同結果要用不同修法。
- 完全找不到檔案:先檢查副檔名、大小、隱藏檔、symlink 與資料夾範圍。
- found 但沒有內容:檢查是否為掃描型 PDF、空文字層或只有極少可用文字。
- skipped:可能是檔案未變、沒有可擷取文字,或內容未通過最低品質門檻。
- error:可能是讀取失敗、截斷、損壞或 PDF parser 無法解析;先用原閱讀器重新匯出一份乾淨副本。
- 有文字但回答錯:抽查多欄、表格、頁碼與段落順序,確認錯誤不是在解析階段就發生。
03
用一個最小來源重跑 Wenlan
不要用整個文件庫測試。複製一份無敏感資料的代表性 PDF 到單獨資料夾,完成平台與 client 設定後,註冊或重新同步這個路徑。
記錄 found、ingested、skipped 與 error,但不要停在批次摘要。文件處理完成後,搜尋一段只會出現在該 PDF 的句子,確認結果能回到正確檔案或來源。
註冊或重新同步一個排錯來源
wenlan status
wenlan sources add ~/Knowledge/pdf-diagnostic04
用可回答與不可回答問題驗收
準備一個文件中確實有答案的問題,以及一個來源完全沒有答案的問題。第一個答案應能指出支持內容;第二個應保持未知,不能用流暢文字掩蓋缺少證據。
若 Markdown 或純文字版本能通過,但原 PDF 不能,問題就在 PDF 擷取路徑,不是 embedding 或提示詞。若兩者都失敗,再檢查來源範圍、同步、檢索與引用。
05
何時該停下來而不是硬救 PDF
對重要合約、報表或表格,OCR 與重新匯出仍可能破壞數字或結構。若無法用抽查證明結果可靠,就保留原 PDF 為權威來源,改用人工校驗的 Markdown 或文字摘要,並清楚記錄其來源與限制。
先驗證一份 PDF,再擴大文件庫
連接 Wenlan、加入一份可控文件,確認文字、來源與引用都通過後再匯入其他資料。
FAQ