跳到主要內容

匯入排錯

AI 知識庫匯入 PDF 失敗?先判斷掃描檔、文字層與解析錯誤

從文字層、OCR、檔案大小、解析錯誤與實際引用逐步排查 AI 知識庫的 PDF 匯入問題。

Qi-Xuan Lu更新 8 分鐘閱讀

文章封包

01

Workflows

02

PDF 顯示已匯入、被略過或出錯,但知識庫裡沒有完整可用內容的繁體中文使用者

03

8 分鐘閱讀

01

先分清文字型 PDF 與掃描型 PDF,不要先調 embedding。

02

found、ingested、skipped 與 error 是排錯訊號,不是內容可用的證明。

03

用一段確定存在的文字與其來源,驗證完整匯入路徑。

01

先說結論:確認 PDF 真的有文字層

先在 PDF 閱讀器中選取並複製一段文字。如果整頁只能當成圖片選取,這是掃描型或 image-only PDF,必須先做 OCR;Wenlan v1 不會自行 OCR。

完成 OCR 後,另存成可擷取文字的 PDF,或轉成乾淨的 `.md` / `.txt`。先抽查姓名、日期、數字、表格與閱讀順序,再交給知識庫;搜尋得到文字不代表 OCR 結果一定正確。

02

把失敗分成五種,不要全部叫做上傳失敗

Wenlan 的資料夾來源只處理 `.md`、`.txt` 與 `.pdf`。文字檔上限為 1 MB,PDF 上限為 10 MB;隱藏檔、symlink 與已排除的資料夾不會進入一般掃描。不同結果要用不同修法。

  • 完全找不到檔案:先檢查副檔名、大小、隱藏檔、symlink 與資料夾範圍。
  • found 但沒有內容:檢查是否為掃描型 PDF、空文字層或只有極少可用文字。
  • skipped:可能是檔案未變、沒有可擷取文字,或內容未通過最低品質門檻。
  • error:可能是讀取失敗、截斷、損壞或 PDF parser 無法解析;先用原閱讀器重新匯出一份乾淨副本。
  • 有文字但回答錯:抽查多欄、表格、頁碼與段落順序,確認錯誤不是在解析階段就發生。

03

用一個最小來源重跑 Wenlan

不要用整個文件庫測試。複製一份無敏感資料的代表性 PDF 到單獨資料夾,完成平台與 client 設定後,註冊或重新同步這個路徑。

記錄 found、ingested、skipped 與 error,但不要停在批次摘要。文件處理完成後,搜尋一段只會出現在該 PDF 的句子,確認結果能回到正確檔案或來源

註冊或重新同步一個排錯來源

wenlan status
wenlan sources add ~/Knowledge/pdf-diagnostic

04

用可回答與不可回答問題驗收

準備一個文件中確實有答案的問題,以及一個來源完全沒有答案的問題。第一個答案應能指出支持內容;第二個應保持未知,不能用流暢文字掩蓋缺少證據。

若 Markdown 或純文字版本能通過,但原 PDF 不能,問題就在 PDF 擷取路徑,不是 embedding 或提示詞。若兩者都失敗,再檢查來源範圍、同步、檢索與引用。

05

何時該停下來而不是硬救 PDF

對重要合約、報表或表格,OCR 與重新匯出仍可能破壞數字或結構。若無法用抽查證明結果可靠,就保留原 PDF 為權威來源,改用人工校驗的 Markdown 或文字摘要,並清楚記錄其來源與限制。

先驗證一份 PDF,再擴大文件庫

連接 Wenlan、加入一份可控文件,確認文字、來源與引用都通過後再匯入其他資料。

FAQ

為什麼 PDF 顯示已處理,知識庫卻找不到內容?+
可能是檔案只有圖片、抽出的文字太少、解析失敗,或批次摘要只代表註冊/排程完成。用一段確定存在的文字驗證實際檢索結果。
Wenlan 會自動對掃描型 PDF 做 OCR 嗎?+
不會。現行 v1 只擷取已有文字層的 PDF;掃描檔需先在外部完成 OCR。
空內容時應該先換 embedding 模型嗎?+
不用。沒有成功擷取的文字無法靠 embedding 補回來;先修正或轉換來源,再重跑同一組驗收。