跳到主要內容

實作

如何用 Markdown、PDF 與 Obsidian 建立本地 AI 知識庫

從一個文件範圍開始,用可重複同步的 Sources、有來源的 Pages 與驗證步驟,建立 AI agent 真正能重用的本地知識庫。

Qi-Xuan Lu更新 7 分鐘閱讀

文章封包

01

Workflows

02

想讓 Claude Code、Codex、Cursor 或其他 AI agent 使用本地文件的繁體中文使用者

03

7 分鐘閱讀

01

先選一個檔案或資料夾,不要一次匯入全部資料。

02

支援 Markdown、文字檔、可擷取文字的 PDF 與 Obsidian vault。

03

先驗證同步與來源,再信任 AI 整理出的頁面。

01

一句話做法

先依作業系統安裝 Wenlan runtime、連接目前使用的 AI 客戶端並驗證連線,再對一個 `.md`、`.txt`、可擷取文字的 `.pdf`、資料夾或 Obsidian vault 執行 `wenlan sources add <path>`。同一路徑再次執行會重新同步。

來源能回答真實問題後,在已安裝 Wenlan plugin 的 Claude Code 或 Codex 使用 `/distill <主題>`、`/pages`、`/lint` 與 `/curate`;只有 MCP 連線的客戶端則使用該客戶端顯示的 Wenlan 工具完成同一流程。

02

先劃定支援的來源範圍

Wenlan 的 Directory Source 會讀取單一檔案或遞迴掃描資料夾,支援 `.md`、`.txt` 與能直接擷取文字的 `.pdf`。Obsidian vault 可作為唯讀 Markdown 來源,人寫的原始檔仍由 vault 管理。

掃描型 PDF 必須先做 OCR;任意程式碼檔案目前不屬於 Directory Source 的支援範圍。程式碼、測試與專案原生文件仍應是權威,知識庫負責維護可檢查的綜合答案。

03

建立最小文件到頁面流程

先選一個會重複詢問的主題和一小組文件,讓錯誤、跳過與缺少來源都看得見。

  • 執行 sources add,確認 found、ingested、skipped 與 errors 數量。
  • 修改來源後重跑同一指令,確認同步結果符合預期。
  • 來源足夠時才 distill,不用把每份文件都變成 Page。
  • 開啟 Page,核對重要結論能回到來源或引用。
  • 執行 lint 與 curate,處理薄弱、衝突、過期或待審查內容。

完成平台與客戶端設定後

wenlan status
wenlan sources add ~/Knowledge/project-docs

04

如何驗收,而不是只看匯入成功

用一個來源中存在的問題和一個來源中不存在的問題測試。前者應能找到支持材料,後者不應被補成確定答案。接著修改一份文件、重新同步,確認 Page 能顯示需要刷新或產生可審查修訂。

驗收重點是來源邊界、同步結果、引用與修訂,不是一次匯入多少檔案。這讓知識庫即使不使用 Wenlan,也有可重複的品質判準。

05

何時再擴大資料範圍

只有當一個主題能完成來源、同步、Page、lint 與 review 閉環後,才加入下一個資料夾或 vault。這能避免同名文件、過期版本與無關內容一起進入檢索結果。

了解有來源 AI 知識庫的維護架構

先用一個資料夾驗證完整閉環

安裝 Wenlan,加入一組可檢查的文件,再驗證同步、Page、引用與審查流程。

FAQ

Wenlan 會改寫我的 Obsidian vault 嗎?+
不會。vault 會作為唯讀來源重新掃描與索引,原始 Markdown 仍由你管理;Pages 匯出或 symlink 是另一個明確選擇。
掃描型 PDF 可以直接加入嗎?+
不行。PDF 必須能直接擷取文字;只有影像的掃描型 PDF 需要先經過 OCR,再把可讀文字納入來源。
這和把文件上傳到聊天機器人有什麼不同?+
聊天附件通常只服務當次對話;這個流程會保留可重複同步的本地來源,並建立能檢查引用、過期狀態與修訂的維護型 Page。