跳到主要内容

实作

如何用 Markdown、PDF 与 Obsidian 建立本地 AI 知识库

从一个文档范围开始,用可重复同步的 Sources、有来源的 Pages 与验证步骤,建立 AI agent 真正能复用的本地知识库。

Qi-Xuan Lu更新 7 分钟阅读

文章封包

01

Workflows

02

想让 Claude Code、Codex、Cursor 或其他 AI agent 使用本地文档的简体中文用户

03

7 分钟阅读

01

先选一个文件或文件夹,不要一次导入全部资料。

02

支持 Markdown、文本文件、可提取文字的 PDF 与 Obsidian vault。

03

先验证同步与来源,再信任 AI 整理出的页面。

01

一句话做法

先按操作系统安装 Wenlan runtime、连接当前使用的 AI 客户端并验证连接,再对一个 `.md`、`.txt`、可提取文字的 `.pdf`、文件夹或 Obsidian vault 执行 `wenlan sources add <path>`。同一路径再次执行会重新同步。

来源能回答真实问题后,在已安装 Wenlan plugin 的 Claude Code 或 Codex 使用 `/distill <主题>`、`/pages`、`/lint` 与 `/curate`;只有 MCP 连接的客户端则使用该客户端显示的 Wenlan 工具完成同一流程。

02

先划定支持的来源范围

Wenlan 的 Directory Source 会读取单一文件或递归扫描文件夹,支持 `.md`、`.txt` 与能直接提取文字的 `.pdf`。Obsidian vault 可作为只读 Markdown 来源,人写的原始文件仍由 vault 管理。

扫描型 PDF 必须先做 OCR;任意源代码文件目前不属于 Directory Source 的支持范围。代码、测试与项目原生文档仍应是权威,知识库负责维护可检查的综合答案。

03

建立最小文档到页面流程

先选一个会重复询问的主题和一小组文档,让错误、跳过与缺少来源都看得见。

  • 执行 sources add,确认 found、ingested、skipped 与 errors 数量。
  • 修改来源后重跑同一命令,确认同步结果符合预期。
  • 来源足够时才 distill,不用把每份文档都变成 Page。
  • 打开 Page,核对重要结论能回到来源或引用。
  • 执行 lint 与 curate,处理薄弱、冲突、过期或待审核内容。

完成平台与客户端设置后

wenlan status
wenlan sources add ~/Knowledge/project-docs

04

如何验收,而不是只看导入成功

用一个来源中存在的问题和一个来源中不存在的问题测试。前者应能找到支持材料,后者不应被补成确定答案。接着修改一份文档、重新同步,确认 Page 能显示需要刷新或产生可审核修订。

验收重点是来源边界、同步结果、引用与修订,不是一次导入多少文件。这让知识库即使不使用 Wenlan,也有可重复的质量标准。

05

何时再扩大资料范围

只有当一个主题能完成来源、同步、Page、lint 与 review 闭环后,才加入下一个文件夹或 vault。这能避免同名文档、过期版本与无关内容一起进入检索结果。

了解有来源 AI 知识库的维护架构

先用一个文件夹验证完整闭环

安装 Wenlan,加入一组可检查的文档,再验证同步、Page、引用与审核流程。

FAQ

Wenlan 会改写我的 Obsidian vault 吗?+
不会。vault 会作为只读来源重新扫描与索引,原始 Markdown 仍由你管理;Pages 导出或 symlink 是另一个明确选择。
扫描型 PDF 可以直接加入吗?+
不行。PDF 必须能直接提取文字;只有图片的扫描型 PDF 需要先经过 OCR,再把可读文本纳入来源。
这和把文档上传到聊天机器人有什么不同?+
聊天附件通常只服务当次对话;这个流程会保留可重复同步的本地来源,并建立能检查引用、过期状态与修订的维护型 Page。