实作
如何用 Markdown、PDF 与 Obsidian 建立本地 AI 知识库
从一个文档范围开始,用可重复同步的 Sources、有来源的 Pages 与验证步骤,建立 AI agent 真正能复用的本地知识库。
文章封包
Workflows
想让 Claude Code、Codex、Cursor 或其他 AI agent 使用本地文档的简体中文用户
7 分钟阅读
01
先选一个文件或文件夹,不要一次导入全部资料。
02
支持 Markdown、文本文件、可提取文字的 PDF 与 Obsidian vault。
03
先验证同步与来源,再信任 AI 整理出的页面。
01
一句话做法
先按操作系统安装 Wenlan runtime、连接当前使用的 AI 客户端并验证连接,再对一个 `.md`、`.txt`、可提取文字的 `.pdf`、文件夹或 Obsidian vault 执行 `wenlan sources add <path>`。同一路径再次执行会重新同步。
来源能回答真实问题后,在已安装 Wenlan plugin 的 Claude Code 或 Codex 使用 `/distill <主题>`、`/pages`、`/lint` 与 `/curate`;只有 MCP 连接的客户端则使用该客户端显示的 Wenlan 工具完成同一流程。
02
先划定支持的来源范围
Wenlan 的 Directory Source 会读取单一文件或递归扫描文件夹,支持 `.md`、`.txt` 与能直接提取文字的 `.pdf`。Obsidian vault 可作为只读 Markdown 来源,人写的原始文件仍由 vault 管理。
扫描型 PDF 必须先做 OCR;任意源代码文件目前不属于 Directory Source 的支持范围。代码、测试与项目原生文档仍应是权威,知识库负责维护可检查的综合答案。
03
建立最小文档到页面流程
先选一个会重复询问的主题和一小组文档,让错误、跳过与缺少来源都看得见。
- 执行 sources add,确认 found、ingested、skipped 与 errors 数量。
- 修改来源后重跑同一命令,确认同步结果符合预期。
- 来源足够时才 distill,不用把每份文档都变成 Page。
- 打开 Page,核对重要结论能回到来源或引用。
- 执行 lint 与 curate,处理薄弱、冲突、过期或待审核内容。
完成平台与客户端设置后
wenlan status
wenlan sources add ~/Knowledge/project-docs04
如何验收,而不是只看导入成功
用一个来源中存在的问题和一个来源中不存在的问题测试。前者应能找到支持材料,后者不应被补成确定答案。接着修改一份文档、重新同步,确认 Page 能显示需要刷新或产生可审核修订。
验收重点是来源边界、同步结果、引用与修订,不是一次导入多少文件。这让知识库即使不使用 Wenlan,也有可重复的质量标准。
05
何时再扩大资料范围
只有当一个主题能完成来源、同步、Page、lint 与 review 闭环后,才加入下一个文件夹或 vault。这能避免同名文档、过期版本与无关内容一起进入检索结果。
先用一个文件夹验证完整闭环
安装 Wenlan,加入一组可检查的文档,再验证同步、Page、引用与审核流程。
FAQ