把 PDF 导入 Obsidian 笔记库而不弄得一团糟
最后核对
Obsidian 很乐意存下一个 PDF 并在面板里显示它。但它做不到的是:在里面好好搜索、链接到其中某一节、让它出现在关系图里,或者让你像对待笔记那样在页边写字。
转成 Markdown 能一次性解决这些问题,前提是产出的文件长得像一则笔记,而不是一份逐字稿。大多数导入正是在这一步做错的。
阅读约 5 分钟
转换之前先想清楚「笔记」是什么
把一本 90 页的手册转成单独一则笔记,技术上可搜索,实际上不可用:在面板里读太长,精确链接也太长,而且它会淹没每一次出现它的搜索结果。
转换之前,先决定这个 PDF 是一则笔记还是多则。论文是一则。手册是每章一则。书是每章一则,再加一则索引笔记把它们串起来。先切分 PDF 再转换各部分——这比事后切分 Markdown 省力得多,因为在 PDF 里你看得见页面的边界。
标题层级是笔记的脊柱
Obsidian 的大纲面板、折叠功能、按标题级别的链接,以及搜索排序的很大一部分,都来自标题结构。标题错了的笔记,就是导航错了的笔记。
这也是转换后的文件最常需要动手的地方,因为标题级别来自字号,而字号在一份文档内部只是大致一致。花两分钟修好层级,第一次用大纲面板时就回本了。
有一条约定值得采纳:让笔记标题承载文档名,正文从 H2 开始,而不是用一个重复文件名的 H1 开场。Obsidian 本来就把文件名显示为标题,再来一个内容相同的 H1,等于浪费每则笔记的开头。
配得上位置的 front matter
Obsidian 会把 YAML front matter 读成属性,用于驱动 Dataview 查询、属性面板和搜索筛选。转换器生成不了它——这些内容 PDF 里一样都没有——所以值得在导入时手动补一次。
只保留你真的会拿来查询的字段。没人筛选的 front matter,只是压在每则笔记顶部的噪声。
---
title: 分布式系统手册 第 4 章
source: distributed-systems-handbook.pdf
author: R. Mehta
year: 2023
pages: 61-84
tags: [reference, distributed-systems]
imported: 2026-08-04
---留下原始 PDF,并链接到它
转换是有损的:插图留不下来,以图片形式排出的内容也留不下来。把源 PDF 放在笔记库的附件文件夹里,并从笔记链接过去。
这样分工才好用:Markdown 是你搜索、链接、引用和批注的对象;PDF 是你在需要第 12 页那张图、或者要拿数字跟原文核对时才打开的东西。
> 转换自 [[attachments/distributed-systems-handbook.pdf]]。
> 插图与示意图在原文件中。趁记忆还新,做一遍加链接
刚转换出来的笔记一条链接都没有,也就意味着它对关系图不可见,从笔记库任何地方都到不了。大约五分钟的工作,就能让它的价值大幅提升。
把笔记读一遍,把那些已经作为笔记存在的术语用双方括号括起来。如果某个概念值得一则尚不存在的笔记,照样链接——未解析的链接是一件出现在关系图里的待办事项,而那正是你希望它待的地方。
然后把这则笔记加进覆盖其主题的索引或内容地图。没有任何东西链接过去的笔记不会被再次找到,无论内容多好。
处理积压的一批
如果你导入的是一整个 PDF 文件夹而不是单个文档,请按工序对整批推进,而不是把每则笔记彻底做完再开始下一则。先全部转换,再修所有标题层级,再补所有 front matter,最后统一加链接。
这样更快,而且产出的笔记库前后一致:最后做的笔记和最先做的长得一样——如果你一则一则地边做边改进约定,就不会是这样。
不值得费力的事
- 别试图在笔记里保留 PDF 的页码。Markdown 不分页,那些页码什么也指不到。
- 别在没做文字识别之前转换扫描版 PDF——你会得到一则空笔记,然后纳闷为什么。
- 别转换你手上就有原始文档的 PDF。转换原件:它有真正的结构,什么都不用推断。
- 别花时间在 Markdown 里重建复杂表格。给表格截个图,保留 PDF 链接,然后继续往下走。