把 PDF 转好的实用指南
转换 PDF 很容易。要拿到一个可以依赖的结果,就得知道这个格式记录了什么、没记录什么,每个转换器在哪里不得不推断,以及在信任输出之前该检查什么。这些指南覆盖了最常出现的问题,而且没有一篇的结论是「所以请用我们的转换器」。
PDF 转换为什么会丢失结构,以及该怎么办
PDF 存的是定位好的字形,不是结构。理解这一点,就能解释你此后会遇到的每一个转换错误。
阅读约 6 分钟
你拿回的 Markdown,以及如何清理它
转换器输出什么、Markdown 的哪些特性能挺过这趟旅程,以及每次都值得做的少数几轮清理。
阅读约 5 分钟
把 PDF 导入 Obsidian 笔记库而不弄得一团糟
把一个装满 PDF 的文件夹,变成 Obsidian 的大纲、搜索和关系图真正用得上的笔记。
阅读约 5 分钟
为 LLM 与检索管线准备 PDF
在检索管线里 Markdown 为何胜过原始抽取文本,以及如何在分块时不破坏让它有效的那些东西。
阅读约 7 分钟
四篇背后的同一个道理
PDF 里没有标题、段落、列表或表格,只有位于坐标上的字形。产生该版面的结构被用来算出这些坐标,然后就被丢弃了。因此把 PDF 转成 Markdown 不是提取而是推断:把几何信息读回来,推导出什么样的结构会产生它。
每个转换器都在这么做,我们的也一样,而且没有谁能做得比推断更好——答案确实不在文件里。想通这一点,错误就不再显得随意。输出成段落的标题,当初是用字重而不是字号标记的;塌掉的表格有合并单元格;读起来像胡言乱语的页面是双栏的。每一次失败都能追回到某条规则,而你知道的规则就是你能绕开的规则。
这正是这些指南的用处。第一篇完整解释这种推断及其失败方式。第二篇讲你拿回的文件,以及保存前值得做的少数几处编辑。第三、四篇讲两个具体去处——笔记库和检索管线——它们对同一份 Markdown 提出的要求相当不同。