把 PDF 转好的实用指南

转换 PDF 很容易。要拿到一个可以依赖的结果,就得知道这个格式记录了什么、没记录什么,每个转换器在哪里不得不推断,以及在信任输出之前该检查什么。这些指南覆盖了最常出现的问题,而且没有一篇的结论是「所以请用我们的转换器」。

四篇背后的同一个道理

PDF 里没有标题、段落、列表或表格,只有位于坐标上的字形。产生该版面的结构被用来算出这些坐标,然后就被丢弃了。因此把 PDF 转成 Markdown 不是提取而是推断:把几何信息读回来,推导出什么样的结构会产生它。

每个转换器都在这么做,我们的也一样,而且没有谁能做得比推断更好——答案确实不在文件里。想通这一点,错误就不再显得随意。输出成段落的标题,当初是用字重而不是字号标记的;塌掉的表格有合并单元格;读起来像胡言乱语的页面是双栏的。每一次失败都能追回到某条规则,而你知道的规则就是你能绕开的规则。

这正是这些指南的用处。第一篇完整解释这种推断及其失败方式。第二篇讲你拿回的文件,以及保存前值得做的少数几处编辑。第三、四篇讲两个具体去处——笔记库和检索管线——它们对同一份 Markdown 提出的要求相当不同。