PDF 转 Markdown:布局解析与结构还原

PDF 仅保存字符的页面坐标,并不直接包含标题或表格等结构信息。本工具通过页面几何布局算法,重新推导出清晰的 Markdown 结构。

23 条评价,满分 5 分中的 5.0 分

把 PDF 或 Word 拖到这里

或从电脑中选择文件

PDF 或 Word (.docx) · 最大 50 MB

如何从 PDF 中还原标题和表格?

转换器在浏览器中测量每行文字的字号与坐标:字号明显大于正文的行成为 H1 至 H4 标题,基线对齐到相同列位置的文字成为 GFM 管道表格。文件全程不离开您的设备。

转换过程是否安全私密?

是的。解析在您浏览器的 Web Worker 中完成,文件字节与文本都不会发送到任何服务器,也不会用于训练模型。无需注册,单个文件上限 50 MB。

PDF 转 Markdown 转换步骤

  1. 1

    选择 PDF 文件

    将文件拖入放置区,或点击选择本地电脑中的 PDF 文件。

  2. 2

    自动解析结构

    PDF.js 在浏览器本地快速解析页面几何布局与文字。

  3. 3

    复制或下载 Markdown

    一键复制生成的 Markdown 文本,或保存为 .md 文件。

可还原的结构元素

基于字体大小和坐标对齐规则,精准还原多种常见的 Markdown 标记。

  • H1 至 H4 层次化标题结构
  • 无序与有序列表及嵌套缩进
  • GFM(GitHub Flavored Markdown)管道表格
  • 双栏排版论文的正确阅读顺序

无法还原的内容

PDF 中的插图不会被提取,只保留其周围的文字;数学公式不会转换为 LaTeX,而是按页面上的字符原样输出。加密的 PDF 可以转换,密码只留在您的设备上。

常见问题

支持扫描版 PDF 转换吗?
浏览器内无法转换。扫描件是文字的图片,页面中没有可读取的文本层。我们另有一个扫描版 PDF 转换器,在服务器上完成文字识别,每个文件都需要您先确认才会发送。

相关转换工具

Further reading