PDF 转 Markdown:布局解析与结构还原
PDF 仅保存字符的页面坐标,并不直接包含标题或表格等结构信息。本工具通过页面几何布局算法,重新推导出清晰的 Markdown 结构。
23 条评价,满分 5 分中的 5.0 分
把 PDF 或 Word 拖到这里
或从电脑中选择文件
PDF 或 Word (.docx) · 最大 50 MB
如何从 PDF 中还原标题和表格?
转换器在浏览器中测量每行文字的字号与坐标:字号明显大于正文的行成为 H1 至 H4 标题,基线对齐到相同列位置的文字成为 GFM 管道表格。文件全程不离开您的设备。
转换过程是否安全私密?
是的。解析在您浏览器的 Web Worker 中完成,文件字节与文本都不会发送到任何服务器,也不会用于训练模型。无需注册,单个文件上限 50 MB。
PDF 转 Markdown 转换步骤
- 1
选择 PDF 文件
将文件拖入放置区,或点击选择本地电脑中的 PDF 文件。
- 2
自动解析结构
PDF.js 在浏览器本地快速解析页面几何布局与文字。
- 3
复制或下载 Markdown
一键复制生成的 Markdown 文本,或保存为 .md 文件。
可还原的结构元素
基于字体大小和坐标对齐规则,精准还原多种常见的 Markdown 标记。
- H1 至 H4 层次化标题结构
- 无序与有序列表及嵌套缩进
- GFM(GitHub Flavored Markdown)管道表格
- 双栏排版论文的正确阅读顺序
无法还原的内容
PDF 中的插图不会被提取,只保留其周围的文字;数学公式不会转换为 LaTeX,而是按页面上的字符原样输出。加密的 PDF 可以转换,密码只留在您的设备上。
常见问题
- 支持扫描版 PDF 转换吗?
- 浏览器内无法转换。扫描件是文字的图片,页面中没有可读取的文本层。我们另有一个扫描版 PDF 转换器,在服务器上完成文字识别,每个文件都需要您先确认才会发送。