扫描版 PDF 转 Markdown
扫描页是一张文字的图片,普通转换器在其中找不到可转换的内容,本工具改为识别图片中的文字。与本站其他页面不同,它需要把页面发送到我们的服务器:会发送什么将明确告知您,并且必须由您确认之后,才会有任何内容离开您的设备。
把 PDF 或 Word 拖到这里
或从电脑中选择文件
PDF 或 Word (.docx) · 最大 50 MB
如何把扫描版 PDF 转换为 Markdown?
把扫描件拖到本页。文件先在浏览器中检查,确认没有文本层后才会向您提供识别选项。您同意后,页面在我们的服务器上识别并返回 Markdown。
我的扫描文件会被上传吗?
会,而且本站只有这个工具会这样做。页面发送到我们自己的服务器,识别期间仅存在于内存中,任务结束即销毁,不写入磁盘,也不交给其他公司。
扫描版 PDF 转 Markdown 的步骤
- 1
添加扫描版 PDF
把文件拖到上方方框,或从设备中选择。文件先在浏览器中检查,已含文本层的 PDF 会直接在本地转换,不会发送到任何地方。
- 2
选择语言
选择文档所用的语言。识别准确率高度依赖这一项,选错是结果不佳最常见的原因。
- 3
确认发送
页面会显示将要发送的内容、去向以及保留时长。在您按下按钮之前不会传输任何数据,拒绝也不会改变当前状态。
- 4
核对结果
Markdown 会出现在编辑器中,并附有识别置信度提示。在依据结果做判断之前,请对照原件核对人名、数字与日期。
扫描版 PDF 究竟是什么
PDF 有两种,在屏幕上看起来完全一样。一种存储字符,文字可以选中、搜索和复制;另一种存储的是一张页面照片,来自平板扫描仪、手机相机或传真,其中根本不含字符。
我们的普通转换器直接在浏览器中读取第一种,且不会把文件发往任何地方;面对第二种,它理所当然地什么也找不到。所以扫描件需要的是另一种工具,而不是同一种工具的改进版。
不借助任何软件也能分辨:打开 PDF,用光标尝试选中一行文字。若没有任何内容被高亮,那就是扫描件。
为什么只有这个页面会上传
光学字符识别需要把每一页高分辨率地栅格化,再让识别引擎处理图像。在浏览器里做这件事可行,但速度慢、内存占用高,准确率也明显更低;而在中端手机上,也就是大多数拍照文档的来源,它并不是一个现实的选择。
因此只有这一个工具会把页面发送到服务器。我们在构建它时尽可能保留了原本的承诺:识别运行在我们自己的硬件与自研引擎上,任何第三方都不会收到您的文档;该服务没有数据库、没有对象存储,也没有可写磁盘来保存它。页面只在任务期间存在于内存中,随后即消失。
每个文件、每一次都会单独征求您的同意,并且从不记住这一选择。若您拒绝,不会有任何内容被发送,本站其余部分的行为也与平时完全一致。
识别擅长什么,不擅长什么
一份干净的 300 DPI 印刷文本扫描件识别得非常准确;而倾斜拍摄、光线不佳或已经褪色的传真件则明显更差。识别是统计意义上的推测,而不是誊抄。
有两种失败方式值得了解,因为它们无法从结果中直接看出。一是字符被误读,最常发生在人名、编号和长数字上,这些地方没有上下文词语可供校正;二是引擎完全无法读出的词会被丢弃,因此文字可能不是错的,而是缺失的。结果中会给出置信度,并指出得分较低的页面。
- 受支持语言的印刷文本:在干净扫描件上表现可靠
- 标题、段落与列表:依据识别出的文字位置与字号重建
- 表格:通常可以还原,但请核对列对齐
- 手写内容:不支持
- 数学公式:不支持
- 图片与图表:不提取
如何得到更好的结果
如果可以选择,请以 300 DPI 而非 150 DPI 扫描,这是好结果与平庸结果之间最大的单项差别。拍摄时请让页面保持平整、光线均匀,不要倾斜。并且务必设置正确的语言:用英语引擎去读一份德语文档,只会得到看似笃定的胡话。
常见问题
- 我的扫描文档会保存在你们的服务器上吗?
- 不会。它在识别期间保存在内存中,任务完成或失败时即被销毁。识别服务没有数据库,也没有文件存储,因此它没有地方可以留存。
- 你们会把文档发给 Google 或其他 OCR 服务吗?
- 不会。识别运行在我们自己的服务器上,使用我们自己的引擎。使用本工具不会为隐私政策中的处理方名单增加任何一家公司。
- 支持识别哪些语言?
- 英语、德语、西班牙语、法语、葡萄牙语、印地语、日语、韩语、简体中文与阿拉伯语。请在确认之前选择文档的语言,准确率取决于此。
- 可以识别手写内容吗?
- 不能。引擎针对印刷文本训练,手写笔记、签名与批注不会被识别。我们宁可事先说明,也不愿让您从结果中才发现。
- 免费可以识别多少页?
- 有每日页数额度和单份文档上限,两者都会在您确认之前显示。它们存在是因为识别需要真实的计算时间,这一点与浏览器内转换不同。
- 有没有完全不上传就能处理扫描件的办法?
- 网页端没有。若您的 PDF 其实已含文本层,普通转换器会直接在浏览器中处理;真正的扫描件则必须经过服务器识别。