Convertir un PDF escaneado a Markdown
Una página escaneada es una fotografía del texto, así que un conversor normal no encuentra nada que convertir. Esta herramienta reconoce las palabras de la imagen. A diferencia de todo lo demás en este sitio, funciona enviando las páginas a nuestro servidor: se te dice exactamente qué se enviará y tienes que confirmarlo antes de que nada salga de tu dispositivo.
Suelta tu PDF o Word aquí
o elige un archivo de tu ordenador
PDF o Word (.docx) · hasta 50 MB
¿Cómo convierto un PDF escaneado a Markdown?
Suelta el escaneo en esta página. Primero se comprueba en tu navegador y, si no tiene capa de texto, se te ofrece el reconocimiento. Al confirmar, las páginas se leen en nuestro servidor y vuelven convertidas en Markdown.
¿Se sube mi archivo escaneado?
Sí, y solo lo hace esta herramienta. Las páginas van a nuestro propio servidor, se mantienen en memoria mientras se leen y se destruyen al terminar. No se escribe nada en disco y ninguna otra empresa las recibe.
Cómo convertir un PDF escaneado a Markdown
- 1
Añade tu PDF escaneado
Arrastra el archivo al recuadro de arriba o elígelo desde tu dispositivo. Se inspecciona primero en tu navegador, así que un PDF que ya tenga capa de texto se convierte aquí sin enviarse a ningún sitio.
- 2
Elige el idioma
Selecciona el idioma en el que está escrito el documento. La precisión del reconocimiento depende mucho de esto, y elegir mal es la causa más común de un mal resultado.
- 3
Confirma el envío
Se te muestra qué se va a enviar, adónde va y cuánto tiempo dura. No se transmite nada hasta que pulsas el botón, y rechazar te deja exactamente donde estabas.
- 4
Revisa el resultado
El Markdown aparece en el editor junto con una nota sobre la confianza del reconocimiento. Contrasta nombres, cifras y fechas con el original antes de fiarte de ellos.
Qué es realmente un PDF escaneado
Hay dos clases de PDF que en pantalla se ven idénticas. Una guarda los caracteres, así que el texto se puede seleccionar, buscar y copiar. La otra guarda una fotografía de la página, de un escáner plano, la cámara de un móvil o un fax, y no contiene ningún carácter.
Nuestro conversor normal lee la primera clase directamente en tu navegador y no envía el archivo a ninguna parte. Ante la segunda no encuentra nada, y hace bien, y por eso los escaneos necesitan otra herramienta y no una versión mejor de la misma.
Puedes distinguirlas sin ningún programa: abre el PDF e intenta seleccionar una línea de texto con el cursor. Si no se resalta nada, es un escaneo.
Por qué esta página sube el archivo y las demás no
El reconocimiento óptico necesita rasterizar cada página a alta resolución y ejecutar un motor de reconocimiento sobre la imagen. Hacerlo en un navegador es posible, pero lento, pesado en memoria y bastante menos preciso; en un móvil de gama media, que es de donde salen la mayoría de los documentos fotografiados, no es una opción realista.
Por eso esta única herramienta envía las páginas a un servidor. La construimos para conservar todo lo posible de la promesa original: el reconocimiento se ejecuta en nuestro propio hardware con nuestro propio motor, así que ningún tercero recibe tu documento, y el servicio no tiene base de datos, ni almacenamiento de objetos, ni disco donde escribir. Las páginas existen en memoria mientras dura el trabajo y después desaparecen.
El consentimiento se pide para cada archivo, cada vez, y nunca se recuerda. Si lo rechazas, no se envía nada y el resto del sitio se comporta exactamente como siempre.
Qué hace bien el reconocimiento y qué no
Un escaneo limpio a 300 ppp de texto impreso se reconoce con mucha precisión. Una foto tomada en ángulo, con poca luz o de un fax descolorido sale bastante peor: el reconocimiento es una estimación estadística, no una transcripción.
Conviene conocer dos fallos porque no se ven en el resultado. Los caracteres se leen mal, sobre todo en nombres, códigos de referencia y números largos, donde no hay una palabra alrededor que corrija. Y las palabras que el motor no consigue leer se descartan, así que el texto puede faltar en vez de estar equivocado. El resultado indica la puntuación de confianza y señala las páginas con mala nota.
- Texto impreso en los idiomas admitidos: fiable en un escaneo limpio
- Títulos, párrafos y listas: se reconstruyen a partir de la posición y el tamaño de las palabras reconocidas
- Tablas: se recuperan a menudo, pero comprueba la alineación de las columnas
- Escritura a mano: no admitida
- Fórmulas matemáticas: no admitidas
- Imágenes y diagramas: no se extraen
Cómo obtener un resultado mejor
Escanea a 300 ppp en lugar de a 150 si puedes elegir; es la mayor diferencia entre un buen resultado y uno mediocre. Fotografía las páginas planas y con luz uniforme, no en ángulo. Y ajusta bien el idioma: un motor en inglés leyendo un documento en alemán producirá disparates con mucha seguridad.
Preguntas frecuentes
- ¿Guardáis mi documento escaneado en vuestro servidor?
- No. Se mantiene en memoria mientras se lee y se destruye cuando el trabajo termina o falla. El servicio de reconocimiento no tiene base de datos ni almacenamiento de archivos, así que no hay dónde conservarlo.
- ¿Enviáis mi documento a Google o a otro servicio de OCR?
- No. El reconocimiento se ejecuta en nuestro propio servidor con nuestro propio motor. Usar esta herramienta no añade ninguna empresa a la lista de encargados del tratamiento de nuestra Política de Privacidad.
- ¿Qué idiomas puede reconocer?
- Inglés, alemán, español, francés, portugués, hindi, japonés, coreano, chino simplificado y árabe. Elige el idioma del documento antes de confirmar, porque la precisión depende de ello.
- ¿Puede leer escritura a mano?
- No. El motor está entrenado con texto impreso. Las notas manuscritas, las firmas y las anotaciones no se reconocerán, y preferimos decirlo antes que dejar que lo descubras en el resultado.
- ¿Cuántas páginas puedo reconocer gratis?
- Hay un límite diario de páginas y otro por documento, ambos visibles antes de confirmar. Existen porque el reconocimiento consume tiempo de proceso real, a diferencia del conversor del navegador.
- ¿Puedo convertir un escaneo sin subirlo en absoluto?
- En la web no. Si tu PDF en realidad tiene capa de texto, el conversor normal lo procesa en el navegador; pero un escaneo de verdad necesita el reconocimiento en el servidor.