Sobre My PDF 2 MD
Última revisión
My PDF 2 MD convierte documentos PDF a Markdown sin subirlos a ningún sitio. Esta página explica quién lo mantiene, cómo funciona la conversión, en qué casos falla y cómo se financia una herramienta gratuita que nunca recibe tus archivos.
Quién está detrás de este sitio
My PDF 2 MD lo desarrolla y lo mantiene MyPDF2MD.com, un proyecto de software independiente con sede en Kozhikode, Kerala, India. No hay un fondo de inversión detrás, no es la fachada de una API de procesamiento documental y no revende nada de lo que conviertes.
Lo lleva un equipo pequeño. No hay una cola de soporte escondida detrás de un chatbot: el correo llega a una persona. Las preguntas generales van a support@mypdf2md.com; todo lo relativo a datos personales, a privacy@mypdf2md.com. Ambos se responden en un plazo de cinco días laborables, y la página de contacto tiene un formulario si prefieres no escribir un correo.
Por qué existe
Casi todas las herramientas de PDF a Markdown que hay en la web funcionan igual: subes el documento a un servidor del que no sabes nada, se procesa allí y te piden que confíes en una frase de una política de privacidad sobre lo que pasó después. Para la carta de un restaurante da igual. Para un contrato firmado, un informe médico, un acta del consejo o un manuscrito inédito, es un intercambio que casi nadie aceptaría sabiendo lo que acepta.
La tecnología para evitarlo lleva años en los navegadores. PDF.js, el motor de PDF de Mozilla, se ejecuta dentro de la propia página y puede leer un documento sin que ninguna parte de él cruce la red. Lo que faltaba no era la capacidad, sino una herramienta construida alrededor de ella. Por eso esta convierte en tu máquina por defecto, y la promesa de privacidad de la portada describe la arquitectura en lugar de prometer buena conducta.
Esa decisión tiene un coste y conviene decirlo sin rodeos: una pestaña del navegador tiene menos memoria y menos CPU que un servidor, así que los documentos muy largos o muy complejos tardan más aquí que en un servicio alojado. Nos parece el intercambio correcto para los documentos que de verdad preocupan.
Cómo funciona la conversión de verdad
Esta es la parte que la mayoría de los conversores describe como magia, y merece la pena entenderla porque explica los errores que comete la herramienta.
Un PDF no contiene títulos, párrafos, listas ni tablas. Contiene glifos en coordenadas. Cuando un procesador de textos exporta un PDF, la estructura semántica del documento original — este texto es un título de nivel dos, estas líneas forman un párrafo, estas celdas son una tabla — se descarta y se sustituye por instrucciones para pintar marcas sobre una página. Convertir un PDF a Markdown consiste en deducir esa estructura a partir de la geometría, y deducir no es extraer.
El conversor empieza por calcular la altura del texto normal: la altura de fuente más frecuente del documento, ponderada por cuántos caracteres están compuestos con ella. Todo lo demás se mide en múltiplos de esa unidad, que es lo que hace que el resultado no dependa de si el documento está a 9 o a 14 puntos.
A partir de ahí las reglas son geométricas. Los fragmentos que comparten línea base con una diferencia de un tercio de la altura del cuerpo forman una sola línea. Las líneas consecutivas separadas por no más de una altura y media forman un párrafo. Un fragmento compuesto claramente más grande que el cuerpo — a partir de 1,2 veces — es un título, y cuánto más grande decide si acaba siendo H1, H2 o H3. Dos o más filas consecutivas cuyas celdas se alinean en al menos dos posiciones horizontales compartidas son una tabla. Un corredor vertical cerca del centro de la página la divide en columnas para que el orden de lectura no vaya en zigzag. Los encabezados y pies que se repiten en la misma posición página tras página se detectan y se eliminan.
El formato en línea se lee de la propia fuente en lugar de adivinarse: la negrita y la cursiva salen del peso y la inclinación reales de la fuente, y los fragmentos monoespaciados se convierten en código. Los enlaces incrustados en el PDF se conservan como enlaces de Markdown.
En qué se equivoca
Como la estructura se deduce, la herramienta tiene fallos predecibles, y preferimos enumerarlos a que los descubras en un documento que te importaba.
- Un documento que marca los títulos solo con negrita, sin cambiar el tamaño, no le da nada al detector de títulos: esos títulos salen como párrafos normales.
- Las tablas con celdas combinadas, las tablas anidadas o las celdas cuyo contenido ocupa varias líneas pierden la alineación, porque el detector de columnas trabaja con posiciones horizontales y una celda combinada rompe la rejilla.
- Las maquetaciones a varias columnas más elaboradas que una división simple en dos — una página de revista con destacados y barras laterales — pueden producir un orden de lectura desordenado.
- La notación matemática no se convierte a LaTeX. Las fórmulas compuestas como texto llegan como los caracteres que las forman; las fórmulas insertadas como imagen no llegan.
- Las imágenes no se extraen. La salida es texto y estructura.
- Un documento escaneado no contiene texto seleccionable, así que la conversión en el navegador no produce nada. Ese caso se trata aparte, con el reconocimiento opcional que se describe más abajo.
Lo único que sí sale de tu dispositivo
Un escaneo es una fotografía de una página. No hay texto dentro que leer, así que por mucho que se analice en el navegador no saldrá ninguno. Leerlo exige reconocimiento óptico de caracteres, que necesita mucha más potencia de cálculo de la que puede ofrecer una pestaña.
Para ese caso, y solo para ese caso, puedes pedirnos que reconozcamos un documento en nuestro servidor. Nunca es automático. La herramienta detecta que el archivo no tiene texto seleccionable, te lo dice y ofrece el reconocimiento como una decisión que tienes que confirmar: un diálogo te indica cuántas páginas se van a subir, adónde van y cuánto tiempo se conservan antes de que se envíe nada.
El reconocimiento se ejecuta en nuestra propia infraestructura con nuestro propio motor. El archivo se mantiene en memoria mientras dura el trabajo y se destruye al terminar; no se escribe nada en disco y ningún tercero lo recibe. Lo que sí guardamos es un registro de uso — número de páginas, marca de tiempo, idioma del reconocimiento y, o bien tu ID de cuenta, o bien un hash con sal de tu IP — que existe para aplicar el límite diario y detectar abusos, no contiene ninguna parte de tu documento y se borra a los treinta días.
El resultado del reconocimiento es una estimación, no una transcripción. Confunde caracteres, sobre todo en nombres, cifras, fechas y códigos de referencia, y las palabras que no consigue leer se descartan en lugar de señalarse. El resultado se marca como tal, con la puntuación de confianza del propio motor y la lista de las páginas de las que estuvo menos seguro. No lee escritura a mano y no convierte fórmulas matemáticas.
Cómo se paga una herramienta gratuita
El conversor web es gratuito, no pide registro y lleva publicidad. Nos parece más honesto decirlo en la página que dejar que lo descubras, así que: este sitio gana dinero con anuncios y no gana dinero con tus documentos.
Y no puede ganarlo, que es la razón de ser de la arquitectura y no una política que te pidamos creer. Un archivo convertido en tu navegador no llega hasta nosotros. Aquí no hay un corpus de PDF subidos que minar, con el que entrenar o que vender, porque no hay subida.
La publicidad solo se carga después de que la aceptes. Si rechazas la categoría de publicidad en el aviso de cookies, no se carga ningún script de anuncios — no uno que muestre menos anuncios: ninguno. Lo mismo vale para la analítica. Las dos categorías están desactivadas hasta que las actives, y el pie de página tiene un enlace para cambiar de opinión más adelante.
Ninguna página de este sitio te pide pagar por nada: no hay nada que comprar, ningún plan al que subir y ninguna cuenta que crear.
Lo que no hacemos
- No subimos los documentos que se convierten en el navegador: no existe ninguna ruta de código que pudiera hacerlo.
- No exigimos cuenta, ni dirección de correo, ni inicio de sesión para usar el conversor web.
- No almacenamos, indexamos, entrenamos con ni vendemos ningún documento ni ninguna salida convertida.
- No cargamos publicidad ni analítica antes de que aceptes esa categoría.
- No reclamamos ningún derecho sobre los documentos que conviertes ni sobre el Markdown que recibes.
Cómo está construido
Para quien prefiera los detalles concretos a las promesas:
| Lectura del PDF | PDF.js, ejecutándose en un Web Worker de tu navegador |
|---|---|
| Detección de estructura | Analizador espacial propio sobre fragmentos de texto posicionados |
| Formato de salida | GitHub Flavored Markdown, con tablas de barras verticales |
| Aplicación | Next.js con App Router, React y TypeScript |
| Idiomas de la interfaz | 10, con soporte de derecha a izquierda para el árabe |
| Tamaño máximo | 50 MB |
| Precio | Gratis, financiado con publicidad, sin cuenta |
| Operado por | MyPDF2MD.com, Kozhikode, Kerala, India |
Correcciones
Si algo de este sitio está mal — un error de hecho en una guía, una conversión que falla de una forma que no hemos descrito, una afirmación de esta página que no coincide con lo que hace la herramienta — escríbenos a support@mypdf2md.com: lo corregiremos y diremos qué ha cambiado. La fecha que aparece arriba es la de la última revisión de este texto contra el producto.