Guías para convertir PDF bien
Convertir un PDF es fácil. Obtener un resultado del que puedas fiarte exige saber qué registra y qué no registra el formato, dónde tiene que adivinar todo conversor y qué comprobar antes de dar por bueno el resultado. Estas guías cubren las preguntas que más aparecen, y ninguna acaba en «pues usa nuestro conversor».
Por qué convertir un PDF pierde estructura, y qué hacer al respecto
Un PDF guarda glifos colocados, no estructura. Entenderlo explica todos los errores de conversión que llegarás a ver.
8 min de lectura
El Markdown que recibes, y cómo dejarlo limpio
Qué emite el conversor, qué elementos de Markdown sobreviven al viaje y las pocas pasadas de limpieza que merecen hacerse siempre.
7 min de lectura
Importar PDF a un vault de Obsidian sin liarla
Convertir una carpeta de PDF en notas que el esquema, la búsqueda y el grafo de Obsidian puedan aprovechar de verdad.
7 min de lectura
Preparar PDF para LLM y pipelines de recuperación
Por qué Markdown rinde mejor que el texto extraído en crudo en un pipeline de recuperación, y cómo trocearlo sin destruir lo que lo hace funcionar.
9 min de lectura
La idea que hay debajo de las cuatro
Un PDF no contiene títulos, párrafos, listas ni tablas. Contiene glifos en coordenadas. La estructura que produjo la maquetación se usó para calcular esas posiciones y luego se descartó, lo que significa que convertir un PDF a Markdown no es extracción sino deducción: leer la geometría hacia atrás y averiguar qué estructura la habría producido.
Todos los conversores hacen esto, el nuestro incluido, y ninguno puede hacer más que deducir: la respuesta no está en el archivo. En cuanto eso queda claro, los errores dejan de parecer arbitrarios. Un título que salió como párrafo estaba marcado con negrita y no con tamaño. Una tabla que se derrumbó tenía celdas combinadas. Una página que se lee como un sinsentido tenía dos columnas. Cada fallo se remonta a una regla, y una regla que conoces es una regla que puedes sortear.
Para eso están estas guías. La primera explica la deducción y sus modos de fallo al completo. La segunda trata del archivo que recibes y de las pocas ediciones que conviene hacer antes de guardarlo. La tercera y la cuarta tratan de dos destinos concretos — un almacén de notas y un pipeline de recuperación — que exigen cosas bastante distintas del mismo Markdown.