PDF em Markdown: como funciona e o que se preserva
Um PDF guarda glifos em coordenadas. Ele não guarda um título, nem uma lista, nem uma tabela, então toda a estrutura precisa ser deduzida dessa geometria. Esta página explica como essa dedução funciona, o que sobrevive a ela e em quais documentos ela falha.
Solte seu PDF ou Word aqui
ou escolha um arquivo do seu computador
PDF ou Word (.docx) · até 50 MB
Como um conversor reconstrói títulos e listas de um PDF?
Ele mede a altura de fonte mais comum do documento, trata isso como o texto corrido e classifica todo o resto em relação a essa referência. Blocos maiores viram títulos; marcadores e recuo viram listas aninhadas.
O que se perde ao converter um PDF em Markdown?
Células mescladas, imagens, anotações e elementos de página não têm equivalente em Markdown. Um documento digitalizado não contém texto selecionável, então ele é detectado e avisado em vez de virar um arquivo vazio.
Como converter um PDF em Markdown
- 1
Abra o conversor
Acesse mypdf2md.com. Nada para instalar e nenhuma conta para criar.
- 2
Adicione seu PDF
Arraste o arquivo para a área de soltura ou clique para escolhê-lo no computador. Arquivos de até 50 MB são aceitos.
- 3
Revise o Markdown
O resultado aparece ao lado de uma pré-visualização ao vivo. Edite ali mesmo se algum título ou tabela precisar de ajuste.
- 4
Copie ou baixe
Copie o Markdown para a área de transferência ou baixe como arquivo .md, pronto para seu editor ou repositório.
O que o conversor reconstrói
Um PDF não guarda título, nem lista, nem tabela. Guarda glifos em coordenadas dentro de uma página. Toda a estrutura precisa ser deduzida dessa geometria, e é por isso que tantas ferramentas de PDF para texto devolvem um paredão de texto indiferenciado.
Este conversor mede a altura de fonte mais comum do documento, toma isso como referência do corpo de texto e classifica todo o resto em relação a ela.
- Títulos, pelo tamanho de fonte em relação ao corpo de texto, mapeados de H1 a H4
- Parágrafos, unindo linhas cujo espaço vertical corresponde a entrelinha e não a uma quebra
- Listas com marcadores e numeradas, incluindo o aninhamento deduzido da profundidade do recuo
- Tabelas, quando as células se alinham nas mesmas colunas em linhas consecutivas, geradas como tabelas GFM
- Negrito, itálico e monoespaçado, a partir da fonte de cada trecho
- Layouts de duas colunas, lendo a coluna esquerda inteira antes da direita, sem intercalar linha a linha
O que ele não consegue fazer
Documentos digitalizados não têm texto selecionável, apenas uma imagem do texto. Reconhecimento óptico de caracteres é outro problema, e esta ferramenta não o resolve. Se você enviar um documento digitalizado, verá um aviso em vez de um arquivo vazio sem explicação.
Layouts muito elaborados — páginas de revista, infográficos, texto contornando imagens em ângulo — vão perder parte da ordem de leitura. Documentos comuns como relatórios, artigos, notas fiscais, manuais e e-books convertem bem.
Imagens incorporadas ao PDF não são extraídas. O texto ao redor delas, sim.
Por que converter no navegador faz diferença
A maioria dos conversores online envia seu arquivo para os servidores deles, processa lá e devolve um link de download. Ou seja: seu documento ficou no disco de outra pessoa, por menos tempo que seja, sob uma política de privacidade que você não leu.
Esta ferramenta nunca faz essa requisição. O PDF é interpretado pelo PDF.js dentro de um Web Worker na sua própria máquina. Dá para conferir: abra a aba de rede do navegador durante uma conversão e você não verá nenhum upload. Até os arquivos do worker do PDF.js são servidos por este domínio, e não por uma CDN de terceiros, de modo que ninguém de fora fica sabendo sequer que você converteu algo.
Perguntas frequentes
- Como são tratados os layouts de duas colunas?
- A coluna da esquerda é lida por inteiro antes da direita, em vez de intercalar as duas linha a linha, como faria uma extração de texto puro.
- Por que minha tabela virou parágrafos?
- A detecção exige que as células se alinhem nas mesmas colunas em linhas consecutivas. Quando a estrutura vem de retângulos desenhados e não do alinhamento do texto, o conteúdo continua como parágrafos: uma tabela errada dá mais trabalho de limpar do que texto puro.
- Cabeçalhos e rodapés repetidos são removidos?
- Sim. Texto que se repete na mesma posição em várias páginas é tratado como elemento de página e descartado, para não interromper o corpo do documento.
- Funciona com PDFs protegidos por senha?
- Sim. A senha é solicitada e vai direto para o processador local; ela nunca é transmitida nem armazenada.
- O que acontece com PDFs muito grandes?
- Arquivos acima de 50 MB são recusados antes de qualquer processamento, e toda conversão que passar de 60 segundos é interrompida para a aba continuar respondendo.
Conversores relacionados
Further reading
- Por que a estrutura se perdePDFs guardam glifos posicionados, não estrutura. Entender isso explica todo erro de conversão que você vai encontrar.8 min read
- Limpar o Markdown convertidoO que o conversor emite, quais recursos do Markdown sobrevivem à viagem e as poucas passadas de limpeza que valem sempre.7 min read