PDF em Markdown: como funciona e o que se preserva

Um PDF guarda glifos em coordenadas. Ele não guarda um título, nem uma lista, nem uma tabela, então toda a estrutura precisa ser deduzida dessa geometria. Esta página explica como essa dedução funciona, o que sobrevive a ela e em quais documentos ela falha.

5.0 em 5 com base em 23 avaliações

Solte seu PDF ou Word aqui

ou escolha um arquivo do seu computador

PDF ou Word (.docx) · até 50 MB

Como um conversor reconstrói títulos e listas de um PDF?

Ele mede a altura de fonte mais comum do documento, trata isso como o texto corrido e classifica todo o resto em relação a essa referência. Blocos maiores viram títulos; marcadores e recuo viram listas aninhadas.

O que se perde ao converter um PDF em Markdown?

Células mescladas, imagens, anotações e elementos de página não têm equivalente em Markdown. Um documento digitalizado não contém texto selecionável, então ele é detectado e avisado em vez de virar um arquivo vazio.

Como converter um PDF em Markdown

  1. 1

    Abra o conversor

    Acesse mypdf2md.com. Nada para instalar e nenhuma conta para criar.

  2. 2

    Adicione seu PDF

    Arraste o arquivo para a área de soltura ou clique para escolhê-lo no computador. Arquivos de até 50 MB são aceitos.

  3. 3

    Revise o Markdown

    O resultado aparece ao lado de uma pré-visualização ao vivo. Edite ali mesmo se algum título ou tabela precisar de ajuste.

  4. 4

    Copie ou baixe

    Copie o Markdown para a área de transferência ou baixe como arquivo .md, pronto para seu editor ou repositório.

O que o conversor reconstrói

Um PDF não guarda título, nem lista, nem tabela. Guarda glifos em coordenadas dentro de uma página. Toda a estrutura precisa ser deduzida dessa geometria, e é por isso que tantas ferramentas de PDF para texto devolvem um paredão de texto indiferenciado.

Este conversor mede a altura de fonte mais comum do documento, toma isso como referência do corpo de texto e classifica todo o resto em relação a ela.

  • Títulos, pelo tamanho de fonte em relação ao corpo de texto, mapeados de H1 a H4
  • Parágrafos, unindo linhas cujo espaço vertical corresponde a entrelinha e não a uma quebra
  • Listas com marcadores e numeradas, incluindo o aninhamento deduzido da profundidade do recuo
  • Tabelas, quando as células se alinham nas mesmas colunas em linhas consecutivas, geradas como tabelas GFM
  • Negrito, itálico e monoespaçado, a partir da fonte de cada trecho
  • Layouts de duas colunas, lendo a coluna esquerda inteira antes da direita, sem intercalar linha a linha

O que ele não consegue fazer

Documentos digitalizados não têm texto selecionável, apenas uma imagem do texto. Reconhecimento óptico de caracteres é outro problema, e esta ferramenta não o resolve. Se você enviar um documento digitalizado, verá um aviso em vez de um arquivo vazio sem explicação.

Layouts muito elaborados — páginas de revista, infográficos, texto contornando imagens em ângulo — vão perder parte da ordem de leitura. Documentos comuns como relatórios, artigos, notas fiscais, manuais e e-books convertem bem.

Imagens incorporadas ao PDF não são extraídas. O texto ao redor delas, sim.

Por que converter no navegador faz diferença

A maioria dos conversores online envia seu arquivo para os servidores deles, processa lá e devolve um link de download. Ou seja: seu documento ficou no disco de outra pessoa, por menos tempo que seja, sob uma política de privacidade que você não leu.

Esta ferramenta nunca faz essa requisição. O PDF é interpretado pelo PDF.js dentro de um Web Worker na sua própria máquina. Dá para conferir: abra a aba de rede do navegador durante uma conversão e você não verá nenhum upload. Até os arquivos do worker do PDF.js são servidos por este domínio, e não por uma CDN de terceiros, de modo que ninguém de fora fica sabendo sequer que você converteu algo.

Perguntas frequentes

Como são tratados os layouts de duas colunas?
A coluna da esquerda é lida por inteiro antes da direita, em vez de intercalar as duas linha a linha, como faria uma extração de texto puro.
Por que minha tabela virou parágrafos?
A detecção exige que as células se alinhem nas mesmas colunas em linhas consecutivas. Quando a estrutura vem de retângulos desenhados e não do alinhamento do texto, o conteúdo continua como parágrafos: uma tabela errada dá mais trabalho de limpar do que texto puro.
Cabeçalhos e rodapés repetidos são removidos?
Sim. Texto que se repete na mesma posição em várias páginas é tratado como elemento de página e descartado, para não interromper o corpo do documento.
Funciona com PDFs protegidos por senha?
Sim. A senha é solicitada e vai direto para o processador local; ela nunca é transmitida nem armazenada.
O que acontece com PDFs muito grandes?
Arquivos acima de 50 MB são recusados antes de qualquer processamento, e toda conversão que passar de 60 segundos é interrompida para a aba continuar respondendo.

Conversores relacionados

Further reading