Converter um PDF digitalizado em Markdown

Uma página digitalizada é uma fotografia do texto, então um conversor comum não encontra nada para converter. Esta ferramenta reconhece as palavras da imagem. Diferente de todo o resto deste site, ela funciona enviando as páginas ao nosso servidor: você é informado exatamente do que será enviado e precisa confirmar antes que qualquer coisa saia do seu dispositivo.

5.0 em 5 com base em 23 avaliações

Solte seu PDF ou Word aqui

ou escolha um arquivo do seu computador

PDF ou Word (.docx) · até 50 MB

Como converto um PDF digitalizado em Markdown?

Solte a digitalização nesta página. Ela é verificada primeiro no seu navegador e, se não houver camada de texto, o reconhecimento é oferecido. Ao confirmar, as páginas são lidas no nosso servidor e voltam convertidas em Markdown.

Meu arquivo digitalizado é enviado?

Sim, e só esta ferramenta faz isso. As páginas vão para o nosso próprio servidor, ficam em memória enquanto são lidas e são destruídas ao fim do trabalho. Nada é gravado em disco e nenhuma outra empresa as recebe.

Como converter um PDF digitalizado em Markdown

  1. 1

    Adicione seu PDF digitalizado

    Arraste o arquivo para a caixa acima ou escolha-o no seu dispositivo. Ele é inspecionado primeiro no navegador, então um PDF que já tenha camada de texto é convertido aqui sem ser enviado a lugar nenhum.

  2. 2

    Escolha o idioma

    Selecione o idioma em que o documento está escrito. A precisão do reconhecimento depende muito disso, e escolher errado é a causa mais comum de um resultado ruim.

  3. 3

    Confirme o envio

    É mostrado o que será enviado, para onde vai e por quanto tempo permanece. Nada é transmitido até você apertar o botão, e recusar deixa você exatamente onde estava.

  4. 4

    Confira o resultado

    O Markdown aparece no editor junto com uma nota sobre a confiança do reconhecimento. Confira nomes, números e datas com o original antes de confiar neles.

O que é de fato um PDF digitalizado

Existem dois tipos de PDF que na tela parecem idênticos. Um guarda os caracteres, então o texto pode ser selecionado, pesquisado e copiado. O outro guarda uma fotografia da página, vinda de um scanner de mesa, da câmera de um celular ou de um fax, e não contém caractere algum.

Nosso conversor comum lê o primeiro tipo direto no seu navegador e não envia o arquivo a lugar nenhum. Diante do segundo ele não encontra nada, e está certo: é por isso que digitalizações precisam de outra ferramenta, e não de uma versão melhor da mesma.

Dá para distinguir sem nenhum programa: abra o PDF e tente selecionar uma linha de texto com o cursor. Se nada for destacado, é uma digitalização.

Por que esta página envia o arquivo e as outras não

O reconhecimento óptico precisa rasterizar cada página em alta resolução e rodar um motor de reconhecimento sobre a imagem. Fazer isso no navegador é possível, mas lento, pesado em memória e visivelmente menos preciso; num celular intermediário, de onde vem a maioria dos documentos fotografados, não é uma opção realista.

Por isso apenas esta ferramenta envia as páginas a um servidor. Nós a construímos para preservar o máximo possível da promessa original: o reconhecimento roda no nosso próprio hardware com o nosso próprio motor, então nenhum terceiro recebe seu documento, e o serviço não tem banco de dados, nem armazenamento de objetos, nem disco gravável onde guardá-lo. As páginas existem em memória enquanto dura o trabalho e depois somem.

O consentimento é pedido para cada arquivo, todas as vezes, e nunca é lembrado. Se você recusar, nada é enviado e o resto do site se comporta exatamente como sempre.

O que o reconhecimento faz bem e o que não faz

Uma digitalização limpa a 300 dpi de texto impresso é reconhecida com muita precisão. Uma foto tirada em ângulo, com pouca luz, ou de um fax desbotado sai bem pior: o reconhecimento é uma estimativa estatística, não uma transcrição.

Vale conhecer dois modos de falha porque eles não aparecem no resultado. Caracteres são lidos errado, com mais frequência em nomes, códigos de referência e números longos, onde não há palavra ao redor para corrigir. E as palavras que o motor não consegue ler são descartadas, então o texto pode faltar em vez de estar errado. O resultado informa a pontuação de confiança e aponta as páginas com nota baixa.

  • Texto impresso nos idiomas suportados: confiável numa digitalização limpa
  • Títulos, parágrafos e listas: reconstruídos a partir da posição e do tamanho das palavras reconhecidas
  • Tabelas: muitas vezes recuperadas, mas confira o alinhamento das colunas
  • Escrita à mão: não suportada
  • Fórmulas matemáticas: não suportadas
  • Imagens e diagramas: não são extraídos

Como obter um resultado melhor

Digitalize a 300 dpi em vez de 150 se puder escolher; é a maior diferença isolada entre um bom resultado e um mediano. Fotografe as páginas planas e com luz uniforme, não em ângulo. E ajuste o idioma corretamente: um motor em inglês lendo um documento em alemão vai produzir bobagem com toda a confiança.

Perguntas frequentes

Meu documento digitalizado fica armazenado no servidor de vocês?
Não. Ele fica em memória enquanto está sendo lido e é destruído quando o trabalho termina ou falha. O serviço de reconhecimento não tem banco de dados nem armazenamento de arquivos, então não há onde guardá-lo.
Vocês enviam meu documento ao Google ou a outro serviço de OCR?
Não. O reconhecimento roda no nosso próprio servidor com o nosso próprio motor. Usar esta ferramenta não acrescenta nenhuma empresa à lista de operadores da nossa Política de Privacidade.
Quais idiomas ele consegue reconhecer?
Inglês, alemão, espanhol, francês, português, híndi, japonês, coreano, chinês simplificado e árabe. Escolha o idioma do documento antes de confirmar, porque a precisão depende disso.
Ele consegue ler escrita à mão?
Não. O motor é treinado em texto impresso. Anotações manuscritas, assinaturas e comentários à mão não serão reconhecidos, e preferimos dizer isso a deixar você descobrir pelo resultado.
Quantas páginas posso reconhecer de graça?
Há uma cota diária de páginas e um limite por documento, ambos exibidos antes de você confirmar. Eles existem porque o reconhecimento consome tempo real de processamento, ao contrário do conversor no navegador.
Dá para converter uma digitalização sem enviá-la?
Na web, não. Se o seu PDF na verdade tiver camada de texto, o conversor comum o processa no navegador; mas uma digitalização de fato exige o reconhecimento no servidor.

Conversores relacionados

Further reading