Sobre o My PDF 2 MD
Última revisão
O My PDF 2 MD converte documentos PDF em Markdown sem enviá-los a lugar nenhum. Esta página explica quem mantém o serviço, como a conversão funciona, onde ela falha e como se sustenta uma ferramenta gratuita que nunca recebe os seus arquivos.
Quem mantém este site
O My PDF 2 MD é desenvolvido e operado pela MyPDF2MD.com, um projeto de software independente sediado em Kozhikode, Kerala, India. Não há fundo de investimento por trás, não é a fachada de uma API de processamento de documentos e nada do que você converte é revendido.
O site é tocado por uma equipe pequena. Não existe fila de atendimento atrás de um chatbot: o e-mail chega a uma pessoa. Dúvidas gerais vão para support@mypdf2md.com; qualquer assunto de dados pessoais vai para privacy@mypdf2md.com. Os dois são respondidos em até cinco dias úteis, e a página de contato tem um formulário se você preferir não escrever um e-mail.
Por que ele existe
Quase toda ferramenta de PDF para Markdown na web funciona do mesmo jeito: você envia o documento para um servidor sobre o qual não sabe nada, ele é processado lá, e pedem que você confie em uma frase de uma política de privacidade sobre o que aconteceu depois. Para um cardápio, tudo bem. Para um contrato assinado, um laudo médico, uma ata de reunião ou um manuscrito inédito, é uma troca que quase ninguém faria sabendo o que está fazendo.
A tecnologia que dispensa essa troca está nos navegadores há anos. O PDF.js, o motor de PDF da Mozilla, roda dentro da própria página e consegue ler um documento sem que nenhuma parte dele atravesse a rede. O que faltava não era capacidade, e sim uma ferramenta construída em torno dela. Por isso esta converte na sua máquina por padrão, e a promessa de privacidade da página inicial descreve uma arquitetura em vez de prometer bom comportamento.
Essa decisão tem um custo, e vale dizer sem rodeios: uma aba de navegador tem menos memória e menos processamento que um servidor, então documentos muito longos ou muito complexos demoram mais aqui do que demorariam em um serviço hospedado. Achamos que é a troca certa justamente para os documentos que preocupam.
Como a conversão realmente funciona
Esta é a parte que a maioria dos conversores descreve como mágica, e vale entender porque ela explica os erros que a ferramenta comete.
Um PDF não contém títulos, parágrafos, listas nem tabelas. Contém glifos em coordenadas. Quando um editor de texto exporta um PDF, a estrutura semântica do documento original — este trecho é um título de nível dois, estas linhas formam um parágrafo, estas células formam uma tabela — é descartada e substituída por instruções para desenhar marcas em uma página. Converter um PDF em Markdown é deduzir essa estrutura de volta a partir da geometria, e deduzir não é extrair.
O conversor começa encontrando a altura do texto corrido: a altura de fonte mais frequente no documento, ponderada por quantos caracteres estão compostos nela. Todo o resto é medido em múltiplos dessa unidade, e é isso que torna o resultado independente de o documento estar em 9 ou em 14 pontos.
A partir daí as regras são geométricas. Trechos que compartilham a linha de base dentro de cerca de um terço da altura do corpo formam uma linha. Linhas consecutivas separadas por no máximo uma altura e meia formam um parágrafo. Um trecho visivelmente maior que o corpo — a partir de mais ou menos 1,2 vez — é um título, e o quanto maior decide se vira H1, H2 ou H3. Duas ou mais linhas consecutivas cujas células se alinham em pelo menos duas posições horizontais compartilhadas formam uma tabela. Um vão vertical perto do meio da página divide-a em colunas, para que a ordem de leitura não fique em ziguezague. Cabeçalhos e rodapés que se repetem na mesma posição página após página são detectados e removidos.
A formatação em linha é lida da própria fonte em vez de adivinhada: negrito e itálico vêm do peso e da inclinação reais da fonte, e trechos monoespaçados viram código. Links embutidos no PDF são preservados como links de Markdown.
Onde ele erra
Como a estrutura é deduzida, a ferramenta tem falhas previsíveis, e preferimos listá-las a deixar que você as descubra num documento que importava.
- Um documento que marca títulos só pelo negrito, sem mudar o tamanho, não dá nada ao detector de títulos — esses títulos saem como parágrafos comuns.
- Tabelas com células mescladas, tabelas aninhadas ou células cujo conteúdo quebra em várias linhas perdem o alinhamento, porque o detector de colunas trabalha com posições horizontais e a mesclagem quebra a grade.
- Layouts de várias colunas mais elaborados que uma divisão simples em duas — uma página de revista com destaques e boxes laterais — podem produzir uma ordem de leitura embaralhada.
- Notação matemática não é convertida para LaTeX. Fórmulas compostas como texto chegam como os caracteres que as formam; fórmulas inseridas como imagem não chegam.
- Imagens não são extraídas. A saída é texto e estrutura.
- Um documento digitalizado não tem nenhum texto selecionável, então a conversão no navegador não produz nada a partir dele. Esse caso é tratado à parte, pelo reconhecimento opcional descrito abaixo.
A única coisa que sai do seu dispositivo
Uma digitalização é uma fotografia de página. Não há texto ali dentro para ler, então nenhuma análise no navegador vai produzir algum. Lê-la exige reconhecimento óptico de caracteres, que precisa de muito mais processamento do que uma aba pode oferecer.
Para esse caso, e só para ele, você pode nos pedir para reconhecer um documento no nosso servidor. Nunca é automático. A ferramenta detecta que o arquivo não tem texto selecionável, avisa, e oferece o reconhecimento como uma escolha que você precisa confirmar: uma caixa de diálogo informa quantas páginas serão enviadas, para onde vão e por quanto tempo ficam, antes que qualquer coisa seja transmitida.
O reconhecimento roda na nossa própria infraestrutura, com o nosso próprio motor. O arquivo fica em memória durante o trabalho e é destruído ao terminar; nada é gravado em disco e nenhum terceiro o recebe. O que guardamos é um registro de uso — número de páginas, data e hora, idioma do reconhecimento e o seu ID de conta ou um hash com sal do seu IP — que existe para aplicar o limite diário e detectar abuso, não contém nenhuma parte do seu documento e é apagado depois de trinta dias.
O resultado do reconhecimento é uma estimativa, não uma transcrição. Ele confunde caracteres, principalmente em nomes, números, datas e códigos de referência, e as palavras que não consegue ler são descartadas em vez de sinalizadas. O resultado é marcado como tal, com a pontuação de confiança do próprio motor e a lista das páginas de que ele menos teve certeza. Não lê escrita à mão e não converte fórmulas matemáticas.
Como uma ferramenta gratuita se paga
O conversor web é gratuito, não pede cadastro e exibe publicidade. Achamos mais honesto dizer isso na página do que deixar você descobrir, então: este site ganha dinheiro com anúncios e não ganha dinheiro com os seus documentos.
E nem poderia, o que é o propósito da arquitetura e não uma política que pedimos que você acredite. Um arquivo convertido no seu navegador nunca chega até nós. Não existe aqui um acervo de PDFs enviados para minerar, treinar ou vender, porque não há envio.
A publicidade só é carregada depois que você consente. Recuse a categoria de publicidade no aviso de cookies e nenhum script de anúncio é carregado — não um script que mostra menos anúncios: nenhum. O mesmo vale para a análise de uso. As duas categorias ficam desligadas até você ligá-las, e o rodapé tem um link para mudar de ideia depois.
Nenhuma página deste site pede que você pague por nada: não há o que comprar, nenhum plano para o qual subir e nenhuma conta para criar.
O que não fazemos
- Não enviamos os documentos convertidos no navegador — não existe caminho de código capaz disso.
- Não exigimos conta, endereço de e-mail nem login para usar o conversor web.
- Não armazenamos, indexamos, treinamos com nem vendemos qualquer documento ou saída convertida.
- Não carregamos publicidade nem análise de uso antes do seu consentimento àquela categoria.
- Não reivindicamos nenhum direito sobre os documentos que você converte nem sobre o Markdown que recebe.
Como foi construído
Para quem prefere os detalhes concretos às garantias:
| Leitura do PDF | PDF.js, rodando em um Web Worker no seu navegador |
|---|---|
| Detecção de estrutura | Analisador espacial próprio sobre trechos de texto posicionados |
| Formato de saída | GitHub Flavored Markdown, com tabelas de barras verticais |
| Aplicação | Next.js com App Router, React e TypeScript |
| Idiomas da interface | 10, com suporte da direita para a esquerda em árabe |
| Tamanho máximo | 50 MB |
| Preço | Gratuito, mantido por publicidade, sem conta |
| Operado por | MyPDF2MD.com, Kozhikode, Kerala, India |
Correções
Se algo neste site estiver errado — um erro factual num guia, uma conversão que falha de um jeito que não descrevemos, uma afirmação desta página que não corresponde ao que a ferramenta faz — escreva para support@mypdf2md.com e nós corrigimos e dizemos o que mudou. A data no topo desta página é a da última verificação do conteúdo contra o produto.