O texto que já está dentro do arquivo
A maioria dos PDFs carrega as palavras como texto de verdade, e não como imagem. Um arquivo exportado do Word, do Google Docs, de um sistema contábil ou de um site tem uma camada de texto por dentro, com caracteres, espaçamento e quebras de linha. Esta ferramenta lê essa camada com o pdf.js no nosso próprio servidor e a escreve em um arquivo .txt puro em UTF-8.
Como nada é reconhecido, reescrito nem adivinhado, o resultado é exato: as palavras que você recebe são as palavras que o documento guarda. A extração termina em segundos mesmo com algumas centenas de páginas, e o arquivo que você baixa leva o nome daquele que você enviou: contrato.pdf vira contrato.txt.
Quando o PDF não tem texto para ler
Existe um limite honesto. Se o PDF é uma digitalização ou a foto de uma página, ele contém uma imagem e mais nada. Não há camada de texto para ler, então esta ferramenta não consegue extrair coisa alguma e diz isso com todas as letras, em vez de te entregar um arquivo vazio.
Esse comportamento é proposital. Reconhecer palavras dentro de uma imagem é OCR, e o OCR custa dinheiro de verdade a cada página processada. Uma ferramenta grátis nunca deveria gastar isso por você sem avisar, então a gente para e aponta o lugar certo. Use o OCR em PDF para acrescentar uma camada de texto pesquisável à digitalização e depois volte aqui, ou use o PDF para Word, que lê digitalizações como parte da conversão.
Para que serve o texto puro
- Citar um documento. Uma transcrição limpa do relatório que você precisa citar.
- Alimentar outra ferramenta. Texto puro é o que índices de busca, scripts e planilhas querem.
- Buscar e comparar. Dois arquivos .txt podem ser comparados linha a linha em qualquer editor.
- Copiar conteúdo bloqueado. Alguns leitores desativam a seleção; a camada de texto continua lá.
Precisa só de um trecho do documento? Divida o PDF primeiro e extraia o texto da parte que importa. Se você está conferindo um documento contra uma versão anterior, o Comparar PDF faz isso lado a lado.