El texto que ya está en el archivo
Casi todos los PDF llevan sus palabras como texto de verdad, no como imagen. Un archivo exportado desde Word, Google Docs, un sistema contable o un sitio web trae adentro una capa de texto, con sus caracteres, sus espacios y sus saltos de línea. Esta herramienta lee esa capa con pdf.js en nuestro propio servidor y la escribe como un archivo .txt plano en UTF-8.
Como no se reconoce, reescribe ni adivina nada, el resultado es exacto: las palabras que recibes son las que guarda el documento. La extracción termina en segundos incluso con unos cientos de páginas, y el archivo que descargas lleva el nombre del que subiste, así que contrato.pdf se convierte en contrato.txt.
Cuando un PDF no tiene texto que leer
Hay un límite honesto. Si el PDF es un escaneo o la foto de una página, contiene una imagen y nada más. No hay capa de texto que leer, así que esta herramienta no puede extraer nada y te lo dice claro en lugar de entregarte un archivo vacío.
Ese comportamiento es a propósito. Reconocer palabras dentro de una imagen es OCR, y el OCR cuesta dinero real por cada página procesada. Una herramienta gratuita nunca debería gastarlo en tu nombre sin avisar, así que nos detenemos y te mandamos al lugar correcto. Usa OCR de PDF para agregarle al escaneo una capa de texto buscable y regresa aquí, o usa PDF a Word, que lee los escaneos como parte de la conversión.
Para qué sirve el texto plano
- Citar un documento. Consigue una transcripción limpia de un reporte que necesitas citar.
- Alimentar otra herramienta. El texto plano es lo que quieren los índices de búsqueda, los scripts y las hojas de cálculo.
- Buscar y comparar. Dos archivos .txt se comparan línea por línea en cualquier editor.
- Copiar contenido bloqueado. Algunos visores desactivan la selección; la capa de texto sigue ahí.
¿Solo necesitas una parte del documento? Divide el PDF primero y extrae el texto de la sección que importa. Y si estás revisando un documento contra una versión anterior, Comparar PDF lo hace lado a lado.