Le texte qui se trouve déjà dans le fichier
La plupart des PDF portent leurs mots comme du vrai texte, et non comme une image. Un fichier exporté depuis Word, Google Docs, un logiciel de comptabilité ou un site web contient une couche de texte, avec les caractères, les espacements et les retours à la ligne. Cet outil lit cette couche avec pdf.js sur notre propre serveur et l’écrit dans un fichier .txt brut en UTF-8.
Comme rien n’est reconnu, réécrit ni deviné, le résultat est exact : les mots que vous obtenez sont ceux que le document stocke. L’extraction se termine en quelques secondes, même pour plusieurs centaines de pages, et le fichier que vous téléchargez porte le nom de celui que vous avez envoyé : contrat.pdf devient contrat.txt.
Quand un PDF n’a aucun texte à lire
Il y a une limite, et nous l’assumons. Si le PDF est une numérisation ou une photo de page, il contient une image et rien d’autre. Il n’y a pas de couche de texte à lire, cet outil ne peut donc rien extraire et le dit franchement plutôt que de vous remettre un fichier vide.
Ce comportement est délibéré. Reconnaître des mots à l’intérieur d’une image, c’est de l’OCR, et l’OCR coûte de l’argent pour chaque page traitée. Un outil gratuit ne devrait jamais dépenser cela en silence à votre place, nous nous arrêtons donc et vous indiquons le bon endroit. Utilisez OCR PDF pour ajouter une couche de texte interrogeable à la numérisation, puis revenez ici, ou utilisez PDF en Word, qui lit les numérisations dans le cadre de la conversion.
À quoi sert le texte brut
- Citer un document. Obtenir une transcription nette d’un rapport que vous devez citer.
- Alimenter un autre outil. Le texte brut est ce que veulent les index de recherche, les scripts et les tableurs.
- Chercher et comparer. Deux fichiers .txt se comparent ligne à ligne dans n’importe quel éditeur.
- Copier un contenu bloqué. Certaines visionneuses désactivent la sélection ; la couche de texte, elle, est bien là.
Vous n’avez besoin que d’une partie du document ? Divisez le PDF d’abord, puis extrayez le texte de la section qui compte. Si vous vérifiez un document par rapport à une version antérieure, Comparer PDF le fait côte à côte.