Der Text, der ohnehin schon in der Datei steht
Die meisten PDFs führen ihre Wörter als echten Text mit sich und nicht als Bild. Eine Datei, die aus Word, Google Docs, einem Buchhaltungssystem oder einer Website exportiert wurde, enthält eine Textebene, komplett mit Zeichen, Abständen und Zeilenumbrüchen. Dieses Tool liest diese Ebene mit pdf.js auf unserem eigenen Server aus und schreibt sie als reine .txt-Datei in UTF-8 heraus.
Weil nichts erkannt, umgeschrieben oder erraten wird, ist das Ergebnis exakt: Die Wörter, die Sie bekommen, sind die Wörter, die das Dokument speichert. Die Extraktion ist selbst bei einigen hundert Seiten in Sekunden fertig, und die heruntergeladene Datei trägt den Namen der hochgeladenen, aus vertrag.pdf wird also vertrag.txt.
Wenn ein PDF keinen Text zum Auslesen hat
Es gibt eine ehrliche Grenze. Ist das PDF ein Scan oder ein Foto einer Seite, enthält es ein Bild und sonst nichts. Es gibt keine Textebene zum Auslesen, dieses Tool kann also nichts extrahieren und sagt das klar, statt Ihnen eine leere Datei in die Hand zu drücken.
Dieses Verhalten ist Absicht. Wörter in einem Bild zu erkennen ist OCR, und OCR kostet für jede verarbeitete Seite echtes Geld. Ein kostenloses Tool sollte das niemals still in Ihrem Namen ausgeben, deshalb halten wir an und verweisen Sie stattdessen an die richtige Stelle. Mit OCR PDF legen Sie eine durchsuchbare Textebene auf den Scan und kommen dann hierher zurück, oder Sie nehmen PDF in Word, das Scans als Teil der Umwandlung liest.
Wofür der reine Text gut ist
- Ein Dokument zitieren. Eine saubere Abschrift eines Berichts, den Sie belegen müssen.
- Ein anderes Tool füttern. Reinen Text wollen Suchindizes, Skripte und Tabellenkalkulationen.
- Suchen und vergleichen. Zwei .txt-Dateien lassen sich in jedem Editor Zeile für Zeile vergleichen.
- Gesperrte Inhalte kopieren. Manche Anzeigeprogramme unterbinden das Markieren; die Textebene ist trotzdem da.
Sie brauchen nur einen Teil des Dokuments? Teilen Sie das PDF zuerst und extrahieren Sie den Text aus dem Abschnitt, auf den es ankommt. Wenn Sie ein Dokument gegen eine frühere Fassung prüfen, macht PDF vergleichen das nebeneinander.