Dieses Werkzeug holt den Text aus einem PDF und übergibt ihn Ihnen als bearbeitbares Dokument. Es nutzt PDF.js, um die Textobjekte zu lesen, die die Datei bereits enthält — jedes Zeichen mit seiner Position auf der Seite — und gruppiert sie anhand ihrer senkrechten Koordinaten wieder zu Zeilen. Das Ergebnis wird entweder als Word-kompatible .doc-Datei oder als reine .txt geschrieben.
Es lohnt sich, die Erwartungen genau zu setzen, denn „PDF zu Word" verspricht mehr, als irgendein Konverter halten kann. Ein PDF beschreibt, wo jede Glyphe auf einer Seite sitzt; es hält nicht fest, dass eine Textfolge eine Überschrift, eine Aufzählung, eine Tabellenzelle oder ein zweispaltiges Layout war. Diese Struktur zu rekonstruieren ist Raterei, und dieses Werkzeug versucht es nicht. Sie erhalten den Text in Lesereihenfolge als Absätze — einen sauberen Ausgangspunkt zum Neuschreiben statt einer originalgetreuen Kopie.
Der Text wird in Ihrem Browser extrahiert und das Dokument dort zusammengesetzt. Nichts wird hochgeladen, anders als bei Konvertierungsdiensten, denen Sie die Datei übergeben müssen.
.doc, die Word, Google Docs und LibreOffice öffnen. Reiner Text erzeugt eine .txt ganz ohne Formatierung.| Element | Ergebnis |
|---|---|
| Fließtext | Genau extrahiert, in Lesereihenfolge |
| Absatzumbrüche | Aus den Zeilenpositionen rekonstruiert |
| Seitenumbrüche | Erhalten |
| Überschriften und Formatvorlagen | Verloren — alles wird Fließtext |
| Tabellen | Zu Textzeilen verflacht |
| Bilder und Diagramme | Nicht enthalten |
| Spalten | In der internen Reihenfolge der Datei gelesen, was sich verschränken kann |
Ein gescanntes Dokument enthält Fotografien von Seiten, keine Textobjekte. Für dieses Werkzeug gibt es nichts zu extrahieren, und es meldet, dass kein Text gefunden wurde. Nutzen Sie stattdessen die Texterkennung, die die Zeichen optisch erkennt und eine Textdatei erzeugt, mit der Sie arbeiten können.
Den Unterschied erkennen Sie in jedem PDF-Betrachter: Versuchen Sie, einen Satz mit der Maus zu markieren. Erscheint eine Textmarke und werden Wörter hervorgehoben, funktioniert dieser Konverter. Bekommen Sie nur eine rechteckige Auswahl über die ganze Seite, ist es ein Scan.
Weil ein PDF Glyphenpositionen speichert und keine Dokumentstruktur. Es gibt keinen Vermerk, dass etwas eine Überschrift, eine Tabelle oder eine Aufzählung war, also kann kein Konverter das zuverlässig wiederherstellen. Dieses Werkzeug extrahiert den Text getreu und überlässt Ihnen die Formatierung.
Ihre Datei ist mit ziemlicher Sicherheit ein Scan — Seitenbilder ohne Textebene. Nutzen Sie die Texterkennung, die die Zeichen stattdessen optisch erkennt.
Nein. Tabellenzellen sind in einem PDF nur positionierter Text, sie kommen daher als gewöhnliche Zeilen heraus. Komplexe Tabellen müssen meist von Hand neu aufgebaut werden.
Die .doc behält Absatz- und Seitenumbrüche und öffnet sich in Word, Google Docs und LibreOffice. Die .txt ist reiner Text ganz ohne Struktur — nützlich zur Weitergabe an andere Software.
Nein. Nur die Textebene wird extrahiert. Brauchen Sie die Seiten als Bilder, nutzen Sie PDF zu JPG.
Nein. PDF.js liest den Text in Ihrem Browser, und die Ausgabedatei wird vor dem Herunterladen lokal zusammengesetzt.