Optische Zeichenerkennung liest Text aus Bildern von Text. Ein gescannter Vertrag, ein abfotografierter Beleg, ein Screenshot einer Fehlermeldung — alle sehen aus wie Dokumente, enthalten aber keinen Text, den ein Computer markieren, durchsuchen oder kopieren könnte. Die Texterkennung untersucht die Form der Buchstaben und rekonstruiert die Zeichen.
Dieses Werkzeug führt Tesseract aus, die seit Langem etablierte quelloffene Erkennungs-Engine, kompiliert nach WebAssembly, sodass sie in Ihrem Browser statt auf einem Server läuft. PDF-Seiten werden vor der Erkennung mit doppelter nativer Größe gerendert, denn die Auflösung ist der mit Abstand wichtigste Faktor für die Genauigkeit. Das Ergebnis ist eine reine Textdatei, in der die Seiten durch eine Markierung getrennt sind.
Die Erkennung läuft auf Ihrem eigenen Rechner. Das ist bei Texterkennung ungewöhnlich — die meisten Dienste verlangen einen Upload — und bedeutet, dass Gehaltsabrechnungen, Arztbriefe und Ausweisdokumente gelesen werden können, ohne übertragen zu werden.
.txt-Datei, in der die Seiten durch nummerierte Trenner getrennt sind.| Faktor | Auswirkung auf das Ergebnis |
|---|---|
| Auflösung der Vorlage | Der wichtigste Faktor. Ein 300-dpi-Scan liest sich zuverlässig; ein 100-dpi-Scan rät. |
| Geradheit | Mehr als zwei Grad Schräglage kosten schnell Genauigkeit. |
| Kontrast | Schwarz auf Weiß ist ideal. Blasse Fotokopien und farbige Hintergründe schaden. |
| Schriftart | Gewöhnliche Druckschrift ist zuverlässig. Handschrift wird nicht unterstützt. |
| Layout | Einspaltiger Text fließt sauber. Mehrspaltige Layouts und Tabellen verlieren ihre Struktur. |
Der Automatikmodus kombiniert die Sprache der Seite, auf der Sie sich befinden, mit Englisch: Ein koreanisches Dokument wird als Koreanisch plus Englisch erkannt, ein japanisches als Japanisch plus Englisch und so weiter. Diese Kombination deckt den häufigen realen Fall ab, dass ein Dokument in einer Sprache englische Produktnamen, Adressen oder Fachbegriffe enthält.
Jedes Sprachmodell ist ein eigener Download von mehreren Megabyte, der beim ersten Einsatz geholt und danach vom Browser zwischengespeichert wird. Der erste Durchlauf in einer neuen Sprache dauert daher spürbar länger als der zweite.
Nein, und genau darum geht es. Tesseract ist nach WebAssembly kompiliert und läuft in Ihrem Browser-Tab. Ihre Scans werden nie hochgeladen, was das Werkzeug für Dokumente sicher macht, die Sie keinem Onlinedienst anvertrauen würden.
Bei einem sauberen, geraden 300-dpi-Scan gewöhnlicher Druckschrift ist die Genauigkeit hoch — typischerweise deutlich über 95 Prozent. Blasse Fotokopien, schräge Seiten, niedrig aufgelöste Fotos und ungewöhnliche Schriftarten senken sie merklich.
Nein. Tesseract ist auf Druckschrift trainiert. Handgeschriebene Notizen, Unterschriften und Schreibschrift werden nicht erkannt.
Eine reine UTF-8-Textdatei. Die Seiten werden durch eine nummerierte Markierung getrennt. Layout, Spalten, Tabellen und Bilder bleiben nicht erhalten.
Das Sprachmodell muss heruntergeladen werden, mehrere Megabyte. Danach ist es zwischengespeichert, weitere Dokumente derselben Sprache starten also sofort.
Nein. Die Ausgabe ist eine eigene Textdatei und keine wieder ins PDF eingefügte Textebene. Nutzen Sie sie zum Suchen, Zitieren oder zur Weitergabe an ein anderes System.