Texterkennung (OCR)

PDF- oder Bilddateien hinzufügen — oder hierher ziehen
PDF JPG PNG WEBP

Über dieses Werkzeug zur Texterkennung

Optische Zeichenerkennung liest Text aus Bildern von Text. Ein gescannter Vertrag, ein abfotografierter Beleg, ein Screenshot einer Fehlermeldung — alle sehen aus wie Dokumente, enthalten aber keinen Text, den ein Computer markieren, durchsuchen oder kopieren könnte. Die Texterkennung untersucht die Form der Buchstaben und rekonstruiert die Zeichen.

Dieses Werkzeug führt Tesseract aus, die seit Langem etablierte quelloffene Erkennungs-Engine, kompiliert nach WebAssembly, sodass sie in Ihrem Browser statt auf einem Server läuft. PDF-Seiten werden vor der Erkennung mit doppelter nativer Größe gerendert, denn die Auflösung ist der mit Abstand wichtigste Faktor für die Genauigkeit. Das Ergebnis ist eine reine Textdatei, in der die Seiten durch eine Markierung getrennt sind.

Die Erkennung läuft auf Ihrem eigenen Rechner. Das ist bei Texterkennung ungewöhnlich — die meisten Dienste verlangen einen Upload — und bedeutet, dass Gehaltsabrechnungen, Arztbriefe und Ausweisdokumente gelesen werden können, ohne übertragen zu werden.

So extrahieren Sie Text mit Texterkennung

  1. PDF oder Bilder hinzufügen. Scans, Fotografien und Screenshots funktionieren alle. Neben PDF werden JPG, PNG, WebP und HEIC angenommen.
  2. Sprache wählen. Die automatische Einstellung nutzt Ihre Seitensprache plus Englisch, was gemischte Dokumente gut abdeckt. Erzwingen Sie Englisch, wenn das Dokument rein englisch ist.
  3. Erkennung starten. Das Sprachmodell wird beim ersten Einsatz geladen und danach zwischengespeichert. Die Erkennung braucht einige Sekunden je Seite und zeigt einen laufenden Zähler.
  4. Text herunterladen. Das Ergebnis ist eine UTF-8-.txt-Datei, in der die Seiten durch nummerierte Trenner getrennt sind.

Was die Genauigkeit bestimmt

FaktorAuswirkung auf das Ergebnis
Auflösung der VorlageDer wichtigste Faktor. Ein 300-dpi-Scan liest sich zuverlässig; ein 100-dpi-Scan rät.
GeradheitMehr als zwei Grad Schräglage kosten schnell Genauigkeit.
KontrastSchwarz auf Weiß ist ideal. Blasse Fotokopien und farbige Hintergründe schaden.
SchriftartGewöhnliche Druckschrift ist zuverlässig. Handschrift wird nicht unterstützt.
LayoutEinspaltiger Text fließt sauber. Mehrspaltige Layouts und Tabellen verlieren ihre Struktur.

Sprachen

Der Automatikmodus kombiniert die Sprache der Seite, auf der Sie sich befinden, mit Englisch: Ein koreanisches Dokument wird als Koreanisch plus Englisch erkannt, ein japanisches als Japanisch plus Englisch und so weiter. Diese Kombination deckt den häufigen realen Fall ab, dass ein Dokument in einer Sprache englische Produktnamen, Adressen oder Fachbegriffe enthält.

Jedes Sprachmodell ist ein eigener Download von mehreren Megabyte, der beim ersten Einsatz geholt und danach vom Browser zwischengespeichert wird. Der erste Durchlauf in einer neuen Sprache dauert daher spürbar länger als der zweite.

Häufige Fragen

Läuft die Texterkennung auf einem Server?

Nein, und genau darum geht es. Tesseract ist nach WebAssembly kompiliert und läuft in Ihrem Browser-Tab. Ihre Scans werden nie hochgeladen, was das Werkzeug für Dokumente sicher macht, die Sie keinem Onlinedienst anvertrauen würden.

Wie genau ist es?

Bei einem sauberen, geraden 300-dpi-Scan gewöhnlicher Druckschrift ist die Genauigkeit hoch — typischerweise deutlich über 95 Prozent. Blasse Fotokopien, schräge Seiten, niedrig aufgelöste Fotos und ungewöhnliche Schriftarten senken sie merklich.

Kann es Handschrift lesen?

Nein. Tesseract ist auf Druckschrift trainiert. Handgeschriebene Notizen, Unterschriften und Schreibschrift werden nicht erkannt.

Welches Format hat die Ausgabe?

Eine reine UTF-8-Textdatei. Die Seiten werden durch eine nummerierte Markierung getrennt. Layout, Spalten, Tabellen und Bilder bleiben nicht erhalten.

Warum ist der erste Durchlauf so langsam?

Das Sprachmodell muss heruntergeladen werden, mehrere Megabyte. Danach ist es zwischengespeichert, weitere Dokumente derselben Sprache starten also sofort.

Entsteht ein durchsuchbares PDF?

Nein. Die Ausgabe ist eine eigene Textdatei und keine wieder ins PDF eingefügte Textebene. Nutzen Sie sie zum Suchen, Zitieren oder zur Weitergabe an ein anderes System.

Verwandte Werkzeuge