Reconnaissance de texte (OCR)

Ajoutez des fichiers PDF ou image — ou glissez-les ici
PDF JPG PNG WEBP

À propos de cet outil de reconnaissance de texte

La reconnaissance optique de caractères lit du texte à partir d'images de texte. Un contrat numérisé, un reçu photographié, une capture d'un message d'erreur : tous ressemblent à des documents mais ne contiennent aucun texte qu'un ordinateur puisse sélectionner, rechercher ou copier. L'OCR examine la forme des lettres et reconstitue les caractères.

Cet outil exécute Tesseract, le moteur OCR libre de référence, compilé en WebAssembly afin de s'exécuter dans votre navigateur plutôt que sur un serveur. Les pages PDF sont rendues au double de leur taille native avant reconnaissance, car la résolution est de loin le premier facteur de précision. Le résultat est un fichier texte brut, les pages étant séparées par un repère.

La reconnaissance a lieu sur votre propre machine. C'est inhabituel pour de l'OCR — la plupart des services imposent un téléversement — et cela signifie que bulletins de paie, courriers médicaux et pièces d'identité peuvent être lus sans être transmis.

Comment extraire du texte avec l'OCR

  1. Ajoutez un PDF ou des images. Numérisations, photographies et captures d'écran conviennent. JPG, PNG, WebP et HEIC sont acceptés en plus du PDF.
  2. Choisissez la langue. Le réglage automatique combine la langue de votre page et l'anglais, ce qui gère bien les documents mixtes. Forcez l'anglais si le document est purement anglophone.
  3. Lancez la reconnaissance. Le modèle de langue est téléchargé à la première utilisation puis mis en cache. Comptez quelques secondes par page, avec un compteur de progression.
  4. Téléchargez le texte. Le résultat est un fichier .txt en UTF-8, les pages étant séparées par des repères numérotés.

Ce qui détermine la précision

FacteurEffet sur les résultats
Résolution sourceLe facteur dominant. Une numérisation à 300 ppp est fiable ; à 100 ppp, le moteur devine.
DroitureAu-delà de deux degrés d'inclinaison, la précision chute rapidement.
ContrasteNoir sur blanc est idéal. Photocopies pâles et fonds colorés nuisent.
TypographieLe texte imprimé courant est fiable. L'écriture manuscrite n'est pas prise en charge.
Mise en pageUne colonne unique s'enchaîne proprement. Colonnes multiples et tableaux perdent leur structure.

Langues

Le mode automatique associe la langue de la page où vous vous trouvez et l'anglais : un document coréen est reconnu en coréen plus anglais, un document japonais en japonais plus anglais, et ainsi de suite. Cette combinaison couvre le cas réel courant d'un document dans une langue contenant des noms de produits, adresses ou termes techniques en anglais.

Chaque modèle de langue est un téléchargement distinct de plusieurs mégaoctets, récupéré à la première utilisation puis mis en cache par le navigateur. La première exécution dans une nouvelle langue prend donc sensiblement plus de temps que la deuxième.

Questions fréquentes

L'OCR est-il effectué sur un serveur ?

Non, et c'est tout l'intérêt. Tesseract est compilé en WebAssembly et s'exécute dans votre onglet. Vos numérisations ne sont jamais téléversées, ce qui rend l'outil sûr pour des documents que vous ne confieriez pas à un service en ligne.

Quelle est sa précision ?

Sur une numérisation propre et droite à 300 ppp de texte imprimé courant, la précision est élevée — typiquement bien au-dessus de 95 %. Photocopies pâles, pages inclinées, photos basse résolution et typographies inhabituelles la réduisent sensiblement.

Peut-il lire l'écriture manuscrite ?

Non. Tesseract est entraîné sur des caractères imprimés. Notes manuscrites, signatures et annotations cursives ne sont pas reconnues.

Quel est le format de sortie ?

Un fichier texte brut en UTF-8. Les pages sont séparées par un repère numéroté. Mise en page, colonnes, tableaux et images ne sont pas conservés.

Pourquoi la première exécution est-elle si lente ?

Le modèle de langue doit être téléchargé, soit plusieurs mégaoctets. Il est ensuite mis en cache : les documents suivants dans la même langue démarrent immédiatement.

Cela produit-il un PDF consultable ?

Non. La sortie est un fichier texte distinct plutôt qu'une couche de texte réinjectée dans le PDF. Utilisez-le pour rechercher, citer ou alimenter un autre système.

Outils associés