La reconnaissance optique de caractères lit du texte à partir d'images de texte. Un contrat numérisé, un reçu photographié, une capture d'un message d'erreur : tous ressemblent à des documents mais ne contiennent aucun texte qu'un ordinateur puisse sélectionner, rechercher ou copier. L'OCR examine la forme des lettres et reconstitue les caractères.
Cet outil exécute Tesseract, le moteur OCR libre de référence, compilé en WebAssembly afin de s'exécuter dans votre navigateur plutôt que sur un serveur. Les pages PDF sont rendues au double de leur taille native avant reconnaissance, car la résolution est de loin le premier facteur de précision. Le résultat est un fichier texte brut, les pages étant séparées par un repère.
La reconnaissance a lieu sur votre propre machine. C'est inhabituel pour de l'OCR — la plupart des services imposent un téléversement — et cela signifie que bulletins de paie, courriers médicaux et pièces d'identité peuvent être lus sans être transmis.
.txt en UTF-8, les pages étant séparées par des repères numérotés.| Facteur | Effet sur les résultats |
|---|---|
| Résolution source | Le facteur dominant. Une numérisation à 300 ppp est fiable ; à 100 ppp, le moteur devine. |
| Droiture | Au-delà de deux degrés d'inclinaison, la précision chute rapidement. |
| Contraste | Noir sur blanc est idéal. Photocopies pâles et fonds colorés nuisent. |
| Typographie | Le texte imprimé courant est fiable. L'écriture manuscrite n'est pas prise en charge. |
| Mise en page | Une colonne unique s'enchaîne proprement. Colonnes multiples et tableaux perdent leur structure. |
Le mode automatique associe la langue de la page où vous vous trouvez et l'anglais : un document coréen est reconnu en coréen plus anglais, un document japonais en japonais plus anglais, et ainsi de suite. Cette combinaison couvre le cas réel courant d'un document dans une langue contenant des noms de produits, adresses ou termes techniques en anglais.
Chaque modèle de langue est un téléchargement distinct de plusieurs mégaoctets, récupéré à la première utilisation puis mis en cache par le navigateur. La première exécution dans une nouvelle langue prend donc sensiblement plus de temps que la deuxième.
Non, et c'est tout l'intérêt. Tesseract est compilé en WebAssembly et s'exécute dans votre onglet. Vos numérisations ne sont jamais téléversées, ce qui rend l'outil sûr pour des documents que vous ne confieriez pas à un service en ligne.
Sur une numérisation propre et droite à 300 ppp de texte imprimé courant, la précision est élevée — typiquement bien au-dessus de 95 %. Photocopies pâles, pages inclinées, photos basse résolution et typographies inhabituelles la réduisent sensiblement.
Non. Tesseract est entraîné sur des caractères imprimés. Notes manuscrites, signatures et annotations cursives ne sont pas reconnues.
Un fichier texte brut en UTF-8. Les pages sont séparées par un repère numéroté. Mise en page, colonnes, tableaux et images ne sont pas conservés.
Le modèle de langue doit être téléchargé, soit plusieurs mégaoctets. Il est ensuite mis en cache : les documents suivants dans la même langue démarrent immédiatement.
Non. La sortie est un fichier texte distinct plutôt qu'une couche de texte réinjectée dans le PDF. Utilisez-le pour rechercher, citer ou alimenter un autre système.