El reconocimiento óptico de caracteres lee texto a partir de imágenes de texto. Un contrato escaneado, un recibo fotografiado, una captura de un mensaje de error: todos parecen documentos pero no contienen texto que un ordenador pueda seleccionar, buscar o copiar. El reconocimiento examina la forma de las letras y reconstruye los caracteres.
Esta herramienta ejecuta Tesseract, el veterano motor de reconocimiento de código abierto, compilado a WebAssembly para que funcione dentro de tu navegador en lugar de en un servidor. Las páginas PDF se renderizan al doble de su tamaño nativo antes del reconocimiento, porque la resolución es con diferencia el mayor factor de precisión. El resultado es un archivo de texto plano, con las páginas separadas por una marca.
El reconocimiento se realiza en tu propia máquina. Es poco común en el reconocimiento de texto —la mayoría de servicios exige una subida— y significa que nóminas, informes médicos y documentos de identidad pueden leerse sin transmitirse.
.txt en UTF-8 con las páginas divididas por separadores numerados.| Factor | Efecto en los resultados |
|---|---|
| Resolución de origen | El factor dominante. Un escaneo a 300 ppp se lee con fiabilidad; uno a 100 ppp adivina. |
| Rectitud | Una inclinación de más de dos grados reduce la precisión rápidamente. |
| Contraste | Negro sobre blanco es lo ideal. Las fotocopias pálidas y los fondos de color perjudican. |
| Tipografía | El texto impreso corriente es fiable. La escritura a mano no está admitida. |
| Maquetación | Una sola columna fluye limpiamente. Las columnas múltiples y las tablas pierden su estructura. |
El modo automático combina el idioma de la página en la que estás con el inglés, así que un documento coreano se reconoce como coreano más inglés, uno japonés como japonés más inglés, y así sucesivamente. Esa combinación resuelve el caso real habitual de un documento en un idioma con nombres de producto, direcciones o términos técnicos en inglés.
Cada modelo de idioma es una descarga aparte de varios megabytes, obtenida la primera vez que lo usas y luego guardada en caché por el navegador. La primera ejecución en un idioma nuevo tarda por tanto bastante más que la segunda.
No, y ese es el objetivo. Tesseract está compilado a WebAssembly y se ejecuta dentro de tu pestaña. Tus escaneos nunca se suben, lo que lo hace seguro para documentos que no confiarías a un servicio en línea.
En un escaneo limpio y recto a 300 ppp de texto impreso corriente, la precisión es alta, normalmente muy por encima del 95 por ciento. Fotocopias pálidas, páginas inclinadas, fotos de baja resolución y tipografías inusuales la reducen de forma apreciable.
No. Tesseract está entrenado con texto impreso. Notas manuscritas, firmas y anotaciones en cursiva no se reconocen.
Un archivo de texto plano en UTF-8. Las páginas se separan con una marca numerada. La maquetación, las columnas, las tablas y las imágenes no se conservan.
Hay que descargar el modelo de idioma, que ocupa varios megabytes. Después queda en caché, así que los siguientes documentos en el mismo idioma empiezan de inmediato.
No. La salida es un archivo de texto aparte y no una capa de texto reinsertada en el PDF. Úsalo para buscar, citar o alimentar otro sistema.