Reconocimiento de texto (OCR)

Añade archivos PDF o de imagen — o arrástralos aquí
PDF JPG PNG WEBP

Sobre esta herramienta de reconocimiento de texto

El reconocimiento óptico de caracteres lee texto a partir de imágenes de texto. Un contrato escaneado, un recibo fotografiado, una captura de un mensaje de error: todos parecen documentos pero no contienen texto que un ordenador pueda seleccionar, buscar o copiar. El reconocimiento examina la forma de las letras y reconstruye los caracteres.

Esta herramienta ejecuta Tesseract, el veterano motor de reconocimiento de código abierto, compilado a WebAssembly para que funcione dentro de tu navegador en lugar de en un servidor. Las páginas PDF se renderizan al doble de su tamaño nativo antes del reconocimiento, porque la resolución es con diferencia el mayor factor de precisión. El resultado es un archivo de texto plano, con las páginas separadas por una marca.

El reconocimiento se realiza en tu propia máquina. Es poco común en el reconocimiento de texto —la mayoría de servicios exige una subida— y significa que nóminas, informes médicos y documentos de identidad pueden leerse sin transmitirse.

Cómo extraer texto con reconocimiento óptico

  1. Añade un PDF o imágenes. Sirven escaneos, fotografías y capturas de pantalla. Además de PDF se aceptan JPG, PNG, WebP y HEIC.
  2. Elige el idioma. El ajuste automático usa el idioma de tu página más inglés, lo que resuelve bien los documentos mixtos. Fuerza el inglés si el documento es puramente inglés.
  3. Inicia el reconocimiento. El modelo de idioma se descarga la primera vez y luego queda en caché. Tarda unos segundos por página y muestra un contador de progreso.
  4. Descarga el texto. El resultado es un archivo .txt en UTF-8 con las páginas divididas por separadores numerados.

Qué determina la precisión

FactorEfecto en los resultados
Resolución de origenEl factor dominante. Un escaneo a 300 ppp se lee con fiabilidad; uno a 100 ppp adivina.
RectitudUna inclinación de más de dos grados reduce la precisión rápidamente.
ContrasteNegro sobre blanco es lo ideal. Las fotocopias pálidas y los fondos de color perjudican.
TipografíaEl texto impreso corriente es fiable. La escritura a mano no está admitida.
MaquetaciónUna sola columna fluye limpiamente. Las columnas múltiples y las tablas pierden su estructura.

Idiomas

El modo automático combina el idioma de la página en la que estás con el inglés, así que un documento coreano se reconoce como coreano más inglés, uno japonés como japonés más inglés, y así sucesivamente. Esa combinación resuelve el caso real habitual de un documento en un idioma con nombres de producto, direcciones o términos técnicos en inglés.

Cada modelo de idioma es una descarga aparte de varios megabytes, obtenida la primera vez que lo usas y luego guardada en caché por el navegador. La primera ejecución en un idioma nuevo tarda por tanto bastante más que la segunda.

Preguntas frecuentes

¿El reconocimiento se hace en un servidor?

No, y ese es el objetivo. Tesseract está compilado a WebAssembly y se ejecuta dentro de tu pestaña. Tus escaneos nunca se suben, lo que lo hace seguro para documentos que no confiarías a un servicio en línea.

¿Qué precisión tiene?

En un escaneo limpio y recto a 300 ppp de texto impreso corriente, la precisión es alta, normalmente muy por encima del 95 por ciento. Fotocopias pálidas, páginas inclinadas, fotos de baja resolución y tipografías inusuales la reducen de forma apreciable.

¿Puede leer escritura a mano?

No. Tesseract está entrenado con texto impreso. Notas manuscritas, firmas y anotaciones en cursiva no se reconocen.

¿Qué formato tiene la salida?

Un archivo de texto plano en UTF-8. Las páginas se separan con una marca numerada. La maquetación, las columnas, las tablas y las imágenes no se conservan.

¿Por qué la primera ejecución es tan lenta?

Hay que descargar el modelo de idioma, que ocupa varios megabytes. Después queda en caché, así que los siguientes documentos en el mismo idioma empiezan de inmediato.

¿Genera un PDF con texto buscable?

No. La salida es un archivo de texto aparte y no una capa de texto reinsertada en el PDF. Úsalo para buscar, citar o alimentar otro sistema.

Herramientas relacionadas