Reconhecimento de texto (OCR)

Adicione arquivos PDF ou de imagem — ou arraste-os para cá
PDF JPG PNG WEBP

Sobre esta ferramenta de OCR de PDF

Um PDF digitalizado parece um documento mas comporta-se como uma fotografia. Não se pesquisa, não se copia, não se cita — cada página é uma imagem de texto, e o computador não sabe o que lá está escrito.

O reconhecimento ótico de carateres resolve isso. Esta ferramenta usa o tesseract.js, uma compilação para WebAssembly do motor Tesseract, que é o reconhecedor de código aberto mais usado. Cada página é renderizada e analisada, e o texto reconhecido é devolvido para poder ser copiado.

A qualidade do resultado depende quase inteiramente da qualidade da digitalização. Uma página nítida, direita e bem contrastada dá um reconhecimento muito bom; uma fotografia tirada de esguelha com sombra atravessada dá um resultado que é preciso rever linha a linha.

O reconhecimento corre inteiramente no navegador. O documento não é enviado para nenhum serviço de OCR, o que importa quando se trata de correspondência ou registos pessoais.

Como aplicar OCR a um PDF

  1. Adicione o PDF digitalizado. Arraste o ficheiro.
  2. Escolha o idioma. Escolher o idioma correto melhora bastante o reconhecimento, sobretudo em acentuação e carateres específicos.
  3. Execute. Cada página é renderizada e analisada. É um processo demorado: conte com algum tempo por página.
  4. Reveja o texto. Copie o resultado e verifique-o. Nomes próprios, números e tabelas são onde o OCR erra mais.

O que decide a qualidade do reconhecimento

FatorEfeito
Resolução da digitalização300 ppp é o mínimo razoável; abaixo disso a precisão cai
AlinhamentoPáginas inclinadas reduzem bastante a precisão
ContrastePreto sobre branco é ideal; fundos acinzentados prejudicam
Tipo de letraSerifado ou não serifado comum funciona bem; manuscrito não
Estrutura da páginaUma coluna de texto corrido é o melhor caso; tabelas e colunas confundem

Contar com o tempo e com a revisão

O OCR é computacionalmente pesado, e aqui corre na sua máquina em vez de num servidor. Um documento de vinte páginas leva um tempo considerável, e o navegador vai ficar ocupado. Deixe correr.

Depois, reveja. Mesmo um bom reconhecimento erra em nomes próprios, em sequências de dígitos e em tudo o que esteja disposto em tabela. Se o texto vai ser usado para alguma coisa que importe, a revisão não é opcional.

Perguntas frequentes

Que idiomas são suportados?

O tesseract.js suporta um conjunto amplo de idiomas. Escolha o do documento antes de executar: o modelo correto melhora muito o reconhecimento de acentuação e carateres específicos.

Quão exato é o reconhecimento?

Depende da digitalização. Uma página nítida, direita e contrastada dá resultados muito bons. Fotografias inclinadas, com sombras ou de baixa resolução dão resultados que exigem revisão cuidadosa.

Reconhece texto manuscrito?

Não de forma fiável. O Tesseract foi treinado para texto impresso; manuscrito dá resultados muito fracos.

Porque é que demora tanto?

Porque o reconhecimento corre na sua máquina, em WebAssembly, em vez de num servidor. É esse o custo de o documento não sair do navegador.

O PDF fica pesquisável?

A ferramenta extrai o texto reconhecido para que o possa copiar. Não reconstrói o PDF com uma camada de texto invisível por baixo da imagem.

O documento é enviado para algum serviço?

Não. Todo o reconhecimento acontece neste separador.

Ferramentas relacionadas