Um PDF digitalizado parece um documento mas comporta-se como uma fotografia. Não se pesquisa, não se copia, não se cita — cada página é uma imagem de texto, e o computador não sabe o que lá está escrito.
O reconhecimento ótico de carateres resolve isso. Esta ferramenta usa o tesseract.js, uma compilação para WebAssembly do motor Tesseract, que é o reconhecedor de código aberto mais usado. Cada página é renderizada e analisada, e o texto reconhecido é devolvido para poder ser copiado.
A qualidade do resultado depende quase inteiramente da qualidade da digitalização. Uma página nítida, direita e bem contrastada dá um reconhecimento muito bom; uma fotografia tirada de esguelha com sombra atravessada dá um resultado que é preciso rever linha a linha.
O reconhecimento corre inteiramente no navegador. O documento não é enviado para nenhum serviço de OCR, o que importa quando se trata de correspondência ou registos pessoais.
| Fator | Efeito |
|---|---|
| Resolução da digitalização | 300 ppp é o mínimo razoável; abaixo disso a precisão cai |
| Alinhamento | Páginas inclinadas reduzem bastante a precisão |
| Contraste | Preto sobre branco é ideal; fundos acinzentados prejudicam |
| Tipo de letra | Serifado ou não serifado comum funciona bem; manuscrito não |
| Estrutura da página | Uma coluna de texto corrido é o melhor caso; tabelas e colunas confundem |
O OCR é computacionalmente pesado, e aqui corre na sua máquina em vez de num servidor. Um documento de vinte páginas leva um tempo considerável, e o navegador vai ficar ocupado. Deixe correr.
Depois, reveja. Mesmo um bom reconhecimento erra em nomes próprios, em sequências de dígitos e em tudo o que esteja disposto em tabela. Se o texto vai ser usado para alguma coisa que importe, a revisão não é opcional.
O tesseract.js suporta um conjunto amplo de idiomas. Escolha o do documento antes de executar: o modelo correto melhora muito o reconhecimento de acentuação e carateres específicos.
Depende da digitalização. Uma página nítida, direita e contrastada dá resultados muito bons. Fotografias inclinadas, com sombras ou de baixa resolução dão resultados que exigem revisão cuidadosa.
Não de forma fiável. O Tesseract foi treinado para texto impresso; manuscrito dá resultados muito fracos.
Porque o reconhecimento corre na sua máquina, em WebAssembly, em vez de num servidor. É esse o custo de o documento não sair do navegador.
A ferramenta extrai o texto reconhecido para que o possa copiar. Não reconstrói o PDF com uma camada de texto invisível por baixo da imagem.
Não. Todo o reconhecimento acontece neste separador.