Um PDF gerado por software guarda o texto como texto — cada palavra está lá, com a sua posição na página. Esta ferramenta extrai essa camada com o PDF.js e devolve-a num formato que se pode abrir e editar, o que poupa transcrever manualmente um documento que já existe em forma digital.
Convém ser realista quanto ao que se recupera. O PDF descreve onde cada fragmento de texto é desenhado, não como o documento estava estruturado. Não há conceito de parágrafo, de estilo de título ou de célula de tabela — essa informação existia no ficheiro de origem e não sobreviveu à exportação para PDF. O que se extrai é o conteúdo, não a formatação.
Se o PDF for digitalizado, não há camada de texto nenhuma para extrair. Nesse caso, o caminho é o OCR.
A extração acontece no navegador. O documento não é carregado.
| Elemento | Resultado |
|---|---|
| Texto corrido | Extraído de forma fiável |
| Ordem das páginas | Preservada |
| Estilos de título | Perdidos — o PDF não os guarda |
| Tabelas | Extraídas como texto solto, sem estrutura de célula |
| Imagens | Não incluídas |
| Disposição em colunas | Pode sair fora de ordem |
| PDF digitalizado | Nada — não há camada de texto; use OCR |
Um artigo académico ou uma newsletter em duas colunas é o caso em que a extração corre pior. O texto é lido pela ordem em que os fragmentos estão no ficheiro, que nem sempre corresponde à ordem de leitura visual — o resultado pode alternar entre colunas a meio de cada frase.
Não há solução automática limpa para isto. Se o documento é importante e está em colunas, muitas vezes compensa mais copiar secção a secção a partir do leitor de PDF do que corrigir o resultado da extração completa.
Não. O PDF guarda posições de texto, não estrutura de documento: títulos, estilos e tabelas não existem como tal no ficheiro. Recupera o conteúdo e reformata.
Não. Uma digitalização é uma imagem e não tem camada de texto. Para esses documentos, use a ferramenta de OCR.
Não. O texto das células é extraído, mas sem qualquer estrutura de linha e coluna — sai como texto solto pela ordem em que está no ficheiro.
Não. Apenas o texto é extraído. Para extrair imagens de página, use PDF para JPG.
Documentos em várias colunas costumam dar esse resultado, porque a extração segue a ordem dos fragmentos no ficheiro e não a ordem visual de leitura.
Não. A extração acontece no navegador.