Converter PDF para Word

Voltar ao Início
Adicione um arquivo PDF — ou arraste-os para cá
PDF

Sobre este conversor de PDF para texto

Um PDF gerado por software guarda o texto como texto — cada palavra está lá, com a sua posição na página. Esta ferramenta extrai essa camada com o PDF.js e devolve-a num formato que se pode abrir e editar, o que poupa transcrever manualmente um documento que já existe em forma digital.

Convém ser realista quanto ao que se recupera. O PDF descreve onde cada fragmento de texto é desenhado, não como o documento estava estruturado. Não há conceito de parágrafo, de estilo de título ou de célula de tabela — essa informação existia no ficheiro de origem e não sobreviveu à exportação para PDF. O que se extrai é o conteúdo, não a formatação.

Se o PDF for digitalizado, não há camada de texto nenhuma para extrair. Nesse caso, o caminho é o OCR.

A extração acontece no navegador. O documento não é carregado.

Como converter um PDF em texto editável

  1. Adicione o PDF. Um documento gerado por software, não digitalizado.
  2. Extraia. A camada de texto é lida página a página.
  3. Descarregue. O resultado abre em processadores de texto para edição.
  4. Reformate. Conte com refazer títulos, listas e tabelas: essa estrutura não existia no PDF.

O que sobrevive à conversão

ElementoResultado
Texto corridoExtraído de forma fiável
Ordem das páginasPreservada
Estilos de títuloPerdidos — o PDF não os guarda
TabelasExtraídas como texto solto, sem estrutura de célula
ImagensNão incluídas
Disposição em colunasPode sair fora de ordem
PDF digitalizadoNada — não há camada de texto; use OCR

Documentos em várias colunas

Um artigo académico ou uma newsletter em duas colunas é o caso em que a extração corre pior. O texto é lido pela ordem em que os fragmentos estão no ficheiro, que nem sempre corresponde à ordem de leitura visual — o resultado pode alternar entre colunas a meio de cada frase.

Não há solução automática limpa para isto. Se o documento é importante e está em colunas, muitas vezes compensa mais copiar secção a secção a partir do leitor de PDF do que corrigir o resultado da extração completa.

Perguntas frequentes

A formatação é preservada?

Não. O PDF guarda posições de texto, não estrutura de documento: títulos, estilos e tabelas não existem como tal no ficheiro. Recupera o conteúdo e reformata.

Funciona com PDF digitalizados?

Não. Uma digitalização é uma imagem e não tem camada de texto. Para esses documentos, use a ferramenta de OCR.

As tabelas mantêm a estrutura?

Não. O texto das células é extraído, mas sem qualquer estrutura de linha e coluna — sai como texto solto pela ordem em que está no ficheiro.

As imagens são incluídas?

Não. Apenas o texto é extraído. Para extrair imagens de página, use PDF para JPG.

Porque é que o texto saiu desordenado?

Documentos em várias colunas costumam dar esse resultado, porque a extração segue a ordem dos fragmentos no ficheiro e não a ordem visual de leitura.

O documento é carregado?

Não. A extração acontece no navegador.

Ferramentas relacionadas