Questo strumento estrae il testo da un PDF e te lo consegna come documento modificabile. Usa PDF.js per leggere gli oggetti testo che il file contiene già — ogni carattere con la sua posizione sulla pagina — e li raggruppa di nuovo in righe confrontandone le coordinate verticali. Il risultato viene scritto come file .doc compatibile con Word oppure come .txt semplice.
Vale la pena fissare le aspettative con precisione, perché «PDF in Word» promette più di quanto qualsiasi convertitore possa mantenere. Un PDF descrive dove si posa ogni glifo su una pagina; non registra che una sequenza di testo era un titolo, un elenco puntato, la cella di una tabella o un'impaginazione su due colonne. Ricostruire quella struttura è tirare a indovinare, e questo strumento non ci prova. Quello che ottieni è il testo, in ordine di lettura, come paragrafi: un punto di partenza pulito per riscrivere e non una replica fedele.
Il testo viene estratto e il documento composto nel browser. Non viene caricato nulla, a differenza dei servizi di conversione che richiedono di consegnare il file.
.doc che Word, Google Documenti e LibreOffice aprono tutti. Testo semplice produce un .txt senza alcuna formattazione.| Elemento | Risultato |
|---|---|
| Testo del corpo | Estratto accuratamente, in ordine di lettura |
| Interruzioni di paragrafo | Ricostruite dalle posizioni delle righe |
| Interruzioni di pagina | Conservate |
| Titoli e stili | Persi: tutto diventa testo corrente |
| Tabelle | Appiattite in righe di testo |
| Immagini e grafici | Non inclusi |
| Colonne | Lette nell'ordine interno del file, che può intrecciarle |
Un documento scansionato contiene fotografie di pagine, non oggetti testo. Questo strumento non ha nulla da estrarre e segnalerà che non è stato trovato testo. Usa invece lo strumento di riconoscimento testo, che identifica visivamente i caratteri e produce un file di testo con cui lavorare.
Puoi capire la differenza in qualsiasi lettore PDF: prova a selezionare una frase con il mouse. Se compare un cursore di testo e le parole si evidenziano, questo convertitore funzionerà. Se ottieni solo una selezione rettangolare sull'intera pagina, è una scansione.
Perché un PDF memorizza posizioni di glifi e non la struttura del documento. Non c'è traccia del fatto che qualcosa fosse un titolo, una tabella o un elenco, quindi nessun convertitore può ripristinarlo in modo affidabile. Questo strumento estrae il testo fedelmente e lascia a te la formattazione.
Il file è quasi certamente una scansione: immagini di pagine senza livello di testo. Usa lo strumento di riconoscimento testo, che identifica visivamente i caratteri.
No. In un PDF le celle di una tabella sono solo testo posizionato, quindi escono come righe normali. Le tabelle complesse di solito vanno ricostruite a mano.
Il .doc conserva le interruzioni di paragrafo e di pagina e si apre in Word, Google Documenti e LibreOffice. Il .txt è testo puro senza alcuna struttura, utile per alimentare altro software.
No. Viene estratto solo il livello di testo. Se ti servono le pagine come immagini, usa PDF in JPG.
No. PDF.js legge il testo nel browser e il file in uscita viene composto localmente prima del download.