Il riconoscimento ottico dei caratteri legge il testo da immagini di testo. Un contratto scansionato, uno scontrino fotografato, una schermata di un messaggio d'errore: sembrano tutti documenti ma non contengono testo che un computer possa selezionare, cercare o copiare. Il riconoscimento esamina la forma delle lettere e ricostruisce i caratteri.
Questo strumento esegue Tesseract, il collaudato motore di riconoscimento open source, compilato in WebAssembly così da girare nel tuo browser anziché su un server. Le pagine PDF vengono rese al doppio della dimensione nativa prima del riconoscimento, perché la risoluzione è di gran lunga il fattore che più incide sull'accuratezza. Il risultato è un file di testo semplice, con le pagine separate da un marcatore.
Il riconoscimento avviene sulla tua macchina. È insolito per il riconoscimento testo — la maggior parte dei servizi richiede un caricamento — e significa che buste paga, referti medici e documenti d'identità possono essere letti senza essere trasmessi.
.txt in UTF-8 con le pagine divise da separatori numerati.| Fattore | Effetto sui risultati |
|---|---|
| Risoluzione della fonte | Il fattore dominante. Una scansione a 300 dpi si legge in modo affidabile; una a 100 dpi tira a indovinare. |
| Rettilineità | Un'inclinazione oltre i due gradi fa calare l'accuratezza rapidamente. |
| Contrasto | Nero su bianco è l'ideale. Fotocopie sbiadite e sfondi colorati penalizzano. |
| Carattere | Il testo a stampa comune è affidabile. La scrittura a mano non è supportata. |
| Impaginazione | Una colonna singola scorre pulita. Le colonne multiple e le tabelle perdono la struttura. |
La modalità automatica abbina la lingua della pagina in cui ti trovi all'inglese, quindi un documento coreano viene riconosciuto come coreano più inglese, uno giapponese come giapponese più inglese e così via. Quella combinazione copre il caso reale più comune di un documento in una lingua che contiene nomi di prodotto, indirizzi o termini tecnici in inglese.
Ogni modello linguistico è un download separato di diversi megabyte, recuperato al primo utilizzo e poi memorizzato nella cache del browser. La prima esecuzione in una nuova lingua richiede quindi sensibilmente più tempo della seconda.
No, ed è il punto centrale. Tesseract è compilato in WebAssembly e gira nella scheda del browser. Le tue scansioni non vengono mai caricate, il che lo rende sicuro per documenti che non affideresti a un servizio online.
Su una scansione pulita e dritta a 300 dpi di testo a stampa comune l'accuratezza è alta, tipicamente ben oltre il 95 per cento. Fotocopie sbiadite, pagine inclinate, foto a bassa risoluzione e caratteri insoliti la riducono sensibilmente.
No. Tesseract è addestrato sul testo a stampa. Appunti scritti a mano, firme e corsivo non vengono riconosciuti.
Un file di testo semplice in UTF-8. Le pagine sono separate da un marcatore numerato. Impaginazione, colonne, tabelle e immagini non vengono conservate.
Va scaricato il modello linguistico, che pesa diversi megabyte. Poi viene memorizzato nella cache, quindi i documenti successivi nella stessa lingua partono subito.
No. L'uscita è un file di testo separato e non un livello di testo reinserito nel PDF. Usalo per cercare, citare o alimentare un altro sistema.