Vai al contenuto

Da PDF scansionato a testo

In una scansione, ogni pagina è un’immagine del foglio: non c’è testo da copiare. Il riconoscimento del testo (OCR) legge le lettere sul tuo dispositivo e ti dà il testo in un file .txt, oltre a un PDF in cui puoi cercarlo.

Elaborato sul tuo dispositivoNulla viene inviato ai server

Trascina qui uno o più PDF

File PDF

I file vengono aperti sul tuo dispositivo e non vengono mai inviati.

Come funziona

  1. Scegli la scansione

    Trascina nell’area di lavoro il PDF scansionato (o la foto di un documento salvata in PDF), oppure usa il pulsante.

  2. Controlla la lingua

    La lingua di questa pagina è già selezionata; spunta anche le altre presenti nel documento. La prima volta, MovaDoc scarica i dati per il riconoscimento: circa 3 MB per lingua.

  3. Scarica il testo

    Sullo schermo vedi l’inizio del testo riconosciuto. Clicca su «Scarica il testo (.txt)» per averlo tutto, oppure scarica il PDF ricercabile.

Domande frequenti

Perché non riesco a copiare il testo dal mio PDF?

Perché è una scansione: ogni pagina è un’immagine del foglio, senza lettere memorizzate, e il lettore PDF vede solo una foto. L’OCR riconosce le lettere in quell’immagine e le trasforma in testo che puoi copiare, modificare e cercare.

Il testo mantiene la formattazione del documento?

No. Il file .txt contiene solo il testo, riga per riga, con una riga vuota tra un paragrafo e l’altro: niente font, grassetto, immagini né griglia delle tabelle. Per un documento Word modificabile, con titoli, elenchi e tabelle, usa «Da PDF a Word», che riconosce anche le pagine scansionate.

Funziona con le foto di documenti e con la scrittura a mano?

Con le foto salvate in PDF sì, se sono nitide e dritte: migliore è l’immagine, meno errori ci sono. Se la foto è in JPG o PNG, inseriscila prima in un PDF con «Da immagini a PDF». La scrittura a mano non viene riconosciuta: i dati del riconoscimento servono solo per il testo stampato.

Posso estrarre il testo da più PDF in una volta?

Sì, in due passaggi. Con più PDF, ottieni uno ZIP con i PDF ricercabili (senza i file .txt). Poi «Continua con…» → «Da PDF a testo», che elabora anch’esso più file insieme, ti dà un .txt per ogni PDF.

Il documento viene inviato da qualche parte per essere letto?

No. Il riconoscimento avviene nel tuo browser, con il motore Tesseract. La prima volta, MovaDoc scarica il motore e i dati delle lingue dal proprio sito; poi funziona anche senza internet. Il PDF e il testo riconosciuto non lasciano mai il tuo dispositivo.