Come usare l'OCR su un PDF (rendere ricercabili i documenti scansionati)

· · · 8 min di lettura

L'OCR — riconoscimento ottico dei caratteri — converte l'immagine di testo in un PDF scansionato in caratteri reali, selezionabili, ricercabili e copiabili. Questa guida spiega come funziona l'OCR, quando ti serve e come applicarlo gratuitamente nel tuo browser.


Perché i PDF scansionati hanno bisogno dell'OCR?

Quando scansioni un documento cartaceo, lo scanner crea un'immagine della pagina — non un file di testo. Un PDF scansionato è essenzialmente un JPEG o TIFF incorporato in un contenitore PDF. Puoi visualizzarlo, ma:

  • Non puoi selezionare o copiare il testo
  • Ctrl+F (Trova) restituisce zero risultati
  • I lettori di schermo non possono leggerlo (non accessibile)
  • I motori di ricerca non possono indicizzare il suo contenuto
  • Non puoi compilare campi modulo o evidenziare il testo

L'OCR legge quell'immagine e produce un livello di testo — un livello invisibile di caratteri riconosciuti posizionato con precisione sopra l'immagine. Dopo l'OCR, il documento appare identico, ma ora ha un testo reale sottostante con cui puoi interagire.


Come applicare l'OCR a un PDF online (gratis)

Compress PDF Online — Free

Reduce your PDF file size instantly. No software needed.

Use Tool Now →

Usando PDFlexa OCR:

  1. Vai su PDFlexa OCR
  2. Carica il tuo PDF scansionato (trascina e rilascia oppure clicca su Scegli un file)
  3. Seleziona la lingua del tuo documento dal menu a tendina (24 lingue supportate)
  4. Scegli il formato di output:
    • PDF ricercabile — mantiene l'aspetto originale, aggiunge un livello di testo invisibile
    • Testo semplice (.txt) — solo testo estratto, senza layout
  5. Clicca su Esegui OCR
  6. Scarica il risultato

L'elaborazione avviene nel tuo browser usando Tesseract.js. Per i PDF di grandi dimensioni (30+ pagine), l'elaborazione richiede alcuni minuti. Nessun file viene caricato su un server.

Le lingue supportate includono: inglese, francese, tedesco, spagnolo, portoghese, italiano, olandese, polacco, russo, arabo, cinese (semplificato), giapponese, coreano, hindi, turco e altre 9.


Quando serve l'OCR?

Tipo di documento Serve l'OCR?
Documento cartaceo scansionato in PDF ✅ Sì — è un'immagine
Foto di un documento scattata con il telefono ✅ Sì
PDF creato da un file Word/Excel/Google Documenti ❌ No — ha già un livello di testo
PDF esportato direttamente da un software (fatture, ricevute) ❌ No — ha già il testo
Vecchio documento d'archivio scansionato ✅ Sì
PDF dove il testo è sfocato o illeggibile ⚠️ L'OCR potrebbe migliorarlo
Un modulo PDF che non riesci a compilare ✅ OCR + Compila PDF aiuteranno

Un modo rapido per verificare: prova a selezionare il testo su una pagina. Se riesci a evidenziare una parola, il PDF ha già un livello di testo. Se il cursore crea solo un riquadro di selezione intorno a un'area (come selezionare un'area immagine), è un'immagine scansionata e ha bisogno dell'OCR.


Come funziona l'OCR (sotto il cofano)

Convert PDF to Word — Free

Turn any PDF into an editable Word document in seconds.

Use Tool Now →
  1. Rendering della pagina — ogni pagina del PDF viene renderizzata ad alta risoluzione (equivalente a 300+ DPI) come immagine
  2. Pre-elaborazione — l'immagine viene raddrizzata, ripulita dal rumore e convertita in scala di grigi
  3. Rilevamento del testo — il motore OCR identifica le regioni che sembrano testo (colonne, righe, parole)
  4. Riconoscimento dei caratteri — ogni regione di caratteri viene confrontata con un modello addestrato per la lingua selezionata
  5. Creazione del livello di testo — i caratteri riconosciuti vengono posizionati nelle loro posizioni rilevate sopra l'immagine originale
  6. Ricostruzione del PDF — viene creato un nuovo PDF con l'immagine originale più il livello di testo invisibile

La qualità dell'OCR dipende da: risoluzione della scansione (più alta è meglio), qualità del documento (stampa nitida contro inchiostro sbiadito), corrispondenza della lingua, e se il testo è digitato o scritto a mano. PDFlexa usa Tesseract — il motore OCR open source più utilizzato al mondo, addestrato su oltre 100 lingue.


Consigli per risultati OCR migliori

Scansiona a 300 DPI o superiore. La maggior parte degli scanner consumer usa 150 DPI di default, che è sufficiente per la visualizzazione ma produce risultati OCR scarsi. Usa 300 DPI per il testo, 600 DPI per caratteri molto piccoli.

Scansiona in scala di grigi o bianco e nero. Le scansioni a colori sono più pesanti e non migliorano la qualità dell'OCR per i documenti di testo standard. La scala di grigi è il punto ideale.

Assicurati che la pagina sia piatta e dritta. Pagine curve (dovute alla rilegatura del libro), scansioni storte o ombre da una fotocamera di un telefono riducono tutte la precisione. La maggior parte degli scanner piani gestisce bene questo aspetto; le scansioni con fotocamera del telefono sono le più problematiche.

Scegli la lingua corretta. Tesseract usa modelli addestrati specifici per lingua. Un documento tedesco elaborato con OCR in inglese avrà risultati scarsi sulle dieresi (ä, ö, ü). Fai sempre corrispondere la lingua.

Il testo maiuscolo e stampato viene riconosciuto meglio della scrittura a mano. L'OCR standard è progettato per il testo stampato. Il riconoscimento della scrittura a mano è un problema separato (più difficile) che Tesseract gestisce male.


Precisione dell'OCR: cosa aspettarsi

Qualità del documento Precisione prevista
Pulito, digitato, scansionato piatto a 300 DPI 98-99% di precisione dei caratteri
Scansione da ufficio standard a 150 DPI 92-96% di precisione
Vecchio documento con inchiostro sbiadito 80-90% di precisione
Appunti scritti a mano 50-75% (varia molto)
Articolo accademico a più colonne 90-95% (il rilevamento del layout è più difficile)
Scrittura non latina (arabo, cinese, coreano) 85-95% con la lingua corretta

Per i documenti critici (contratti, atti legali), rivedi sempre l'output dell'OCR alla ricerca di errori — specialmente nomi propri, numeri e date.


OCR vs. da PDF a Word: qual è la differenza?

OCR PDF Da PDF a Word
Output PDF ricercabile (stesso aspetto) o .txt .docx modificabile
Ideale per Rendere ricercabile/accessibile una scansione Modificare il contenuto in Microsoft Word
Layout Layout originale preservato perfettamente Il layout potrebbe spostarsi nella conversione in Word
Caso d'uso Archiviazione, ricerca, accessibilità Riutilizzare e modificare il contenuto

Se vuoi modificare il contenuto scansionato in Word, esegui prima l'OCR e poi usa Da PDF a Word — l'OCR fornisce al convertitore testo reale su cui lavorare invece di regioni immagine vuote.


Domande frequenti

L'OCR cambia l'aspetto del mio PDF? No. Il livello di testo OCR è invisibile — si trova dietro l'immagine della pagina. Il PDF appare identico prima e dopo l'OCR. L'unica differenza è che ora il testo è selezionabile e ricercabile.

L'OCR può leggere la scrittura a mano? L'OCR standard è addestrato per il testo stampato ed è inaffidabile sulla scrittura a mano. I risultati variano molto a seconda di quanto chiaramente e in modo uniforme è formata la scrittura. Per i documenti scritti a mano importanti, la trascrizione manuale è più affidabile.

Quante pagine posso elaborare con l'OCR in una volta sola? L'OCR basato su browser di PDFlexa supporta fino a 50 pagine per caricamento. Per documenti più lunghi, dividi il PDF in parti, esegui l'OCR su ogni parte, poi unisci i risultati.

Perché l'OCR richiede molto tempo? Ogni pagina viene elaborata individualmente: renderizzata ad alta risoluzione, analizzata e riconosciuta. Un documento di 20 pagine potrebbe richiedere 1-3 minuti nel browser. L'elaborazione avviene sul tuo dispositivo — la velocità dipende dalla tua CPU e memoria.

L'OCR è gratuito? Sì. L'OCR di PDFlexa funziona interamente nel tuo browser usando Tesseract.js open source, senza alcun costo. Nessun account richiesto, nessun limite giornaliero sullo strumento OCR.

Prova questi strumenti PDF gratuiti

Comprimi PDF → Unisci PDF → PDF in Word → JPG in PDF →
Abdel B.

Il team di PDFlexa crea guide pratiche per aiutarti a lavorare più velocemente con i file PDF. Tutti gli strumenti sono gratuiti — nessun account richiesto.

Ti è stato utile? Condividilo: Facebook X LinkedIn