L'OCR — riconoscimento ottico dei caratteri — converte l'immagine di testo in un PDF scansionato in caratteri reali, selezionabili, ricercabili e copiabili. Questa guida spiega come funziona l'OCR, quando ti serve e come applicarlo gratuitamente nel tuo browser.
Perché i PDF scansionati hanno bisogno dell'OCR?
Quando scansioni un documento cartaceo, lo scanner crea un'immagine della pagina — non un file di testo. Un PDF scansionato è essenzialmente un JPEG o TIFF incorporato in un contenitore PDF. Puoi visualizzarlo, ma:
- Non puoi selezionare o copiare il testo
- Ctrl+F (Trova) restituisce zero risultati
- I lettori di schermo non possono leggerlo (non accessibile)
- I motori di ricerca non possono indicizzare il suo contenuto
- Non puoi compilare campi modulo o evidenziare il testo
L'OCR legge quell'immagine e produce un livello di testo — un livello invisibile di caratteri riconosciuti posizionato con precisione sopra l'immagine. Dopo l'OCR, il documento appare identico, ma ora ha un testo reale sottostante con cui puoi interagire.
Come applicare l'OCR a un PDF online (gratis)
Reduce your PDF file size instantly. No software needed.
Usando PDFlexa OCR:
- Vai su PDFlexa OCR
- Carica il tuo PDF scansionato (trascina e rilascia oppure clicca su Scegli un file)
- Seleziona la lingua del tuo documento dal menu a tendina (24 lingue supportate)
- Scegli il formato di output:
- PDF ricercabile — mantiene l'aspetto originale, aggiunge un livello di testo invisibile
- Testo semplice (.txt) — solo testo estratto, senza layout
- Clicca su Esegui OCR
- Scarica il risultato
L'elaborazione avviene nel tuo browser usando Tesseract.js. Per i PDF di grandi dimensioni (30+ pagine), l'elaborazione richiede alcuni minuti. Nessun file viene caricato su un server.
Le lingue supportate includono: inglese, francese, tedesco, spagnolo, portoghese, italiano, olandese, polacco, russo, arabo, cinese (semplificato), giapponese, coreano, hindi, turco e altre 9.
Quando serve l'OCR?
| Tipo di documento | Serve l'OCR? |
|---|---|
| Documento cartaceo scansionato in PDF | ✅ Sì — è un'immagine |
| Foto di un documento scattata con il telefono | ✅ Sì |
| PDF creato da un file Word/Excel/Google Documenti | ❌ No — ha già un livello di testo |
| PDF esportato direttamente da un software (fatture, ricevute) | ❌ No — ha già il testo |
| Vecchio documento d'archivio scansionato | ✅ Sì |
| PDF dove il testo è sfocato o illeggibile | ⚠️ L'OCR potrebbe migliorarlo |
| Un modulo PDF che non riesci a compilare | ✅ OCR + Compila PDF aiuteranno |
Un modo rapido per verificare: prova a selezionare il testo su una pagina. Se riesci a evidenziare una parola, il PDF ha già un livello di testo. Se il cursore crea solo un riquadro di selezione intorno a un'area (come selezionare un'area immagine), è un'immagine scansionata e ha bisogno dell'OCR.
Come funziona l'OCR (sotto il cofano)
Turn any PDF into an editable Word document in seconds.
- Rendering della pagina — ogni pagina del PDF viene renderizzata ad alta risoluzione (equivalente a 300+ DPI) come immagine
- Pre-elaborazione — l'immagine viene raddrizzata, ripulita dal rumore e convertita in scala di grigi
- Rilevamento del testo — il motore OCR identifica le regioni che sembrano testo (colonne, righe, parole)
- Riconoscimento dei caratteri — ogni regione di caratteri viene confrontata con un modello addestrato per la lingua selezionata
- Creazione del livello di testo — i caratteri riconosciuti vengono posizionati nelle loro posizioni rilevate sopra l'immagine originale
- Ricostruzione del PDF — viene creato un nuovo PDF con l'immagine originale più il livello di testo invisibile
La qualità dell'OCR dipende da: risoluzione della scansione (più alta è meglio), qualità del documento (stampa nitida contro inchiostro sbiadito), corrispondenza della lingua, e se il testo è digitato o scritto a mano. PDFlexa usa Tesseract — il motore OCR open source più utilizzato al mondo, addestrato su oltre 100 lingue.
Consigli per risultati OCR migliori
Scansiona a 300 DPI o superiore. La maggior parte degli scanner consumer usa 150 DPI di default, che è sufficiente per la visualizzazione ma produce risultati OCR scarsi. Usa 300 DPI per il testo, 600 DPI per caratteri molto piccoli.
Scansiona in scala di grigi o bianco e nero. Le scansioni a colori sono più pesanti e non migliorano la qualità dell'OCR per i documenti di testo standard. La scala di grigi è il punto ideale.
Assicurati che la pagina sia piatta e dritta. Pagine curve (dovute alla rilegatura del libro), scansioni storte o ombre da una fotocamera di un telefono riducono tutte la precisione. La maggior parte degli scanner piani gestisce bene questo aspetto; le scansioni con fotocamera del telefono sono le più problematiche.
Scegli la lingua corretta. Tesseract usa modelli addestrati specifici per lingua. Un documento tedesco elaborato con OCR in inglese avrà risultati scarsi sulle dieresi (ä, ö, ü). Fai sempre corrispondere la lingua.
Il testo maiuscolo e stampato viene riconosciuto meglio della scrittura a mano. L'OCR standard è progettato per il testo stampato. Il riconoscimento della scrittura a mano è un problema separato (più difficile) che Tesseract gestisce male.
Precisione dell'OCR: cosa aspettarsi
| Qualità del documento | Precisione prevista |
|---|---|
| Pulito, digitato, scansionato piatto a 300 DPI | 98-99% di precisione dei caratteri |
| Scansione da ufficio standard a 150 DPI | 92-96% di precisione |
| Vecchio documento con inchiostro sbiadito | 80-90% di precisione |
| Appunti scritti a mano | 50-75% (varia molto) |
| Articolo accademico a più colonne | 90-95% (il rilevamento del layout è più difficile) |
| Scrittura non latina (arabo, cinese, coreano) | 85-95% con la lingua corretta |
Per i documenti critici (contratti, atti legali), rivedi sempre l'output dell'OCR alla ricerca di errori — specialmente nomi propri, numeri e date.
OCR vs. da PDF a Word: qual è la differenza?
| OCR PDF | Da PDF a Word | |
|---|---|---|
| Output | PDF ricercabile (stesso aspetto) o .txt | .docx modificabile |
| Ideale per | Rendere ricercabile/accessibile una scansione | Modificare il contenuto in Microsoft Word |
| Layout | Layout originale preservato perfettamente | Il layout potrebbe spostarsi nella conversione in Word |
| Caso d'uso | Archiviazione, ricerca, accessibilità | Riutilizzare e modificare il contenuto |
Se vuoi modificare il contenuto scansionato in Word, esegui prima l'OCR e poi usa Da PDF a Word — l'OCR fornisce al convertitore testo reale su cui lavorare invece di regioni immagine vuote.
Domande frequenti
L'OCR cambia l'aspetto del mio PDF? No. Il livello di testo OCR è invisibile — si trova dietro l'immagine della pagina. Il PDF appare identico prima e dopo l'OCR. L'unica differenza è che ora il testo è selezionabile e ricercabile.
L'OCR può leggere la scrittura a mano? L'OCR standard è addestrato per il testo stampato ed è inaffidabile sulla scrittura a mano. I risultati variano molto a seconda di quanto chiaramente e in modo uniforme è formata la scrittura. Per i documenti scritti a mano importanti, la trascrizione manuale è più affidabile.
Quante pagine posso elaborare con l'OCR in una volta sola? L'OCR basato su browser di PDFlexa supporta fino a 50 pagine per caricamento. Per documenti più lunghi, dividi il PDF in parti, esegui l'OCR su ogni parte, poi unisci i risultati.
Perché l'OCR richiede molto tempo? Ogni pagina viene elaborata individualmente: renderizzata ad alta risoluzione, analizzata e riconosciuta. Un documento di 20 pagine potrebbe richiedere 1-3 minuti nel browser. L'elaborazione avviene sul tuo dispositivo — la velocità dipende dalla tua CPU e memoria.
L'OCR è gratuito? Sì. L'OCR di PDFlexa funziona interamente nel tuo browser usando Tesseract.js open source, senza alcun costo. Nessun account richiesto, nessun limite giornaliero sullo strumento OCR.