OCR — optische tekenherkenning — zet de afbeelding van tekst in een gescande PDF om in echte, selecteerbare, doorzoekbare en kopieerbare tekens. Deze gids legt uit hoe OCR werkt, wanneer je het nodig hebt, en hoe je het gratis toepast in je browser.
Waarom Hebben Gescande PDF's OCR Nodig?
Wanneer je een papieren document scant, maakt de scanner een foto van de pagina — geen tekstbestand. Een gescande PDF is in wezen een JPEG of TIFF ingesloten in een PDF-container. Je kunt hem bekijken, maar:
- Je kunt geen tekst selecteren of kopiëren
- Ctrl+F (Zoeken) levert nul resultaten op
- Schermlezers kunnen hem niet voorlezen (niet toegankelijk)
- Zoekmachines kunnen de inhoud niet indexeren
- Je kunt geen formuliervelden invullen of tekst markeren
OCR leest die afbeelding en produceert een tekstlaag — een onzichtbare laag herkende tekens, precies over de afbeelding heen gelegd. Na OCR ziet het document er identiek uit, maar heeft het nu echte tekst eronder waarmee je kunt werken.
Hoe Je OCR Gratis Online Toepast op een PDF
Reduce your PDF file size instantly. No software needed.
Met PDFlexa OCR:
- Ga naar PDFlexa OCR
- Upload je gescande PDF (slepen en neerzetten, of klik op Bestand kiezen)
- Selecteer de taal van je document in het keuzemenu (24 talen ondersteund)
- Kies het uitvoerformaat:
- Doorzoekbare PDF — behoudt het originele uiterlijk, voegt een onzichtbare tekstlaag toe
- Platte tekst (.txt) — alleen geëxtraheerde tekst, geen lay-out
- Klik op OCR Uitvoeren
- Download het resultaat
De verwerking draait in je browser met Tesseract.js. Bij grote PDF's (30+ pagina's) duurt de verwerking een paar minuten. Er wordt geen bestand naar een server geüpload.
Ondersteunde talen zijn onder meer: Engels, Frans, Duits, Spaans, Portugees, Italiaans, Nederlands, Pools, Russisch, Arabisch, Chinees (vereenvoudigd), Japans, Koreaans, Hindi, Turks, en 9 meer.
Wanneer is OCR Nodig?
| Documenttype | OCR nodig? |
|---|---|
| Papieren document gescand naar PDF | ✅ Ja — het is een afbeelding |
| Foto van een document gemaakt met een telefoon | ✅ Ja |
| PDF gemaakt vanuit een Word-/Excel-/Google Docs-bestand | ❌ Nee — heeft al een tekstlaag |
| PDF rechtstreeks geëxporteerd vanuit software (facturen, bonnetjes) | ❌ Nee — heeft al tekst |
| Oud gescand archiefdocument | ✅ Ja |
| PDF waarbij tekst wazig of onleesbaar is | ⚠️ OCR kan het verbeteren |
| Een formulier-PDF die je niet kunt invullen | ✅ OCR + Formulier Invullen helpt |
Een snelle manier om te controleren: probeer tekst op een pagina te selecteren. Kun je een woord markeren, dan heeft de PDF al een tekstlaag. Maakt de cursor alleen een selectievak rond een gebied (zoals bij het selecteren van een afbeeldingsgebied), dan is het een gescande afbeelding en heb je OCR nodig.
Hoe OCR Werkt (Onder de Motorkap)
Turn any PDF into an editable Word document in seconds.
- Paginaweergave — elke pagina van de PDF wordt weergegeven op hoge resolutie (equivalent aan 300+ DPI) als afbeelding
- Voorbewerking — de afbeelding wordt rechtgetrokken, ontdaan van ruis, en omgezet naar grijstinten
- Tekstdetectie — de OCR-engine herkent gebieden die op tekst lijken (kolommen, regels, woorden)
- Tekenherkenning — elk tekengebied wordt vergeleken met een getraind model voor de geselecteerde taal
- Tekstlaag maken — herkende tekens worden op hun gedetecteerde posities over de originele afbeelding geplaatst
- PDF-reconstructie — er wordt een nieuwe PDF gemaakt met de originele afbeelding plus de onzichtbare tekstlaag
De kwaliteit van OCR hangt af van: scanresolutie (hoger is beter), documentkwaliteit (heldere druk versus vervaagde inkt), taalovereenkomst, en of de tekst getypt of handgeschreven is. PDFlexa gebruikt Tesseract — de meest gebruikte opensource-OCR-engine, getraind op 100+ talen.
Tips voor Betere OCR-Resultaten
Scan op 300 DPI of hoger. De meeste consumentenscanners staan standaard op 150 DPI, genoeg om te bekijken maar met matige OCR-resultaten. Gebruik 300 DPI voor tekst, 600 DPI voor zeer kleine druk.
Scan in grijstinten of zwart-wit. Kleurenscans zijn groter en verbeteren de OCR-kwaliteit niet bij standaard tekstdocumenten. Grijstinten is de gouden middenweg.
Zorg dat de pagina vlak en recht ligt. Gebogen pagina's (door boekbinding), scheve scans, of schaduwen van een telefooncamera verlagen allemaal de nauwkeurigheid. De meeste flatbedscanners gaan hier goed mee om; scans met een telefooncamera zijn het lastigst.
Kies de juiste taal. Tesseract gebruikt taalspecifieke getrainde modellen. Een Duits document verwerkt met Engelse OCR geeft slechte resultaten bij umlauten (ä, ö, ü). Kies altijd de juiste taal.
Grote letters en gedrukte tekst herkennen beter dan handschrift. Standaard OCR is ontworpen voor gedrukte tekst. Handschriftherkenning is een apart (lastiger) probleem dat Tesseract slecht aankan.
OCR-Nauwkeurigheid: Wat Kun Je Verwachten?
| Documentkwaliteit | Verwachte nauwkeurigheid |
|---|---|
| Schoon, getypt, vlak gescand op 300 DPI | 98–99% tekennauwkeurigheid |
| Standaard kantoorscan op 150 DPI | 92–96% nauwkeurigheid |
| Oud document met vervaagde inkt | 80–90% nauwkeurigheid |
| Handgeschreven notities | 50–75% (sterk wisselend) |
| Academisch paper met meerdere kolommen | 90–95% (lay-outherkenning lastiger) |
| Niet-Latijns schrift (Arabisch, Chinees, Koreaans) | 85–95% met de juiste taal |
Controleer bij kritieke documenten (contracten, juridische dossiers) altijd de OCR-uitvoer op fouten — vooral eigennamen, cijfers en datums.
OCR versus PDF naar Word: Wat is het Verschil?
| OCR PDF | PDF naar Word | |
|---|---|---|
| Uitvoer | Doorzoekbare PDF (zelfde uiterlijk) of .txt | Bewerkbaar .docx |
| Het best voor | Een scan doorzoekbaar/toegankelijk maken | De inhoud bewerken in Microsoft Word |
| Lay-out | Originele lay-out perfect behouden | Lay-out kan verschuiven bij conversie naar Word |
| Toepassing | Archiveren, zoeken, toegankelijkheid | Inhoud hergebruiken en bewerken |
Wil je de gescande inhoud bewerken in Word, voer dan eerst OCR uit en gebruik daarna PDF naar Word — OCR geeft de converter echte tekst om mee te werken in plaats van lege afbeeldingsgebieden.
Veelgestelde Vragen
Verandert OCR het uiterlijk van mijn PDF? Nee. De OCR-tekstlaag is onzichtbaar — hij ligt achter de afbeelding van de pagina. De PDF ziet er voor en na OCR identiek uit. Het enige verschil is dat tekst nu selecteerbaar en doorzoekbaar is.
Kan OCR handschrift lezen? Standaard OCR is getraind op gedrukte tekst en onbetrouwbaar bij handschrift. Resultaten wisselen sterk, afhankelijk van hoe duidelijk en consistent het handschrift is. Voor belangrijke handgeschreven documenten is handmatig overtypen betrouwbaarder.
Hoeveel pagina's kan ik in één keer door OCR halen? De browsergebaseerde OCR van PDFlexa ondersteunt tot 50 pagina's per upload. Splits de PDF voor langere documenten in delen, voer OCR uit op elk deel, en voeg de resultaten daarna samen.
Waarom duurt OCR zo lang? Elke pagina wordt apart verwerkt: weergegeven op hoge resolutie, geanalyseerd en herkend. Een document van 20 pagina's kan 1–3 minuten duren in de browser. De verwerking draait op je eigen apparaat — de snelheid hangt af van je processor en geheugen.
Is OCR gratis? Ja. PDFlexa OCR draait volledig in je browser met de opensource Tesseract.js, zonder kosten. Geen account nodig, geen dagelijkse limiet op de OCR-tool.
Digitaliseer je regelmatig papieren dossiers? Bekijk onze PDF-tools voor accountants of PDF-tools voor onderzoekers voor gerelateerde workflows.