OCR Gebruiken op een PDF (Gescande Documenten Doorzoekbaar Maken)

· · · 8 min leestijd

OCR — optische tekenherkenning — zet de afbeelding van tekst in een gescande PDF om in echte, selecteerbare, doorzoekbare en kopieerbare tekens. Deze gids legt uit hoe OCR werkt, wanneer je het nodig hebt, en hoe je het gratis toepast in je browser.


Waarom Hebben Gescande PDF's OCR Nodig?

Wanneer je een papieren document scant, maakt de scanner een foto van de pagina — geen tekstbestand. Een gescande PDF is in wezen een JPEG of TIFF ingesloten in een PDF-container. Je kunt hem bekijken, maar:

  • Je kunt geen tekst selecteren of kopiëren
  • Ctrl+F (Zoeken) levert nul resultaten op
  • Schermlezers kunnen hem niet voorlezen (niet toegankelijk)
  • Zoekmachines kunnen de inhoud niet indexeren
  • Je kunt geen formuliervelden invullen of tekst markeren

OCR leest die afbeelding en produceert een tekstlaag — een onzichtbare laag herkende tekens, precies over de afbeelding heen gelegd. Na OCR ziet het document er identiek uit, maar heeft het nu echte tekst eronder waarmee je kunt werken.


Hoe Je OCR Gratis Online Toepast op een PDF

Compress PDF Online — Free

Reduce your PDF file size instantly. No software needed.

Use Tool Now →

Met PDFlexa OCR:

  1. Ga naar PDFlexa OCR
  2. Upload je gescande PDF (slepen en neerzetten, of klik op Bestand kiezen)
  3. Selecteer de taal van je document in het keuzemenu (24 talen ondersteund)
  4. Kies het uitvoerformaat:
    • Doorzoekbare PDF — behoudt het originele uiterlijk, voegt een onzichtbare tekstlaag toe
    • Platte tekst (.txt) — alleen geëxtraheerde tekst, geen lay-out
  5. Klik op OCR Uitvoeren
  6. Download het resultaat

De verwerking draait in je browser met Tesseract.js. Bij grote PDF's (30+ pagina's) duurt de verwerking een paar minuten. Er wordt geen bestand naar een server geüpload.

Ondersteunde talen zijn onder meer: Engels, Frans, Duits, Spaans, Portugees, Italiaans, Nederlands, Pools, Russisch, Arabisch, Chinees (vereenvoudigd), Japans, Koreaans, Hindi, Turks, en 9 meer.


Wanneer is OCR Nodig?

Documenttype OCR nodig?
Papieren document gescand naar PDF ✅ Ja — het is een afbeelding
Foto van een document gemaakt met een telefoon ✅ Ja
PDF gemaakt vanuit een Word-/Excel-/Google Docs-bestand ❌ Nee — heeft al een tekstlaag
PDF rechtstreeks geëxporteerd vanuit software (facturen, bonnetjes) ❌ Nee — heeft al tekst
Oud gescand archiefdocument ✅ Ja
PDF waarbij tekst wazig of onleesbaar is ⚠️ OCR kan het verbeteren
Een formulier-PDF die je niet kunt invullen ✅ OCR + Formulier Invullen helpt

Een snelle manier om te controleren: probeer tekst op een pagina te selecteren. Kun je een woord markeren, dan heeft de PDF al een tekstlaag. Maakt de cursor alleen een selectievak rond een gebied (zoals bij het selecteren van een afbeeldingsgebied), dan is het een gescande afbeelding en heb je OCR nodig.


Hoe OCR Werkt (Onder de Motorkap)

Convert PDF to Word — Free

Turn any PDF into an editable Word document in seconds.

Use Tool Now →
  1. Paginaweergave — elke pagina van de PDF wordt weergegeven op hoge resolutie (equivalent aan 300+ DPI) als afbeelding
  2. Voorbewerking — de afbeelding wordt rechtgetrokken, ontdaan van ruis, en omgezet naar grijstinten
  3. Tekstdetectie — de OCR-engine herkent gebieden die op tekst lijken (kolommen, regels, woorden)
  4. Tekenherkenning — elk tekengebied wordt vergeleken met een getraind model voor de geselecteerde taal
  5. Tekstlaag maken — herkende tekens worden op hun gedetecteerde posities over de originele afbeelding geplaatst
  6. PDF-reconstructie — er wordt een nieuwe PDF gemaakt met de originele afbeelding plus de onzichtbare tekstlaag

De kwaliteit van OCR hangt af van: scanresolutie (hoger is beter), documentkwaliteit (heldere druk versus vervaagde inkt), taalovereenkomst, en of de tekst getypt of handgeschreven is. PDFlexa gebruikt Tesseract — de meest gebruikte opensource-OCR-engine, getraind op 100+ talen.


Tips voor Betere OCR-Resultaten

Scan op 300 DPI of hoger. De meeste consumentenscanners staan standaard op 150 DPI, genoeg om te bekijken maar met matige OCR-resultaten. Gebruik 300 DPI voor tekst, 600 DPI voor zeer kleine druk.

Scan in grijstinten of zwart-wit. Kleurenscans zijn groter en verbeteren de OCR-kwaliteit niet bij standaard tekstdocumenten. Grijstinten is de gouden middenweg.

Zorg dat de pagina vlak en recht ligt. Gebogen pagina's (door boekbinding), scheve scans, of schaduwen van een telefooncamera verlagen allemaal de nauwkeurigheid. De meeste flatbedscanners gaan hier goed mee om; scans met een telefooncamera zijn het lastigst.

Kies de juiste taal. Tesseract gebruikt taalspecifieke getrainde modellen. Een Duits document verwerkt met Engelse OCR geeft slechte resultaten bij umlauten (ä, ö, ü). Kies altijd de juiste taal.

Grote letters en gedrukte tekst herkennen beter dan handschrift. Standaard OCR is ontworpen voor gedrukte tekst. Handschriftherkenning is een apart (lastiger) probleem dat Tesseract slecht aankan.


OCR-Nauwkeurigheid: Wat Kun Je Verwachten?

Documentkwaliteit Verwachte nauwkeurigheid
Schoon, getypt, vlak gescand op 300 DPI 98–99% tekennauwkeurigheid
Standaard kantoorscan op 150 DPI 92–96% nauwkeurigheid
Oud document met vervaagde inkt 80–90% nauwkeurigheid
Handgeschreven notities 50–75% (sterk wisselend)
Academisch paper met meerdere kolommen 90–95% (lay-outherkenning lastiger)
Niet-Latijns schrift (Arabisch, Chinees, Koreaans) 85–95% met de juiste taal

Controleer bij kritieke documenten (contracten, juridische dossiers) altijd de OCR-uitvoer op fouten — vooral eigennamen, cijfers en datums.


OCR versus PDF naar Word: Wat is het Verschil?

OCR PDF PDF naar Word
Uitvoer Doorzoekbare PDF (zelfde uiterlijk) of .txt Bewerkbaar .docx
Het best voor Een scan doorzoekbaar/toegankelijk maken De inhoud bewerken in Microsoft Word
Lay-out Originele lay-out perfect behouden Lay-out kan verschuiven bij conversie naar Word
Toepassing Archiveren, zoeken, toegankelijkheid Inhoud hergebruiken en bewerken

Wil je de gescande inhoud bewerken in Word, voer dan eerst OCR uit en gebruik daarna PDF naar Word — OCR geeft de converter echte tekst om mee te werken in plaats van lege afbeeldingsgebieden.


Veelgestelde Vragen

Verandert OCR het uiterlijk van mijn PDF? Nee. De OCR-tekstlaag is onzichtbaar — hij ligt achter de afbeelding van de pagina. De PDF ziet er voor en na OCR identiek uit. Het enige verschil is dat tekst nu selecteerbaar en doorzoekbaar is.

Kan OCR handschrift lezen? Standaard OCR is getraind op gedrukte tekst en onbetrouwbaar bij handschrift. Resultaten wisselen sterk, afhankelijk van hoe duidelijk en consistent het handschrift is. Voor belangrijke handgeschreven documenten is handmatig overtypen betrouwbaarder.

Hoeveel pagina's kan ik in één keer door OCR halen? De browsergebaseerde OCR van PDFlexa ondersteunt tot 50 pagina's per upload. Splits de PDF voor langere documenten in delen, voer OCR uit op elk deel, en voeg de resultaten daarna samen.

Waarom duurt OCR zo lang? Elke pagina wordt apart verwerkt: weergegeven op hoge resolutie, geanalyseerd en herkend. Een document van 20 pagina's kan 1–3 minuten duren in de browser. De verwerking draait op je eigen apparaat — de snelheid hangt af van je processor en geheugen.

Is OCR gratis? Ja. PDFlexa OCR draait volledig in je browser met de opensource Tesseract.js, zonder kosten. Geen account nodig, geen dagelijkse limiet op de OCR-tool.

Digitaliseer je regelmatig papieren dossiers? Bekijk onze PDF-tools voor accountants of PDF-tools voor onderzoekers voor gerelateerde workflows.

Probeer deze gratis PDF-tools

PDF comprimeren → PDF samenvoegen → PDF naar Word → JPG naar PDF →
Abdel B.

Het PDFlexa-team maakt praktische handleidingen om u sneller te laten werken met PDF-bestanden. Alle tools zijn gratis te gebruiken — geen account vereist.

Was dit nuttig? Deel het: Facebook X LinkedIn