OCR — optisk teckenigenkänning — omvandlar bilden av text i en skannad PDF till riktiga, markerbara, sökbara och kopierbara tecken. Den här guiden förklarar hur OCR fungerar, när du behöver det, och hur du tillämpar det gratis i din webbläsare.
Varför behöver skannade PDF-filer OCR?
När du skannar ett pappersdokument skapar skannern en bild av sidan — inte en textfil. En skannad PDF är i grunden en JPEG eller TIFF inbäddad i en PDF-behållare. Du kan visa den, men:
- Du kan inte markera eller kopiera text
- Ctrl+F (sök) ger noll resultat
- Skärmläsare kan inte läsa den (otillgänglig)
- Sökmotorer kan inte indexera dess innehåll
- Du kan inte fylla i formulärfält eller markera text
OCR läser bilden och skapar ett textlager — ett osynligt lager av igenkända tecken placerat exakt ovanpå bilden. Efter OCR ser dokumentet identiskt ut, men nu har det verklig text under som du kan interagera med.
Så tillämpar du OCR på en PDF online (gratis)
Reduce your PDF file size instantly. No software needed.
Med PDFlexa OCR:
- Gå till PDFlexa OCR
- Ladda upp din skannade PDF (dra och släpp eller klicka på Välj en fil)
- Välj dokumentets språk i listmenyn (24 språk stöds)
- Välj utdataformat:
- Sökbar PDF — behåller det ursprungliga utseendet, lägger till ett osynligt textlager
- Ren text (.txt) — endast extraherad text, ingen layout
- Klicka på Kör OCR
- Ladda ner resultatet
Bearbetningen sker i din webbläsare med Tesseract.js. För stora PDF-filer (30+ sidor) tar bearbetningen några minuter. Ingen fil laddas upp till en server.
Språk som stöds inkluderar: engelska, franska, tyska, spanska, portugisiska, italienska, nederländska, polska, ryska, arabiska, kinesiska (förenklad), japanska, koreanska, hindi, turkiska och 9 till.
När behövs OCR?
| Dokumenttyp | OCR behövs? |
|---|---|
| Pappersdokument skannat till PDF | ✅ Ja — det är en bild |
| Foto av ett dokument taget med en telefon | ✅ Ja |
| PDF skapad från en Word-/Excel-/Google Dokument-fil | ❌ Nej — har redan textlager |
| PDF exporterad direkt från programvara (fakturor, kvitton) | ❌ Nej — har redan text |
| Gammalt skannat arkivdokument | ✅ Ja |
| PDF där texten är suddig eller förvrängd | ⚠️ OCR kan förbättra den |
| Ett formulär i PDF-format du inte kan fylla i | ✅ OCR + Fyll i PDF hjälper |
Ett snabbt sätt att kontrollera: försök markera text på en sida. Om du kan markera ett ord har PDF:en redan ett textlager. Om markören bara skapar en markeringsruta runt ett område (som att markera ett bildområde) är det en skannad bild och behöver OCR.
Så fungerar OCR (under huven)
Turn any PDF into an editable Word document in seconds.
- Sidåtergivning — varje sida i PDF:en återges i hög upplösning (motsvarande 300+ DPI) som en bild
- Förbearbetning — bilden vinkeljusteras, avbrusas och konverteras till gråskala
- Textdetektering — OCR-motorn identifierar områden som ser ut som text (kolumner, rader, ord)
- Teckenigenkänning — varje teckenområde matchas mot en tränad modell för det valda språket
- Skapande av textlager — igenkända tecken placeras på sina upptäckta positioner ovanpå originalbilden
- Återuppbyggnad av PDF — en ny PDF skapas med originalbilden plus det osynliga textlagret
OCR-kvaliteten beror på: skanningsupplösning (högre är bättre), dokumentkvalitet (tydlig tryck kontra blekt bläck), språkmatchning, och om texten är maskinskriven eller handskriven. PDFlexa använder Tesseract — den mest använda öppna källkodens OCR-motor, tränad på 100+ språk.
Tips för bättre OCR-resultat
Skanna i 300 DPI eller högre. De flesta konsumentskannrar har standardinställning på 150 DPI, vilket räcker för att visa men ger dåliga OCR-resultat. Använd 300 DPI för text, 600 DPI för mycket liten text.
Skanna i gråskala eller svartvitt. Färgskanningar är större och förbättrar inte OCR-kvaliteten för vanliga textdokument. Gråskala är den optimala punkten.
Se till att sidan är platt och rak. Böjda sidor (från bokbindning), sneda skanningar eller skuggor från en mobilkamera minskar alla noggrannheten. De flesta flatbäddsskannrar hanterar detta bra; mobilkameraskanningar är mest problematiska.
Välj rätt språk. Tesseract använder språkspecifika tränade modeller. Ett tyskt dokument bearbetat med engelsk OCR kommer att ge dåliga resultat på omljud (ä, ö, ü). Matcha alltid språket.
Versaler och tryckt text ger bättre OCR-resultat än handskrift. Standard-OCR är utformat för tryckt text. Handskriftsigenkänning är ett separat (svårare) problem som Tesseract hanterar dåligt.
OCR-noggrannhet: vad du kan förvänta dig
| Dokumentkvalitet | Förväntad noggrannhet |
|---|---|
| Rent, maskinskrivet, platt skannat vid 300 DPI | 98–99 % teckennoggrannhet |
| Standard kontorsskanning vid 150 DPI | 92–96 % noggrannhet |
| Gammalt dokument med bleknat bläck | 80–90 % noggrannhet |
| Handskrivna anteckningar | 50–75 % (varierar kraftigt) |
| Flerkolumns akademisk artikel | 90–95 % (layoutdetektering svårare) |
| Icke-latinsk skrift (arabiska, kinesiska, koreanska) | 85–95 % med korrekt språk |
För kritiska dokument (kontrakt, juridiska handlingar), granska alltid OCR-resultatet för fel — särskilt egennamn, siffror och datum.
OCR kontra PDF till Word: vad är skillnaden?
| OCR PDF | PDF till Word | |
|---|---|---|
| Utdata | Sökbar PDF (samma utseende) eller .txt | Redigerbar .docx |
| Bäst för | Att göra en skanning sökbar/tillgänglig | Redigering av innehållet i Microsoft Word |
| Layout | Ursprunglig layout bevarad perfekt | Layouten kan förskjutas vid Word-konvertering |
| Användningsfall | Arkivering, sökning, tillgänglighet | Återanvändning och redigering av innehållet |
Om du vill redigera det skannade innehållet i Word, kör OCR först och använd sedan PDF till Word — OCR ger konverteraren faktisk text att arbeta med istället för tomma bildregioner.
Vanliga frågor
Ändrar OCR utseendet på min PDF? Nej. OCR-textlagret är osynligt — det ligger bakom bilden av sidan. PDF:en ser identisk ut före och efter OCR. Den enda skillnaden är att texten nu är markerbar och sökbar.
Kan OCR läsa handskrift? Standard-OCR är tränat för tryckt text och är opålitligt på handskrift. Resultaten varierar kraftigt beroende på hur tydligt och konsekvent handskriften är formad. För viktiga handskrivna dokument är manuell avskrift mer pålitlig.
Hur många sidor kan jag OCR-behandla samtidigt? PDFlexas webbläsarbaserade OCR har stöd för upp till 50 sidor per uppladdning. För längre dokument, dela PDF:en i delar, OCR-behandla varje del, och slå sedan ihop resultaten.
Varför tar OCR-behandlingen lång tid? Varje sida bearbetas individuellt: återges i hög upplösning, analyseras och känns igen. Ett 20-sidigt dokument kan ta 1–3 minuter i webbläsaren. Bearbetningen sker på din enhet — hastigheten beror på din processor och minne.
Är OCR gratis? Ja. PDFlexa OCR körs helt i din webbläsare med öppen källkod Tesseract.js utan kostnad. Inget konto krävs, ingen daglig gräns på OCR-verktyget.
Digitaliserar du pappersdokument regelbundet? Se våra PDF-verktyg för revisorer eller PDF-verktyg för forskare för relaterade arbetsflöden.