AI-driven

Extrahera Text från Vilken PDF eller Bild Som Helst

OCR på 30+ språk. Exportera som sökbar PDF, Word DOCX, TXT eller Markdown. Körs helt i din webbläsare — inget laddas upp till en server.

Dra och släpp eller klicka för att ladda upp

Skannad PDF, JPG, PNG, WebP eller TIFF

Max 100 sidor per PDF · Flera bilder stöds

Språk som stöds

Arabiska Bulgariska Kinesiska (förenklad) Kinesiska (traditionell) Kroatiska Tjeckiska Danska Nederländska Engelska Finska Franska Tyska Grekiska Hebreiska Hindi Ungerska Indonesiska Italienska Japanska Koreanska Norska Polska Portugisiska Rumänska Ryska Serbiska Slovakiska Slovenska Spanska Svenska Thailändska Turkiska Ukrainska

Exportformat

  • Sökbar PDF (rekommenderas) — Ursprunglig layout bevarad; texten är markerbar i vilken PDF-läsare som helst
  • Word-dokument (.docx) — Öppna och redigera i Microsoft Word eller Google Docs
  • Ren text (.txt) — Ren textutdata, UTF-8-kodad
  • Markdown (.md) — Strukturerad text grupperad i stycken

100 % Privat

All OCR-bearbetning körs i din webbläsare med hjälp av WebAssembly. Dina filer skickas aldrig till någon server — inte ens vår egen. Bearbetningen är lika privat som att läsa ett dokument på din egen skärm.

Varför PDFlexa AI OCR?

Tesseract LSTM-Motor

Drivs av Tesseracts LSTM-neurala nätverk — branschstandarden för öppen källkod-OCR, med 95–99 % ordnoggrannhet på rena dokument.

Layout Bevarad

Den sökbara PDF-exporten behåller den ursprungliga sidbilden intakt och lägger till ett osynligt textlager — allt bevaras: marginaler, kolumner och visuella element.

Bakgrundsbearbetning

En dedikerad Web Worker kör OCR i en bakgrundstråd — din webbläsarflik förblir helt interaktiv medan stora, flersidiga dokument bearbetas.

33 Språk

Från arabiska och kinesiska till ukrainska och thailändska — täcker praktiskt taget alla stora världsspråk, inklusive höger-till-vänster-skript.

4 Exportformat

Sökbar PDF, Word DOCX, ren TXT och Markdown — exportera direkt till det format som passar ditt arbetsflöde, utan konverteringssteg.

Ingen Datalagring

Eftersom bearbetningen aldrig lämnar din webbläsare finns inga filer att spara eller ta bort. Dina dokument är lika privata som en fil på ditt eget skrivbord.

Så extraherar du text från en skannad PDF

Ladda upp din skannade PDF eller bild

Dra och släpp en skannad PDF, JPG, PNG, WebP eller TIFF i uppladdningsområdet, eller klicka på "Välj fil" för att bläddra. Flersidiga PDF-filer och flera bildfiler stöds.

Välj språk och utdataformat

Välj det språk dokumentet är skrivet på bland 33 tillgängliga alternativ. Välj sedan ditt önskade exportformat — sökbar PDF rekommenderas för maximal kompatibilitet.

Klicka på "Starta OCR" och ladda ner

OCR-motorn bearbetar ditt dokument i en bakgrunds-worker. En förloppsindikator visar vilken sida som för närvarande bearbetas. Ladda ner ditt resultat direkt när det är klart.

Vanliga frågor om OCR

Vad är OCR och hur fungerar det?

OCR (optisk teckenigenkänning) omvandlar bilder av text — skannade dokument, foton av tryckta sidor eller PDF-filer med enbart bilder — till maskinläsbara tecken. Motorn analyserar pixelmönster och matchar dem mot bokstäver, siffror och skiljetecken. Pdflexa använder Tesseract, världens mest exakta OCR-motor med öppen källkod, som körs helt i din webbläsare.

Vilka filformat accepterar OCR-verktyget?

Du kan ladda upp skannade PDF-filer samt JPEG/JPG-, PNG-, WebP- och TIFF-bilder. Flersidiga PDF-filer bearbetas sida för sida (upp till 100 sidor per fil). Med batchuppladdning kan du köra OCR på flera bilder samtidigt.

Hur många språk stöder OCR-motorn?

OCR-motorn stöder 33 språk, inklusive svenska, engelska, spanska, franska, tyska, kinesiska (förenklad och traditionell), japanska, koreanska, arabiska, ryska, hindi och fler. Välj rätt dokumentspråk innan bearbetning för att maximera noggrannheten.

Laddas mitt dokument upp till Pdflexas servrar?

Nej. Varje steg — PDF-rendering, OCR-igenkänning och utdatagenerering — körs helt i din webbläsare med WebAssembly och JavaScript. Dina filer lämnar aldrig din enhet, vilket gör detta till det mest privata OCR-verktyget som finns online.

Vilka utdataformat kan jag exportera?

Du kan exportera den igenkända texten som sökbar PDF (originalbild med ett osynligt textlager, vilket gör den markerbar och kopierbar i vilken PDF-läsare som helst), ren TXT, Microsoft Word DOCX, eller Markdown. Alla format bevarar textens logiska läsordning.

Hur exakt är textigenkänningen?

Noggrannheten beror på dokumentets kvalitet, upplösning och språk. Rena, högupplösta skanningar på 300 DPI eller mer på ett språk som stöds uppnår vanligtvis över 98 % ordnoggrannhet med Tesseracts LSTM-motor. Handskrift, dekorativa typsnitt, lågkontrastdokument eller sidor med blandade språk får lägre noggrannhet.

Kan jag köra OCR på en stor PDF med många sidor?

Ja. OCR-motorn bearbetar sidor sekventiellt med hjälp av en bakgrunds-Web Worker, så din webbläsares gränssnitt förblir responsivt hela tiden. Upp till 100 sidor per fil stöds. För mycket stora dokument kan bearbetningen ta några minuter — en förloppsindikator i realtid visar vilken sida som bearbetas.

Bevarar OCR den ursprungliga dokumentlayouten?

Den sökbara PDF-exporten bevarar den ursprungliga visuella layouten perfekt, eftersom sidbilden hålls intakt och texten skrivs som ett osynligt överlägg. För TXT-, DOCX- och Markdown-export extraheras texten i läsordning, men den visuella formateringen (kolumner, tabeller) approximeras snarare än återges exakt.

Relaterade verktyg