AI-drevet

Hent ut Tekst fra Hvilken som Helst PDF eller Bilde

OCR på 30+ språk. Eksporter som søkbar PDF, Word DOCX, TXT eller Markdown. Kjører helt i nettleseren din — ingenting lastes opp til en server.

Dra og slipp eller klikk for å laste opp

Skannet PDF, JPG, PNG, WebP eller TIFF

Maks 100 sider per PDF · Flere bilder støttes

Støttede språk

Arabisk Bulgarsk Kinesisk (forenklet) Kinesisk (tradisjonell) Kroatisk Tsjekkisk Dansk Nederlandsk Engelsk Finsk Fransk Tysk Gresk Hebraisk Hindi Ungarsk Indonesisk Italiensk Japansk Koreansk Norsk Polsk Portugisisk Rumensk Russisk Serbisk Slovakisk Slovensk Spansk Svensk Thai Tyrkisk Ukrainsk

Eksportformater

  • Søkbar PDF (anbefalt) — Opprinnelig layout bevart; teksten kan markeres i enhver PDF-leser
  • Word-dokument (.docx) — Åpne og rediger i Microsoft Word eller Google Docs
  • Ren tekst (.txt) — Ren tekstutdata, UTF-8-kodet
  • Markdown (.md) — Strukturert tekst gruppert i avsnitt

100 % Privat

All OCR-behandling kjører i nettleseren din ved hjelp av WebAssembly. Filene dine sendes aldri til noen server — ikke engang vår egen. Behandlingen er like privat som å lese et dokument på din egen skjerm.

Hvorfor PDFlexa AI OCR?

Tesseract LSTM-Motor

Drevet av Tesseracts LSTM-nevrale nettverk — industristandarden for åpen kildekode-OCR, med 95–99 % ordnøyaktighet på rene dokumenter.

Layout Bevart

Den søkbare PDF-eksporten holder det originale sidebildet intakt og legger til et usynlig tekstlag — og bevarer dermed hver marg, kolonne og visuelt element.

Bakgrunnsbehandling

En dedikert Web Worker kjører OCR i en bakgrunnstråd — nettleserfanen din forblir fullt interaktiv mens store, flersidede dokumenter behandles.

33 Språk

Fra arabisk og kinesisk til ukrainsk og thai — dekker praktisk talt alle store verdensspråk, inkludert høyre-til-venstre-skriftsystemer.

4 Eksportformater

Søkbar PDF, Word DOCX, ren TXT og Markdown — eksporter direkte til formatet som passer arbeidsflyten din, uten konverteringstrinn.

Ingen Datalagring

Fordi behandlingen aldri forlater nettleseren din, finnes det ingen filer å oppbevare eller slette. Dokumentene dine er like private som en fil på ditt eget skrivebord.

Slik henter du ut tekst fra en skannet PDF

Last opp din skannede PDF eller ditt bilde

Dra og slipp en skannet PDF, JPG, PNG, WebP eller TIFF i opplastingsområdet, eller klikk på «Velg fil» for å bla gjennom. Flersidede PDF-er og flere bildefiler støttes.

Velg språk og utdataformat

Velg språket dokumentet er skrevet på blant 33 tilgjengelige alternativer. Velg deretter ønsket eksportformat — søkbar PDF anbefales for maksimal kompatibilitet.

Klikk på «Start OCR» og last ned

OCR-motoren behandler dokumentet ditt i en bakgrunns-worker. En fremdriftsindikator viser hvilken side som for øyeblikket behandles. Når det er ferdig, laster du ned resultatet umiddelbart.

Ofte stilte spørsmål om OCR

Hva er OCR, og hvordan fungerer det?

OCR (optisk tegngjenkjenning) omdanner bilder av tekst — skannede dokumenter, bilder av trykte sider eller PDF-er med bare bilder — til maskinlesbare tegn. Motoren analyserer pikselmønstre og matcher dem med bokstaver, tall og tegnsetting. Pdflexa bruker Tesseract, verdens mest nøyaktige åpen kildekode-OCR-motor, som kjører helt i nettleseren din.

Hvilke filformater godtar OCR-verktøyet?

Du kan laste opp skannede PDF-filer samt JPEG/JPG-, PNG-, WebP- og TIFF-bilder. Flersidede PDF-er behandles side for side (opptil 100 sider per fil). Batch-opplasting lar deg kjøre OCR på flere bilder samtidig.

Hvor mange språk støtter OCR-motoren?

OCR-motoren støtter 33 språk, inkludert norsk, engelsk, spansk, fransk, tysk, kinesisk (forenklet og tradisjonell), japansk, koreansk, arabisk, russisk, hindi og flere. Velg riktig dokumentspråk før behandling for å maksimere nøyaktigheten.

Blir dokumentet mitt lastet opp til Pdflexas servere?

Nei. Hvert trinn — PDF-gjengivelse, OCR-gjenkjenning og generering av utdata — kjører helt inne i nettleseren din ved hjelp av WebAssembly og JavaScript. Filene dine forlater aldri enheten din, noe som gjør dette til det mest private OCR-verktøyet som er tilgjengelig på nettet.

Hvilke utdataformater kan jeg eksportere?

Du kan eksportere den gjenkjente teksten som søkbar PDF (originalbilde med et usynlig tekstlag, som gjør det markerbart og kopierbart i enhver PDF-leser), ren TXT, Microsoft Word DOCX eller Markdown. Alle formater bevarer tekstens logiske leserekkefølge.

Hvor nøyaktig er tekstgjenkjenningen?

Nøyaktigheten avhenger av dokumentets kvalitet, oppløsning og språk. Rene skanninger i høy oppløsning (300 DPI eller mer) på et støttet språk oppnår vanligvis over 98 % ordnøyaktighet med Tesseracts LSTM-motor. Håndskrift, dekorative skrifttyper, dokumenter med lav kontrast eller sider med blandede språk vil ha lavere nøyaktighet.

Kan jeg kjøre OCR på en stor PDF med mange sider?

Ja. OCR-motoren behandler sider sekvensielt ved hjelp av en bakgrunns-Web Worker, slik at nettleserens grensesnitt forblir responsivt hele tiden. Opptil 100 sider per fil støttes. For svært store dokumenter kan behandlingen ta noen minutter — en fremdriftsindikator i sanntid viser hvilken side som behandles.

Bevarer OCR det opprinnelige dokumentlayoutet?

Den søkbare PDF-eksporten bevarer det opprinnelige visuelle layoutet perfekt, fordi sidebildet holdes intakt og teksten skrives som et usynlig overlegg. For TXT-, DOCX- og Markdown-eksport hentes teksten ut i leserekkefølge, men den visuelle formateringen (kolonner, tabeller) tilnærmes snarere enn gjengis nøyaktig.

Relaterte verktøy