KI-gestützt

Text aus jedem PDF oder Bild extrahieren

OCR in über 30 Sprachen. Exportiere als durchsuchbares PDF, Word DOCX, TXT oder Markdown. Läuft vollständig in deinem Browser — nichts wird auf einen Server hochgeladen.

Ziehen & Ablegen oder zum Hochladen klicken

Gescanntes PDF, JPG, PNG, WebP oder TIFF

Max. 100 Seiten pro PDF · Mehrere Bilder werden unterstützt

Unterstützte Sprachen

Arabisch Bulgarisch Chinesisch (vereinfacht) Chinesisch (traditionell) Kroatisch Tschechisch Dänisch Niederländisch Englisch Finnisch Französisch Deutsch Griechisch Hebräisch Hindi Ungarisch Indonesisch Italienisch Japanisch Koreanisch Norwegisch Polnisch Portugiesisch Rumänisch Russisch Serbisch Slowakisch Slowenisch Spanisch Schwedisch Thailändisch Türkisch Ukrainisch

Exportformate

  • Durchsuchbares PDF (empfohlen) — Ursprüngliches Layout bleibt erhalten; Text ist in jedem PDF-Betrachter auswählbar
  • Word-Dokument (.docx) — In Microsoft Word oder Google Docs öffnen und bearbeiten
  • Reiner Text (.txt) — Sauberer Textausgabe, UTF-8-kodiert
  • Markdown (.md) — Strukturierter Text mit Absatzgruppierung

100 % Privat

Die gesamte OCR-Verarbeitung läuft mithilfe von WebAssembly in deinem Browser. Deine Dateien werden nie an einen Server gesendet — auch nicht an unseren. Die Verarbeitung ist so privat wie das Lesen eines Dokuments auf deinem eigenen Bildschirm.

Warum PDFlexa AI OCR?

Tesseract-LSTM-Engine

Angetrieben vom LSTM-Neuronalnetz von Tesseract — dem Industriestandard für Open-Source-OCR mit 95–99 % Worterkennungsgenauigkeit bei sauberen Dokumenten.

Layout bleibt erhalten

Der durchsuchbare PDF-Export hält das originale Seitenbild intakt und fügt eine unsichtbare Textebene hinzu — so bleiben Ränder, Spalten und visuelle Elemente vollständig erhalten.

Verarbeitung im Hintergrund

Ein dedizierter Web Worker führt die OCR in einem Hintergrund-Thread aus — dein Browser-Tab bleibt voll interaktiv, während große, mehrseitige Dokumente verarbeitet werden.

33 Sprachen

Von Arabisch und Chinesisch bis Ukrainisch und Thailändisch — deckt praktisch jede wichtige Weltsprache ab, einschließlich rechts-nach-links geschriebener Schriften.

4 Exportformate

Durchsuchbares PDF, Word DOCX, reines TXT und Markdown — exportiere direkt in das Format, das zu deinem Workflow passt, ganz ohne Konvertierungsschritt.

Keine Datenspeicherung

Da die Verarbeitung deinen Browser nie verlässt, gibt es keine Dateien, die aufbewahrt oder gelöscht werden müssten. Deine Dokumente sind so privat wie eine Datei auf deinem eigenen Schreibtisch.

So extrahieren Sie Text aus einem gescannten PDF

Lade dein gescanntes PDF oder Bild hoch

Ziehe ein gescanntes PDF, JPG, PNG, WebP oder TIFF in den Upload-Bereich, oder klicke auf „Datei auswählen“, um zu suchen. Mehrseitige PDFs und mehrere Bilddateien werden unterstützt.

Sprache und Ausgabeformat wählen

Wähle die Sprache des Dokuments aus 33 verfügbaren Optionen. Wähle dann dein bevorzugtes Exportformat — für maximale Kompatibilität wird das durchsuchbare PDF empfohlen.

„OCR starten“ klicken und herunterladen

Die OCR-Engine verarbeitet dein Dokument in einem Hintergrund-Worker. Ein Fortschrittsbalken zeigt die aktuell verarbeitete Seite an. Nach Abschluss lädst du dein Ergebnis sofort herunter.

Häufig gestellte Fragen zu OCR

Was ist OCR und wie funktioniert es?

OCR (optische Zeichenerkennung) wandelt Textbilder — gescannte Dokumente, Fotos gedruckter Seiten oder reine Bild-PDFs — in maschinenlesbare Zeichen um. Die Engine analysiert Pixelmuster und ordnet sie Buchstaben, Zahlen und Satzzeichen zu. Pdflexa nutzt Tesseract, die weltweit präziseste Open-Source-OCR-Engine, die vollständig in deinem Browser läuft.

Welche Dateiformate akzeptiert das OCR-Tool?

Du kannst gescannte PDF-Dateien sowie JPEG/JPG-, PNG-, WebP- und TIFF-Bilder hochladen. Mehrseitige PDFs werden Seite für Seite verarbeitet (bis zu 100 Seiten pro Datei). Mit dem Stapel-Upload kannst du mehrere Bilder gleichzeitig per OCR verarbeiten.

Wie viele Sprachen unterstützt die OCR-Engine?

Die OCR-Engine unterstützt 33 Sprachen, darunter Deutsch, Englisch, Spanisch, Französisch, Chinesisch (vereinfacht und traditionell), Japanisch, Koreanisch, Arabisch, Russisch, Hindi und mehr. Wähle vor der Verarbeitung die richtige Dokumentsprache, um die Genauigkeit zu maximieren.

Wird mein Dokument auf die Server von Pdflexa hochgeladen?

Nein. Jeder Schritt — PDF-Rendering, OCR-Erkennung und Ausgabeerstellung — läuft vollständig in deinem Browser mithilfe von WebAssembly und JavaScript ab. Deine Dateien verlassen nie dein Gerät, was dies zum privatesten online verfügbaren OCR-Tool macht.

Welche Ausgabeformate kann ich exportieren?

Du kannst den erkannten Text als durchsuchbares PDF (Originalbild mit unsichtbarer Textebene, wodurch der Text in jedem PDF-Betrachter auswählbar und kopierbar ist), reines TXT, Microsoft Word DOCX oder Markdown exportieren. Alle Formate erhalten die logische Lesereihenfolge des Textes.

Wie genau ist die Texterkennung?

Die Genauigkeit hängt von Dokumentqualität, Auflösung und Sprache ab. Saubere, hochauflösende Scans mit 300 DPI oder mehr in einer unterstützten Sprache erreichen mit der LSTM-Engine von Tesseract in der Regel über 98 % Wortgenauigkeit. Handschrift, dekorative Schriftarten, kontrastarme Dokumente oder Seiten mit gemischten Sprachen führen zu geringerer Genauigkeit.

Kann ich ein großes PDF mit vielen Seiten per OCR verarbeiten?

Ja. Die OCR-Engine verarbeitet Seiten nacheinander über einen Hintergrund-Web-Worker, sodass die Benutzeroberfläche deines Browsers durchgehend reaktionsfähig bleibt. Es werden bis zu 100 Seiten pro Datei unterstützt. Bei sehr großen Dokumenten kann die Verarbeitung einige Minuten dauern — eine Echtzeit-Fortschrittsanzeige zeigt, welche Seite gerade verarbeitet wird.

Bleibt bei OCR das ursprüngliche Dokumentlayout erhalten?

Der durchsuchbare PDF-Export erhält das ursprüngliche visuelle Layout perfekt, da das Seitenbild intakt bleibt und der Text als unsichtbare Überlagerung geschrieben wird. Bei TXT-, DOCX- und Markdown-Exporten wird der Text in Lesereihenfolge extrahiert, die visuelle Formatierung (Spalten, Tabellen) jedoch nur angenähert und nicht exakt nachgebildet.

Verwandte Tools