Extrahujte Text z Jakéhokoli PDF nebo Obrázku
OCR ve více než 30 jazycích. Exportujte jako prohledávatelné PDF, Word DOCX, TXT nebo Markdown. Funguje zcela ve vašem prohlížeči — nic se nenahrává na server.
Přetáhněte nebo klikněte pro nahrání
Naskenované PDF, JPG, PNG, WebP nebo TIFF
Max. 100 stran na PDF · Podpora více obrázků
Inicializace…
Váš soubor je připraven
Podporované jazyky
Formáty exportu
- Prohledatelné PDF (doporučeno) — Zachováno původní rozvržení; text je vybratelný v jakémkoli prohlížeči PDF
- Dokument Word (.docx) — Otevřete a upravte v Microsoft Word nebo Google Docs
- Prostý text (.txt) — Čistý textový výstup, kódovaný v UTF-8
- Markdown (.md) — Strukturovaný text seskupený do odstavců
100% Soukromí
Veškeré zpracování OCR probíhá ve vašem prohlížeči pomocí WebAssembly. Vaše soubory nejsou nikdy odeslány na žádný server — ani na náš. Zpracování je stejně soukromé jako čtení dokumentu na vlastní obrazovce.
Proč PDFlexa AI OCR?
Motor Tesseract LSTM
Poháněno neuronovou sítí LSTM Tesseract — průmyslovým standardem pro open source OCR s přesností rozpoznávání slov 95–99 % u čistých dokumentů.
Zachované Rozvržení
Export prohledávatelného PDF zachovává původní obrázek stránky nedotčený a přidává neviditelnou textovou vrstvu — čímž zachovává každý okraj, sloupec a vizuální prvek.
Zpracování na Pozadí
Vyhrazený Web Worker spouští OCR ve vlákně na pozadí — karta vašeho prohlížeče zůstává plně interaktivní během zpracování velkých, vícestránkových dokumentů.
33 Jazyků
Od arabštiny a čínštiny po ukrajinštinu a thajštinu — pokrývá prakticky každý hlavní světový jazyk, včetně písem psaných zprava doleva.
4 Exportní Formáty
Prohledávatelné PDF, Word DOCX, prostý TXT a Markdown — exportujte přímo do formátu, který vyhovuje vašemu pracovnímu postupu, bez konverzního kroku.
Žádné Uchovávání Dat
Protože zpracování nikdy neopustí váš prohlížeč, nejsou zde žádné soubory k uchování nebo smazání. Vaše dokumenty jsou stejně soukromé jako soubor na vašem vlastním stole.
Jak extrahovat text z naskenovaného PDF
Nahrajte svůj naskenovaný PDF nebo obrázek
Přetáhněte naskenovaný PDF, JPG, PNG, WebP nebo TIFF do oblasti pro nahrání, nebo klikněte na „Vybrat soubor“ a procházejte. Podporovány jsou vícestránkové PDF soubory a více obrazových souborů.
Vyberte jazyk a výstupní formát
Vyberte jazyk, ve kterém je dokument napsán, z 33 dostupných možností. Poté vyberte preferovaný exportní formát — pro maximální kompatibilitu se doporučuje prohledávatelné PDF.
Klikněte na „Spustit OCR“ a stáhněte
Motor OCR zpracovává váš dokument ve workeru na pozadí. Ukazatel průběhu zobrazuje aktuálně zpracovávanou stránku. Po dokončení si okamžitě stáhněte svůj výsledek.
Často kladené otázky o OCR
Co je OCR a jak funguje?
OCR (optické rozpoznávání znaků) převádí obrázky textu — naskenované dokumenty, fotografie tištěných stránek nebo PDF obsahující pouze obrázky — na strojově čitelné znaky. Motor analyzuje vzory pixelů a mapuje je na písmena, čísla a interpunkci. Pdflexa používá Tesseract, nejpřesnější open source OCR motor na světě, který běží zcela ve vašem prohlížeči.
Jaké formáty souborů nástroj OCR přijímá?
Můžete nahrát naskenované PDF soubory a obrázky JPEG/JPG, PNG, WebP a TIFF. Vícestránkové PDF soubory jsou zpracovávány stránku po stránce (až 100 stránek na soubor). Dávkové nahrávání vám umožňuje provést OCR na více obrázcích najednou.
Kolik jazyků motor OCR podporuje?
Motor OCR podporuje 33 jazyků, včetně češtiny, angličtiny, španělštiny, francouzštiny, němčiny, čínštiny (zjednodušené a tradiční), japonštiny, korejštiny, arabštiny, ruštiny, hindštiny a dalších. Před zpracováním vyberte správný jazyk dokumentu pro maximalizaci přesnosti.
Je můj dokument nahráván na servery Pdflexa?
Ne. Každý krok — vykreslení PDF, rozpoznávání OCR a generování výstupu — probíhá zcela uvnitř vašeho prohlížeče pomocí WebAssembly a JavaScriptu. Vaše soubory nikdy neopustí vaše zařízení, díky čemuž je to nejsoukromější OCR nástroj dostupný online.
Jaké výstupní formáty mohu exportovat?
Rozpoznaný text můžete exportovat jako prohledávatelné PDF (původní obrázek s neviditelnou textovou vrstvou, díky které je vybratelný a kopírovatelný v jakémkoli prohlížeči PDF), prostý TXT, Microsoft Word DOCX nebo Markdown. Všechny formáty zachovávají logické pořadí čtení textu.
Jak přesné je rozpoznávání textu?
Přesnost závisí na kvalitě dokumentu, rozlišení a jazyce. Čisté skeny ve vysokém rozlišení (300 DPI nebo více) v podporovaném jazyce obvykle dosahují přesnosti slov přes 98 % s LSTM motorem Tesseract. Rukopis, dekorativní písma, dokumenty s nízkým kontrastem nebo stránky se smíšenými jazyky budou mít nižší přesnost.
Mohu provést OCR na velkém PDF s mnoha stránkami?
Ano. Motor OCR zpracovává stránky postupně pomocí Web Workeru na pozadí, takže rozhraní vašeho prohlížeče zůstává po celou dobu responzivní. Podporováno je až 100 stránek na soubor. U velmi velkých dokumentů může zpracování trvat několik minut — ukazatel průběhu v reálném čase zobrazuje, která stránka se právě zpracovává.
Zachovává OCR původní rozvržení dokumentu?
Export prohledávatelného PDF dokonale zachovává původní vizuální rozvržení, protože obrázek stránky zůstává nedotčený a text je zapsán jako neviditelná překryvná vrstva. U exportů TXT, DOCX a Markdown je text extrahován v pořadí čtení, ale vizuální formátování (sloupce, tabulky) je pouze přibližné, nikoli přesně reprodukované.