S podporou AI

Extrahujte Text z Jakéhokoli PDF nebo Obrázku

OCR ve více než 30 jazycích. Exportujte jako prohledávatelné PDF, Word DOCX, TXT nebo Markdown. Funguje zcela ve vašem prohlížeči — nic se nenahrává na server.

Přetáhněte nebo klikněte pro nahrání

Naskenované PDF, JPG, PNG, WebP nebo TIFF

Max. 100 stran na PDF · Podpora více obrázků

Podporované jazyky

Arabština Bulharština Čínština (zjednodušená) Čínština (tradiční) Chorvatština Čeština Dánština Nizozemština Angličtina Finština Francouzština Němčina Řečtina Hebrejština Hindština Maďarština Indonéština Italština Japonština Korejština Norština Polština Portugalština Rumunština Ruština Srbština Slovenština Slovinština Španělština Švédština Thajština Turečtina Ukrajinština

Formáty exportu

  • Prohledatelné PDF (doporučeno) — Zachováno původní rozvržení; text je vybratelný v jakémkoli prohlížeči PDF
  • Dokument Word (.docx) — Otevřete a upravte v Microsoft Word nebo Google Docs
  • Prostý text (.txt) — Čistý textový výstup, kódovaný v UTF-8
  • Markdown (.md) — Strukturovaný text seskupený do odstavců

100% Soukromí

Veškeré zpracování OCR probíhá ve vašem prohlížeči pomocí WebAssembly. Vaše soubory nejsou nikdy odeslány na žádný server — ani na náš. Zpracování je stejně soukromé jako čtení dokumentu na vlastní obrazovce.

Proč PDFlexa AI OCR?

Motor Tesseract LSTM

Poháněno neuronovou sítí LSTM Tesseract — průmyslovým standardem pro open source OCR s přesností rozpoznávání slov 95–99 % u čistých dokumentů.

Zachované Rozvržení

Export prohledávatelného PDF zachovává původní obrázek stránky nedotčený a přidává neviditelnou textovou vrstvu — čímž zachovává každý okraj, sloupec a vizuální prvek.

Zpracování na Pozadí

Vyhrazený Web Worker spouští OCR ve vlákně na pozadí — karta vašeho prohlížeče zůstává plně interaktivní během zpracování velkých, vícestránkových dokumentů.

33 Jazyků

Od arabštiny a čínštiny po ukrajinštinu a thajštinu — pokrývá prakticky každý hlavní světový jazyk, včetně písem psaných zprava doleva.

4 Exportní Formáty

Prohledávatelné PDF, Word DOCX, prostý TXT a Markdown — exportujte přímo do formátu, který vyhovuje vašemu pracovnímu postupu, bez konverzního kroku.

Žádné Uchovávání Dat

Protože zpracování nikdy neopustí váš prohlížeč, nejsou zde žádné soubory k uchování nebo smazání. Vaše dokumenty jsou stejně soukromé jako soubor na vašem vlastním stole.

Jak extrahovat text z naskenovaného PDF

Nahrajte svůj naskenovaný PDF nebo obrázek

Přetáhněte naskenovaný PDF, JPG, PNG, WebP nebo TIFF do oblasti pro nahrání, nebo klikněte na „Vybrat soubor“ a procházejte. Podporovány jsou vícestránkové PDF soubory a více obrazových souborů.

Vyberte jazyk a výstupní formát

Vyberte jazyk, ve kterém je dokument napsán, z 33 dostupných možností. Poté vyberte preferovaný exportní formát — pro maximální kompatibilitu se doporučuje prohledávatelné PDF.

Klikněte na „Spustit OCR“ a stáhněte

Motor OCR zpracovává váš dokument ve workeru na pozadí. Ukazatel průběhu zobrazuje aktuálně zpracovávanou stránku. Po dokončení si okamžitě stáhněte svůj výsledek.

Často kladené otázky o OCR

Co je OCR a jak funguje?

OCR (optické rozpoznávání znaků) převádí obrázky textu — naskenované dokumenty, fotografie tištěných stránek nebo PDF obsahující pouze obrázky — na strojově čitelné znaky. Motor analyzuje vzory pixelů a mapuje je na písmena, čísla a interpunkci. Pdflexa používá Tesseract, nejpřesnější open source OCR motor na světě, který běží zcela ve vašem prohlížeči.

Jaké formáty souborů nástroj OCR přijímá?

Můžete nahrát naskenované PDF soubory a obrázky JPEG/JPG, PNG, WebP a TIFF. Vícestránkové PDF soubory jsou zpracovávány stránku po stránce (až 100 stránek na soubor). Dávkové nahrávání vám umožňuje provést OCR na více obrázcích najednou.

Kolik jazyků motor OCR podporuje?

Motor OCR podporuje 33 jazyků, včetně češtiny, angličtiny, španělštiny, francouzštiny, němčiny, čínštiny (zjednodušené a tradiční), japonštiny, korejštiny, arabštiny, ruštiny, hindštiny a dalších. Před zpracováním vyberte správný jazyk dokumentu pro maximalizaci přesnosti.

Je můj dokument nahráván na servery Pdflexa?

Ne. Každý krok — vykreslení PDF, rozpoznávání OCR a generování výstupu — probíhá zcela uvnitř vašeho prohlížeče pomocí WebAssembly a JavaScriptu. Vaše soubory nikdy neopustí vaše zařízení, díky čemuž je to nejsoukromější OCR nástroj dostupný online.

Jaké výstupní formáty mohu exportovat?

Rozpoznaný text můžete exportovat jako prohledávatelné PDF (původní obrázek s neviditelnou textovou vrstvou, díky které je vybratelný a kopírovatelný v jakémkoli prohlížeči PDF), prostý TXT, Microsoft Word DOCX nebo Markdown. Všechny formáty zachovávají logické pořadí čtení textu.

Jak přesné je rozpoznávání textu?

Přesnost závisí na kvalitě dokumentu, rozlišení a jazyce. Čisté skeny ve vysokém rozlišení (300 DPI nebo více) v podporovaném jazyce obvykle dosahují přesnosti slov přes 98 % s LSTM motorem Tesseract. Rukopis, dekorativní písma, dokumenty s nízkým kontrastem nebo stránky se smíšenými jazyky budou mít nižší přesnost.

Mohu provést OCR na velkém PDF s mnoha stránkami?

Ano. Motor OCR zpracovává stránky postupně pomocí Web Workeru na pozadí, takže rozhraní vašeho prohlížeče zůstává po celou dobu responzivní. Podporováno je až 100 stránek na soubor. U velmi velkých dokumentů může zpracování trvat několik minut — ukazatel průběhu v reálném čase zobrazuje, která stránka se právě zpracovává.

Zachovává OCR původní rozvržení dokumentu?

Export prohledávatelného PDF dokonale zachovává původní vizuální rozvržení, protože obrázek stránky zůstává nedotčený a text je zapsán jako neviditelná překryvná vrstva. U exportů TXT, DOCX a Markdown je text extrahován v pořadí čtení, ale vizuální formátování (sloupce, tabulky) je pouze přibližné, nikoli přesně reprodukované.

Související nástroje