AI-alapú

Szöveg Kinyerése Bármilyen PDF-ből vagy Képből

OCR 30+ nyelven. Exportálás kereshető PDF-ként, Word DOCX-ként, TXT-ként vagy Markdownként. Teljes egészében a böngésződben fut — semmi sem kerül feltöltésre szerverre.

Húzza ide vagy kattintson a feltöltéshez

Beolvasott PDF, JPG, PNG, WebP vagy TIFF

Max. 100 oldal PDF-enként · Több kép is támogatott

Támogatott nyelvek

Arab Bolgár Kínai (egyszerűsített) Kínai (hagyományos) Horvát Cseh Dán Holland Angol Finn Francia Német Görög Héber Hindi Magyar Indonéz Olasz Japán Koreai Norvég Lengyel Portugál Román Orosz Szerb Szlovák Szlovén Spanyol Svéd Thai Török Ukrán

Exportformátumok

  • Kereshető PDF (ajánlott) — Eredeti elrendezés megőrizve; a szöveg bármely PDF-nézegetőben kijelölhető
  • Word-dokumentum (.docx) — Nyisd meg és szerkeszd Microsoft Wordben vagy Google Docsban
  • Egyszerű szöveg (.txt) — Tiszta szöveges kimenet, UTF-8 kódolással
  • Markdown (.md) — Strukturált szöveg, bekezdésekbe csoportosítva

100%-ban Privát

Minden OCR-feldolgozás a böngésződben fut, WebAssembly használatával. A fájljaid soha nem kerülnek elküldésre semmilyen szerverre — még a miénkre sem. A feldolgozás ugyanolyan privát, mint egy dokumentum olvasása a saját képernyődön.

Miért a PDFlexa AI OCR?

Tesseract LSTM Motor

A Tesseract LSTM neurális hálózata hajtja — az iparági szabvány a nyílt forráskódú OCR-hez, 95–99%-os szópontossággal tiszta dokumentumokon.

Elrendezés Megőrizve

A kereshető PDF export érintetlenül megtartja az eredeti oldalképet, és láthatatlan szövegréteget ad hozzá — megőrizve minden margót, oszlopot és vizuális elemet.

Háttérfeldolgozás

Egy dedikált Web Worker futtatja az OCR-t egy háttérszálon — a böngésződ lapja teljesen interaktív marad, miközben nagy, több oldalas dokumentumok kerülnek feldolgozásra.

33 Nyelv

Az arabtól és kínaitól az ukránig és thaiig — gyakorlatilag minden jelentős világnyelvet lefed, beleértve a jobbról balra írt írásrendszereket is.

4 Exportformátum

Kereshető PDF, Word DOCX, egyszerű TXT és Markdown — exportálj közvetlenül a munkafolyamatodhoz illő formátumba, konverziós lépés nélkül.

Nulla Adatmegőrzés

Mivel a feldolgozás soha nem hagyja el a böngésződet, nincsenek megőrzendő vagy törlendő fájlok. A dokumentumaid ugyanolyan privátak, mint egy fájl a saját asztalodon.

Hogyan nyerjen ki szöveget beszkennelt PDF-ből

Töltsd fel a beszkennelt PDF-edet vagy képedet

Húzz és ejts egy beszkennelt PDF-et, JPG-t, PNG-t, WebP-t vagy TIFF-et a feltöltési területre, vagy kattints a „Fájl kiválasztása” gombra a böngészéshez. Több oldalas PDF-ek és több képfájl is támogatott.

Válaszd ki a nyelvet és a kimeneti formátumot

Válaszd ki azt a nyelvet, amelyen a dokumentum íródott, 33 elérhető opció közül. Ezután válaszd ki a kívánt exportformátumot — a kereshető PDF a maximális kompatibilitás érdekében ajánlott.

Kattints az „OCR indítása” gombra, majd töltsd le

Az OCR motor egy háttér workerben dolgozza fel a dokumentumodat. Egy folyamatjelző mutatja, éppen melyik oldal kerül feldolgozásra. A befejezéskor azonnal töltsd le az eredményt.

Gyakran ismételt kérdések az OCR-ről

Mi az az OCR, és hogyan működik?

Az OCR (optikai karakterfelismerés) szövegképeket — beszkennelt dokumentumokat, nyomtatott oldalak fotóit vagy csak képeket tartalmazó PDF-eket — géppel olvasható karakterekké alakít. A motor elemzi a pixelmintázatokat, és betűkhöz, számokhoz és írásjelekhez rendeli őket. A Pdflexa a Tesseractet használja, a világ legpontosabb nyílt forráskódú OCR motorját, amely teljes egészében a böngésződben fut.

Milyen fájlformátumokat fogad el az OCR eszköz?

Feltölthetsz beszkennelt PDF-fájlokat, valamint JPEG/JPG-, PNG-, WebP- és TIFF-képeket. A több oldalas PDF-ek oldalanként kerülnek feldolgozásra (fájlonként legfeljebb 100 oldal). A kötegelt feltöltéssel egyszerre több képet is feldolgozhatsz OCR-rel.

Hány nyelvet támogat az OCR motor?

Az OCR motor 33 nyelvet támogat, köztük a magyart, angolt, spanyolt, franciát, németet, kínait (egyszerűsített és hagyományos), japánt, koreait, arabot, oroszt, hindit és másokat. A pontosság maximalizálása érdekében válaszd ki a megfelelő dokumentumnyelvet a feldolgozás előtt.

Feltöltésre kerül a dokumentumom a Pdflexa szervereire?

Nem. Minden lépés — PDF-renderelés, OCR-felismerés és kimenet-generálás — teljes egészében a böngésződben fut, WebAssembly és JavaScript segítségével. A fájljaid soha nem hagyják el az eszközödet, ami ezt a legprivátabb online elérhető OCR eszközzé teszi.

Milyen kimeneti formátumokat exportálhatok?

A felismert szöveget exportálhatod kereshető PDF-ként (eredeti kép láthatatlan szövegréteggel, amely bármely PDF-nézegetőben kijelölhetővé és másolhatóvá teszi), egyszerű TXT-ként, Microsoft Word DOCX-ként vagy Markdownként. Minden formátum megőrzi a szöveg logikai olvasási sorrendjét.

Mennyire pontos a szövegfelismerés?

A pontosság a dokumentum minőségétől, felbontásától és nyelvétől függ. A tiszta, nagy felbontású (300 DPI vagy magasabb) szkennelések egy támogatott nyelven jellemzően 98%+ szópontosságot érnek el a Tesseract LSTM motorjával. A kézírás, a díszes betűtípusok, az alacsony kontrasztú dokumentumok vagy a vegyes nyelvű oldalak alacsonyabb pontosságúak lesznek.

OCR-ezhetek egy nagy, sok oldalas PDF-et?

Igen. Az OCR motor szekvenciálisan dolgozza fel az oldalakat egy háttér Web Worker segítségével, így a böngésződ felülete végig reagáló marad. Fájlonként legfeljebb 100 oldal támogatott. Nagyon nagy dokumentumok esetén a feldolgozás néhány percig is eltarthat — egy valós idejű folyamatjelző mutatja, melyik oldal kerül épp feldolgozásra.

Megőrzi az OCR az eredeti dokumentum elrendezését?

A kereshető PDF export tökéletesen megőrzi az eredeti vizuális elrendezést, mivel az oldalkép érintetlen marad, és a szöveg láthatatlan rárétegzésként kerül beírásra. TXT-, DOCX- és Markdown-exportok esetén a szöveg olvasási sorrendben kerül kinyerésre, de a vizuális formázás (oszlopok, táblázatok) csak közelítő, nem pontosan reprodukált.

Kapcsolódó eszközök