Szöveg Kinyerése Bármilyen PDF-ből vagy Képből
OCR 30+ nyelven. Exportálás kereshető PDF-ként, Word DOCX-ként, TXT-ként vagy Markdownként. Teljes egészében a böngésződben fut — semmi sem kerül feltöltésre szerverre.
Húzza ide vagy kattintson a feltöltéshez
Beolvasott PDF, JPG, PNG, WebP vagy TIFF
Max. 100 oldal PDF-enként · Több kép is támogatott
Inicializálás…
A fájlja elkészült
Támogatott nyelvek
Exportformátumok
- Kereshető PDF (ajánlott) — Eredeti elrendezés megőrizve; a szöveg bármely PDF-nézegetőben kijelölhető
- Word-dokumentum (.docx) — Nyisd meg és szerkeszd Microsoft Wordben vagy Google Docsban
- Egyszerű szöveg (.txt) — Tiszta szöveges kimenet, UTF-8 kódolással
- Markdown (.md) — Strukturált szöveg, bekezdésekbe csoportosítva
100%-ban Privát
Minden OCR-feldolgozás a böngésződben fut, WebAssembly használatával. A fájljaid soha nem kerülnek elküldésre semmilyen szerverre — még a miénkre sem. A feldolgozás ugyanolyan privát, mint egy dokumentum olvasása a saját képernyődön.
Miért a PDFlexa AI OCR?
Tesseract LSTM Motor
A Tesseract LSTM neurális hálózata hajtja — az iparági szabvány a nyílt forráskódú OCR-hez, 95–99%-os szópontossággal tiszta dokumentumokon.
Elrendezés Megőrizve
A kereshető PDF export érintetlenül megtartja az eredeti oldalképet, és láthatatlan szövegréteget ad hozzá — megőrizve minden margót, oszlopot és vizuális elemet.
Háttérfeldolgozás
Egy dedikált Web Worker futtatja az OCR-t egy háttérszálon — a böngésződ lapja teljesen interaktív marad, miközben nagy, több oldalas dokumentumok kerülnek feldolgozásra.
33 Nyelv
Az arabtól és kínaitól az ukránig és thaiig — gyakorlatilag minden jelentős világnyelvet lefed, beleértve a jobbról balra írt írásrendszereket is.
4 Exportformátum
Kereshető PDF, Word DOCX, egyszerű TXT és Markdown — exportálj közvetlenül a munkafolyamatodhoz illő formátumba, konverziós lépés nélkül.
Nulla Adatmegőrzés
Mivel a feldolgozás soha nem hagyja el a böngésződet, nincsenek megőrzendő vagy törlendő fájlok. A dokumentumaid ugyanolyan privátak, mint egy fájl a saját asztalodon.
Hogyan nyerjen ki szöveget beszkennelt PDF-ből
Töltsd fel a beszkennelt PDF-edet vagy képedet
Húzz és ejts egy beszkennelt PDF-et, JPG-t, PNG-t, WebP-t vagy TIFF-et a feltöltési területre, vagy kattints a „Fájl kiválasztása” gombra a böngészéshez. Több oldalas PDF-ek és több képfájl is támogatott.
Válaszd ki a nyelvet és a kimeneti formátumot
Válaszd ki azt a nyelvet, amelyen a dokumentum íródott, 33 elérhető opció közül. Ezután válaszd ki a kívánt exportformátumot — a kereshető PDF a maximális kompatibilitás érdekében ajánlott.
Kattints az „OCR indítása” gombra, majd töltsd le
Az OCR motor egy háttér workerben dolgozza fel a dokumentumodat. Egy folyamatjelző mutatja, éppen melyik oldal kerül feldolgozásra. A befejezéskor azonnal töltsd le az eredményt.
Gyakran ismételt kérdések az OCR-ről
Mi az az OCR, és hogyan működik?
Az OCR (optikai karakterfelismerés) szövegképeket — beszkennelt dokumentumokat, nyomtatott oldalak fotóit vagy csak képeket tartalmazó PDF-eket — géppel olvasható karakterekké alakít. A motor elemzi a pixelmintázatokat, és betűkhöz, számokhoz és írásjelekhez rendeli őket. A Pdflexa a Tesseractet használja, a világ legpontosabb nyílt forráskódú OCR motorját, amely teljes egészében a böngésződben fut.
Milyen fájlformátumokat fogad el az OCR eszköz?
Feltölthetsz beszkennelt PDF-fájlokat, valamint JPEG/JPG-, PNG-, WebP- és TIFF-képeket. A több oldalas PDF-ek oldalanként kerülnek feldolgozásra (fájlonként legfeljebb 100 oldal). A kötegelt feltöltéssel egyszerre több képet is feldolgozhatsz OCR-rel.
Hány nyelvet támogat az OCR motor?
Az OCR motor 33 nyelvet támogat, köztük a magyart, angolt, spanyolt, franciát, németet, kínait (egyszerűsített és hagyományos), japánt, koreait, arabot, oroszt, hindit és másokat. A pontosság maximalizálása érdekében válaszd ki a megfelelő dokumentumnyelvet a feldolgozás előtt.
Feltöltésre kerül a dokumentumom a Pdflexa szervereire?
Nem. Minden lépés — PDF-renderelés, OCR-felismerés és kimenet-generálás — teljes egészében a böngésződben fut, WebAssembly és JavaScript segítségével. A fájljaid soha nem hagyják el az eszközödet, ami ezt a legprivátabb online elérhető OCR eszközzé teszi.
Milyen kimeneti formátumokat exportálhatok?
A felismert szöveget exportálhatod kereshető PDF-ként (eredeti kép láthatatlan szövegréteggel, amely bármely PDF-nézegetőben kijelölhetővé és másolhatóvá teszi), egyszerű TXT-ként, Microsoft Word DOCX-ként vagy Markdownként. Minden formátum megőrzi a szöveg logikai olvasási sorrendjét.
Mennyire pontos a szövegfelismerés?
A pontosság a dokumentum minőségétől, felbontásától és nyelvétől függ. A tiszta, nagy felbontású (300 DPI vagy magasabb) szkennelések egy támogatott nyelven jellemzően 98%+ szópontosságot érnek el a Tesseract LSTM motorjával. A kézírás, a díszes betűtípusok, az alacsony kontrasztú dokumentumok vagy a vegyes nyelvű oldalak alacsonyabb pontosságúak lesznek.
OCR-ezhetek egy nagy, sok oldalas PDF-et?
Igen. Az OCR motor szekvenciálisan dolgozza fel az oldalakat egy háttér Web Worker segítségével, így a böngésződ felülete végig reagáló marad. Fájlonként legfeljebb 100 oldal támogatott. Nagyon nagy dokumentumok esetén a feldolgozás néhány percig is eltarthat — egy valós idejű folyamatjelző mutatja, melyik oldal kerül épp feldolgozásra.
Megőrzi az OCR az eredeti dokumentum elrendezését?
A kereshető PDF export tökéletesen megőrzi az eredeti vizuális elrendezést, mivel az oldalkép érintetlen marad, és a szöveg láthatatlan rárétegzésként kerül beírásra. TXT-, DOCX- és Markdown-exportok esetén a szöveg olvasási sorrendben kerül kinyerésre, de a vizuális formázás (oszlopok, táblázatok) csak közelítő, nem pontosan reprodukált.