Ekstrak Teks daripada Mana-mana PDF atau Imej
OCR dalam 30+ bahasa. Eksport sebagai PDF boleh dicari, Word DOCX, TXT atau Markdown. Berjalan sepenuhnya dalam pelayar anda — tiada apa-apa dimuat naik ke pelayan.
Tarik & lepas atau klik untuk muat naik
PDF diimbas, JPG, PNG, WebP atau TIFF
Maks 100 halaman setiap PDF · Menyokong pelbagai imej
Memulakan…
Fail anda sudah sedia
Bahasa yang Disokong
Format Eksport
- PDF boleh dicari (disyorkan) — Susun atur asal dikekalkan; teks boleh dipilih dalam mana-mana pemapar PDF
- Dokumen Word (.docx) — Buka dan sunting dalam Microsoft Word atau Google Docs
- Teks Biasa (.txt) — Output teks bersih, dikodkan UTF-8
- Markdown (.md) — Teks berstruktur dikumpulkan mengikut perenggan
100% Peribadi
Semua pemprosesan OCR berjalan dalam pelayar anda menggunakan WebAssembly. Fail anda tidak pernah dihantar ke mana-mana pelayan — malah pelayan kami sendiri. Pemprosesan adalah seperibadi membaca dokumen pada skrin anda sendiri.
Mengapa AI OCR PDFlexa?
Enjin Tesseract LSTM
Dikuasakan oleh rangkaian neural LSTM Tesseract — piawaian industri untuk OCR sumber terbuka, dengan ketepatan perkataan 95–99% pada dokumen bersih.
Susun Atur Dikekalkan
Eksport PDF boleh dicari mengekalkan imej halaman asal dengan utuh dan menambah lapisan teks tidak kelihatan — mengekalkan setiap margin, lajur dan elemen visual.
Pemprosesan Latar Belakang
Web Worker khusus menjalankan OCR dalam bebenang latar belakang — tab pelayar anda kekal sepenuhnya interaktif semasa dokumen besar berbilang halaman diproses.
33 Bahasa
Daripada bahasa Arab dan Cina hingga Ukraine dan Thai — meliputi hampir setiap bahasa utama dunia, termasuk skrip kanan-ke-kiri.
4 Format Eksport
PDF boleh dicari, Word DOCX, TXT biasa dan Markdown — eksport terus ke format yang sesuai dengan aliran kerja anda, tanpa langkah penukaran.
Sifar Penyimpanan Data
Kerana pemprosesan tidak pernah meninggalkan pelayar anda, tiada fail untuk disimpan atau dipadam. Dokumen anda sama peribadi seperti fail di meja anda sendiri.
Cara Mengekstrak Teks daripada PDF yang Diimbas
Muat Naik PDF atau Imej Imbasan Anda
Seret dan lepaskan PDF, JPG, PNG, WebP atau TIFF imbasan ke kawasan muat naik, atau klik "Pilih fail" untuk melayari. PDF berbilang halaman dan beberapa fail imej disokong.
Pilih Bahasa dan Format Output
Pilih bahasa dokumen ditulis daripada 33 pilihan yang tersedia. Kemudian pilih format eksport pilihan anda — PDF boleh dicari disyorkan untuk keserasian maksimum.
Klik "Mula OCR" dan Muat Turun
Enjin OCR memproses dokumen anda dalam pekerja latar belakang. Bar kemajuan menunjukkan halaman yang sedang diproses. Selepas selesai, muat turun hasil anda serta-merta.
Soalan Lazim tentang OCR
Apakah itu OCR dan bagaimana ia berfungsi?
OCR (Pengecaman Aksara Optik) menukar imej teks — dokumen yang diimbas, foto halaman bercetak atau PDF imej sahaja — kepada aksara yang boleh dibaca mesin. Enjin ini menganalisis corak piksel dan memadankannya dengan huruf, nombor dan tanda baca. Pdflexa menggunakan Tesseract, enjin OCR sumber terbuka paling tepat di dunia, yang berjalan sepenuhnya dalam pelayar anda.
Format fail apakah yang diterima alat OCR?
Anda boleh memuat naik fail PDF yang diimbas serta imej JPEG/JPG, PNG, WebP dan TIFF. PDF berbilang halaman diproses halaman demi halaman (sehingga 100 halaman setiap fail). Muat naik kelompok membolehkan anda melakukan OCR pada beberapa imej sekali gus.
Berapa banyak bahasa disokong oleh enjin OCR?
Enjin OCR menyokong 33 bahasa termasuk Melayu, Inggeris, Sepanyol, Perancis, Jerman, Cina (Ringkas dan Tradisional), Jepun, Korea, Arab, Rusia, Hindi dan banyak lagi. Pilih bahasa dokumen yang betul sebelum pemprosesan untuk memaksimumkan ketepatan.
Adakah dokumen saya dimuat naik ke pelayan Pdflexa?
Tidak. Setiap langkah — pemaparan PDF, pengecaman OCR dan penjanaan output — berjalan sepenuhnya dalam pelayar anda menggunakan WebAssembly dan JavaScript. Fail anda tidak pernah meninggalkan peranti anda, menjadikan ini alat OCR paling peribadi yang tersedia dalam talian.
Format output apakah yang boleh saya eksport?
Anda boleh mengeksport teks yang dikenal pasti sebagai PDF boleh dicari (imej asal dengan lapisan teks tidak kelihatan, menjadikannya boleh dipilih dan disalin dalam mana-mana pemapar PDF), TXT biasa, Word DOCX Microsoft, atau Markdown. Semua format mengekalkan susunan bacaan logik teks.
Sejauh manakah ketepatan pengecaman teks?
Ketepatan bergantung pada kualiti dokumen, resolusi dan bahasa. Imbasan bersih beresolusi tinggi (300 DPI atau lebih) dalam bahasa yang disokong biasanya mencapai ketepatan perkataan lebih 98% dengan enjin LSTM Tesseract. Tulisan tangan, fon perhiasan, dokumen kontras rendah atau halaman berbilang bahasa akan mempunyai ketepatan lebih rendah.
Bolehkah saya mengOCR PDF besar dengan banyak halaman?
Ya. Enjin OCR memproses halaman secara berturutan menggunakan Web Worker latar belakang, jadi antara muka pelayar anda kekal responsif sepanjang masa. Sehingga 100 halaman setiap fail disokong. Untuk dokumen yang sangat besar, pemprosesan mungkin mengambil masa beberapa minit — penunjuk kemajuan masa nyata menunjukkan halaman mana yang sedang diproses.
Adakah OCR mengekalkan susun atur asal dokumen?
Eksport PDF boleh dicari mengekalkan susun atur visual asal dengan sempurna, kerana imej halaman dikekalkan utuh dan teks ditulis sebagai lapisan tidak kelihatan. Untuk eksport TXT, DOCX dan Markdown, teks diekstrak mengikut susunan bacaan, tetapi pemformatan visual (lajur, jadual) dianggarkan dan bukan diterbitkan semula dengan tepat.