Cara Menggunakan OCR pada PDF (Buat Dokumen Scan Bisa Dicari)

· · · 8 menit baca

OCR — Optical Character Recognition — mengubah gambar teks dalam PDF hasil scan menjadi karakter sesungguhnya yang bisa dipilih, dicari, dan disalin. Panduan ini menjelaskan cara kerja OCR, kapan Anda membutuhkannya, dan cara menerapkannya secara gratis di browser Anda.


Mengapa PDF Hasil Scan Membutuhkan OCR?

Saat Anda memindai dokumen kertas, scanner membuat gambar dari halaman tersebut — bukan file teks. PDF hasil scan pada dasarnya adalah JPEG atau TIFF yang tertanam dalam wadah PDF. Anda bisa melihatnya, tapi:

  • Anda tidak bisa memilih atau menyalin teks
  • Ctrl+F (Cari) tidak menghasilkan apa-apa
  • Pembaca layar tidak bisa membacanya (tidak aksesibel)
  • Mesin pencari tidak bisa mengindeks kontennya
  • Anda tidak bisa mengisi kolom formulir atau menyorot teks

OCR membaca gambar tersebut dan menghasilkan lapisan teks — lapisan tak terlihat dari karakter yang dikenali, ditempatkan tepat di atas gambar. Setelah OCR, dokumen terlihat identik, tapi sekarang punya teks sesungguhnya di baliknya yang bisa Anda gunakan.


Cara Menerapkan OCR ke PDF Online (Gratis)

Compress PDF Online — Free

Reduce your PDF file size instantly. No software needed.

Use Tool Now →

Menggunakan PDFlexa OCR:

  1. Buka OCR PDF
  2. Unggah PDF hasil scan Anda (seret dan lepas, atau klik Pilih file)
  3. Pilih bahasa dokumen Anda dari dropdown (24 bahasa didukung)
  4. Pilih format output:
    • PDF yang bisa dicari — mempertahankan tampilan asli, menambahkan lapisan teks tak terlihat
    • Teks biasa (.txt) — hanya teks yang diekstrak, tanpa tata letak
  5. Klik Jalankan OCR
  6. Unduh hasilnya

Pemrosesan berjalan di browser Anda menggunakan Tesseract.js. Untuk PDF besar (30+ halaman), pemrosesan memakan waktu beberapa menit. Tidak ada file yang diunggah ke server.

Bahasa yang didukung termasuk: Indonesia, Inggris, Prancis, Jerman, Spanyol, Portugis, Italia, Belanda, Polandia, Rusia, Arab, Mandarin (Sederhana), Jepang, Korea, Hindi, Turki, dan 9 bahasa lainnya.


Kapan OCR Dibutuhkan?

Jenis dokumen Butuh OCR?
Dokumen kertas yang dipindai ke PDF ✅ Ya — itu adalah gambar
Foto dokumen yang diambil dengan ponsel ✅ Ya
PDF yang dibuat dari file Word/Excel/Google Docs ❌ Tidak — sudah punya lapisan teks
PDF yang diekspor langsung dari software (invoice, kuitansi) ❌ Tidak — sudah ada teksnya
Dokumen arsip hasil scan lama ✅ Ya
PDF dengan teks buram atau berantakan ⚠️ OCR mungkin memperbaikinya
PDF formulir yang tidak bisa Anda isi ✅ OCR + Isi PDF akan membantu

Cara cepat untuk memeriksa: coba pilih teks pada halaman. Jika Anda bisa menyorot sebuah kata, PDF sudah memiliki lapisan teks. Jika kursor hanya membuat kotak pilihan di sekitar area (seperti memilih area gambar), itu adalah gambar hasil scan dan butuh OCR.


Cara Kerja OCR (di Balik Layar)

Convert PDF to Word — Free

Turn any PDF into an editable Word document in seconds.

Use Tool Now →
  1. Rendering halaman — setiap halaman PDF dirender pada resolusi tinggi sebagai gambar
  2. Pra-pemrosesan — gambar diluruskan, dikurangi noise-nya, dan diubah menjadi grayscale
  3. Deteksi teks — mesin OCR mengidentifikasi area yang terlihat seperti teks (kolom, baris, kata)
  4. Pengenalan karakter — setiap area karakter dicocokkan dengan model terlatih untuk bahasa yang dipilih
  5. Pembuatan lapisan teks — karakter yang dikenali ditempatkan pada posisi terdeteksi di atas gambar asli
  6. Rekonstruksi PDF — PDF baru dibuat dengan gambar asli ditambah lapisan teks tak terlihat

Kualitas OCR bergantung pada: resolusi scan (semakin tinggi semakin baik), kualitas dokumen (cetakan jelas vs tinta pudar), kecocokan bahasa, dan apakah teksnya diketik atau tulisan tangan. PDFlexa menggunakan Tesseract — mesin OCR open-source yang paling banyak digunakan, dilatih pada 100+ bahasa.


Tips untuk Hasil OCR yang Lebih Baik

Scan pada 300 DPI atau lebih tinggi. Sebagian besar scanner konsumen defaultnya 150 DPI, cukup untuk dilihat tapi menghasilkan hasil OCR yang buruk.

Scan dalam grayscale atau hitam-putih. Scan warna lebih besar dan tidak meningkatkan kualitas OCR untuk dokumen teks standar.

Pastikan halaman rata dan lurus. Halaman melengkung (dari penjilidan buku), scan miring, atau bayangan dari kamera ponsel semuanya mengurangi akurasi.

Pilih bahasa yang benar. Tesseract menggunakan model terlatih khusus bahasa. Dokumen berbahasa Indonesia yang diproses dengan OCR bahasa Inggris akan punya hasil buruk pada kata-kata dengan imbuhan tertentu. Selalu cocokkan bahasanya.

Huruf kapital besar dan teks cetak lebih akurat dibanding tulisan tangan. OCR standar dirancang untuk teks cetak. Pengenalan tulisan tangan adalah masalah terpisah (lebih sulit) yang kurang baik ditangani Tesseract.


Akurasi OCR: Apa yang Diharapkan

Kualitas dokumen Akurasi yang diharapkan
Bersih, diketik, discan rata pada 300 DPI Akurasi karakter 98–99%
Scan kantor standar pada 150 DPI Akurasi 92–96%
Dokumen lama dengan tinta pudar Akurasi 80–90%
Catatan tulisan tangan 50–75% (bervariasi luas)
Makalah akademik multi-kolom 90–95% (deteksi tata letak lebih sulit)
Skrip non-Latin (Arab, Mandarin, Korea) 85–95% dengan bahasa yang benar

Untuk dokumen penting (kontrak, catatan hukum), selalu tinjau hasil OCR untuk kesalahan — terutama nama, angka, dan tanggal.


OCR vs PDF ke Word: Apa Bedanya?

OCR PDF PDF ke Word
Output PDF yang bisa dicari (tampilan sama) atau .txt .docx yang bisa diedit
Cocok untuk Membuat hasil scan bisa dicari/aksesibel Mengedit konten di Microsoft Word
Tata letak Tata letak asli sepenuhnya dipertahankan Tata letak mungkin bergeser dalam konversi Word
Kasus penggunaan Arsip, pencarian, aksesibilitas Menggunakan ulang dan mengedit konten

Jika Anda ingin mengedit konten hasil scan di Word, jalankan OCR terlebih dahulu lalu gunakan PDF ke Word — OCR memberi konverter teks sesungguhnya untuk diproses, bukan area gambar kosong.


Pertanyaan yang Sering Diajukan

Apakah OCR mengubah tampilan PDF saya? Tidak. Lapisan teks OCR tidak terlihat — berada di balik gambar halaman. PDF terlihat identik sebelum dan sesudah OCR. Satu-satunya perbedaan adalah teks sekarang bisa dipilih dan dicari.

Bisakah OCR membaca tulisan tangan? OCR standar dilatih untuk teks cetak dan tidak andal pada tulisan tangan. Hasilnya bervariasi luas tergantung seberapa jelas dan konsisten tulisan tangannya. Untuk dokumen tulisan tangan penting, transkripsi manual lebih dapat diandalkan.

Berapa banyak halaman yang bisa saya OCR sekaligus? OCR berbasis browser PDFlexa mendukung hingga 50 halaman per unggahan. Untuk dokumen lebih panjang, pisahkan PDF menjadi beberapa bagian, OCR tiap bagian, lalu gabungkan hasilnya.

Mengapa OCR memakan waktu lama? Setiap halaman diproses secara individual: dirender pada resolusi tinggi, dianalisis, dan dikenali. Dokumen 20 halaman mungkin memakan waktu 1–3 menit di browser. Pemrosesan berjalan di perangkat Anda — kecepatannya tergantung CPU dan memori Anda.

Apakah OCR gratis? Ya. OCR PDFlexa berjalan sepenuhnya di browser Anda menggunakan Tesseract.js open-source tanpa biaya. Tidak perlu akun, tidak ada batas harian pada alat OCR.

Coba Alat PDF Gratis Ini

Kompres PDF → Gabungkan PDF → PDF ke Word → JPG ke PDF →
Abdel B.

Tim PDFlexa membuat panduan praktis untuk membantu Anda bekerja lebih cepat dengan file PDF. Semua alat gratis digunakan — tanpa perlu akun.

Apakah ini bermanfaat? Bagikan: Facebook X LinkedIn