OCR — Optik Karakter Tanıma — taranmış bir PDF'deki metnin görüntüsünü gerçek, seçilebilir, aranabilir ve kopyalanabilir karakterlere dönüştürür. Bu rehber, OCR'nin nasıl çalıştığını, ne zaman ihtiyacınız olduğunu ve tarayıcınızda ücretsiz nasıl uygulayacağınızı açıklar.
Taranmış PDF'ler Neden OCR'ye İhtiyaç Duyar?
Kağıt bir belgeyi taradığınızda, tarayıcı sayfanın bir resmini oluşturur — bir metin dosyası değil. Taranmış bir PDF, esasen bir PDF kapsayıcısına gömülü bir JPEG veya TIFF'tir. Onu görüntüleyebilirsiniz, ama:
- Metni seçemez veya kopyalayamazsiniz
- Ctrl+F (Bul) sıfır sonuç döndürür
- Ekran okuyucular onu okuyamaz (erişilebilir değil)
- Arama motorları içeriğini dizine ekleyemez
- Form alanlarını dolduramaz veya metni vurgulayamazsınız
OCR, o görüntüyü okur ve bir metin katmanı üretir — görüntünün tam üzerine hassas şekilde yerleştirilmiş, tanınan karakterlerden oluşan görünmez bir katman. OCR'den sonra, belge aynı görünür, ama artık altında etkileşimde bulunabileceğiniz gerçek metin vardır.
Bir PDF'e Çevrimiçi OCR Nasıl Uygulanır (Ücretsiz)
Reduce your PDF file size instantly. No software needed.
PDFlexa OCR kullanarak:
- PDFlexa OCR sayfasına gidin
- Taranmış PDF'inizi yükleyin (sürükleyip bırakın veya Bir dosya seç'e tıklayın)
- Açılır menüden belgenizin dilini seçin (24 dil desteklenir)
- Çıktı biçimini seçin:
- Aranabilir PDF — orijinal görünümü korur, görünmez metin katmanı ekler
- Düz metin (.txt) — yalnızca çıkarılan metin, düzen yok
- OCR Çalıştır'a tıklayın
- Sonucu indirin
İşlem, Tesseract.js kullanılarak tarayıcınızda çalışır. Büyük PDF'ler için (30+ sayfa), işlem birkaç dakika sürer. Hiçbir dosya bir sunucuya yüklenmez.
Desteklenen diller şunları içerir: İngilizce, Fransızca, Almanca, İspanyolca, Portekizce, İtalyanca, Felemenkçe, Lehçe, Rusça, Arapça, Çince (Basitleştirilmiş), Japonca, Korece, Hintçe, Türkçe ve 9 dil daha.
OCR Ne Zaman Gereklidir?
| Belge türü | OCR gerekli mi? |
|---|---|
| PDF'e taranmış kağıt belge | ✅ Evet — bu bir görseldir |
| Telefonla çekilmiş bir belge fotoğrafı | ✅ Evet |
| Word/Excel/Google Dokümanlar dosyasından oluşturulan PDF | ❌ Hayır — zaten metin katmanı var |
| Yazılımdan doğrudan dışa aktarılan PDF (faturalar, makbuzlar) | ❌ Hayır — zaten metin var |
| Eski taranmış arşiv belgesi | ✅ Evet |
| Metnin bulanık veya bozuk olduğu PDF | ⚠️ OCR iyileştirebilir |
| Dolduramadığınız bir form PDF'i | ✅ OCR + Formu Doldur yardımcı olur |
Hızlı bir kontrol yöntemi: bir sayfada metin seçmeyi deneyin. Bir kelimeyi vurgulayabiliyorsanız, PDF'de zaten bir metin katmanı vardır. İmleç yalnızca bir bölge etrafında bir seçim kutusu oluşturuyorsa (bir görsel alanı seçer gibi), bu taranmış bir görseldir ve OCR gerektirir.
OCR Nasıl Çalışır (Perde Arkası)
Turn any PDF into an editable Word document in seconds.
- Sayfa oluşturma — PDF'in her sayfası yüksek çözünürlükte (300+ DPI eşdeğeri) bir görsel olarak oluşturulur
- Ön işleme — görselin eğikliği düzeltilir, gürültüsü giderilir ve gri tonlamaya dönüştürülür
- Metin algılama — OCR motoru metne benzeyen bölgeleri belirler (sütunlar, satırlar, kelimeler)
- Karakter tanıma — her karakter bölgesi, seçilen dil için eğitilmiş bir modelle eşleştirilir
- Metin katmanı oluşturma — tanınan karakterler, orijinal görselin üzerinde algılanan konumlarına yerleştirilir
- PDF yeniden oluşturma — orijinal görsel artı görünmez metin katmanıyla yeni bir PDF oluşturulur
OCR'nin kalitesi şunlara bağlıdır: tarama çözünürlüğü (yüksek olması daha iyidir), belge kalitesi (net baskı ile solmuş mürekkep), dil eşleşmesi ve metnin yazılı mı yoksa el yazısı mı olduğu. PDFlexa, 100'den fazla dilde eğitilmiş, en yaygın kullanılan açık kaynaklı OCR motoru olan Tesseract'ı kullanır.
Daha İyi OCR Sonuçları İçin İpuçları
300 DPI veya daha yüksek çözünürlükte tarayın. Çoğu tüketici tarayıcısı varsayılan olarak 150 DPI'dır, bu görüntülemeye yeterlidir ama zayıf OCR sonuçları üretir. Metin için 300 DPI, çok küçük yazı için 600 DPI kullanın.
Gri tonlamalı veya siyah-beyaz tarayın. Renkli taramalar daha büyüktür ve standart metin belgeleri için OCR kalitesini artırmaz. Gri tonlama en uygun noktadır.
Sayfanın düz ve doğru olduğundan emin olun. Eğik sayfalar (kitap cildinden), çarpık taramalar veya telefon kamerasından gelen gölgeler doğruluğu azaltır. Çoğu masaüstü tarayıcı bunu iyi ele alır; telefon kamerası taramaları en sorunlu olanlardır.
Doğru dili seçin. Tesseract dile özgü eğitilmiş modeller kullanır. İngilizce OCR ile işlenen Almanca bir belge, umlautlarda (ä, ö, ü) kötü sonuçlar verir. Her zaman dili eşleştirin.
Büyük harfler ve basılı metin, el yazısından daha iyi OCR'lenir. Standart OCR, basılı metin için tasarlanmıştır. El yazısı tanıma, Tesseract'ın zayıf ele aldığı ayrı (daha zor) bir sorundur.
OCR Doğruluğu: Neler Beklenmeli
| Belge kalitesi | Beklenen doğruluk |
|---|---|
| Temiz, yazılı, 300 DPI'da düz taranmış | %98-99 karakter doğruluğu |
| 150 DPI'da standart ofis taraması | %92-96 doğruluk |
| Mürekkebi solmuş eski belge | %80-90 doğruluk |
| El yazısı notlar | %50-75 (geniş çapta değişir) |
| Çok sütunlu akademik makale | %90-95 (düzen algılama daha zor) |
| Latin olmayan alfabe (Arapça, Çince, Korece) | Doğru dille %85-95 |
Kritik belgeler için (sözleşmeler, hukuki kayıtlar), her zaman OCR çıktısını hatalar için gözden geçirin — özellikle özel isimler, sayılar ve tarihler.
OCR ile PDF'den Word'e: Fark Nedir?
| OCR PDF | PDF'den Word'e | |
|---|---|---|
| Çıktı | Aranabilir PDF (aynı görünüm) veya .txt | Düzenlenebilir .docx |
| En iyi kullanım | Bir taramayı aranabilir/erişilebilir yapmak | İçeriği Microsoft Word'de düzenlemek |
| Düzen | Orijinal düzen mükemmel şekilde korunur | Word dönüşümünde düzen kayabilir |
| Kullanım durumu | Arşiv, arama, erişilebilirlik | İçeriği yeniden kullanma ve düzenleme |
Taranmış içeriği Word'de düzenlemek istiyorsanız, önce OCR çalıştırın ve ardından PDF'den Word'e kullanın — OCR, dönüştürücüye boş görsel bölgeler yerine gerçek metin verir.
Sıkça Sorulan Sorular
OCR, PDF'imin görünümünü değiştirir mi? Hayır. OCR metin katmanı görünmezdir — sayfanın görüntüsünün arkasında durur. PDF, OCR öncesinde ve sonrasında aynı görünür. Tek fark, metnin artık seçilebilir ve aranabilir olmasıdır.
OCR el yazısını okuyabilir mi? Standart OCR basılı metin için eğitilmiştir ve el yazısında güvenilmezdir. Sonuçlar, el yazısının ne kadar net ve tutarlı oluşturulduğuna bağlı olarak geniş çapta değişir. Önemli el yazısı belgeler için, manuel transkripsiyon daha güvenilirdir.
Bir seferde kaç sayfayı OCR'den geçirebilirim? PDFlexa'nın tarayıcı tabanlı OCR'si, yükleme başına 50 sayfaya kadar destekler. Daha uzun belgeler için, PDF'i parçalara bölün, her parçayı OCR'den geçirin, ardından sonuçları birleştirin.
OCR neden uzun sürüyor? Her sayfa ayrı ayrı işlenir: yüksek çözünürlükte oluşturulur, analiz edilir ve tanınır. 20 sayfalık bir belge tarayıcıda 1-3 dakika sürebilir. İşlem cihazınızda çalışır — hız, CPU'nuza ve belleğinize bağlıdır.
OCR ücretsiz mi? Evet. PDFlexa OCR, açık kaynaklı Tesseract.js kullanarak tamamen tarayıcınızda, ücretsiz olarak çalışır. Hesap gerekmez, OCR aracında günlük limit yoktur.
Düzenli olarak kağıt kayıtları dijitalleştiriyor musunuz? İlgili iş akışları için muhasebeciler için PDF araçları veya araştırmacılar için PDF araçları sayfalarımıza bakın.