OCR — optyczne rozpoznawanie znaków — przekształca obraz tekstu w zeskanowanym pliku PDF w rzeczywiste, możliwe do zaznaczenia, przeszukiwania i skopiowania znaki. Ten przewodnik wyjaśnia, jak działa OCR, kiedy jest potrzebny i jak zastosować go za darmo w przeglądarce.
Dlaczego zeskanowane pliki PDF potrzebują OCR?
Kiedy skanujesz dokument papierowy, skaner tworzy obraz strony — a nie plik tekstowy. Zeskanowany PDF jest w zasadzie plikiem JPEG lub TIFF osadzonym w kontenerze PDF. Możesz go przeglądać, ale:
- Nie możesz zaznaczyć ani skopiować tekstu
- Ctrl+F (Znajdź) zwraca zero wyników
- Czytniki ekranu nie potrafią go odczytać (niedostępny)
- Wyszukiwarki nie mogą zaindeksować jego treści
- Nie możesz wypełnić pól formularza ani podświetlić tekstu
OCR odczytuje ten obraz i tworzy warstwę tekstu — niewidoczną warstwę rozpoznanych znaków nałożoną precyzyjnie na obraz. Po zastosowaniu OCR dokument wygląda identycznie, ale ma teraz pod spodem prawdziwy tekst, z którym możesz wchodzić w interakcję.
Jak zastosować OCR na PDF-ie online (za darmo)
Reduce your PDF file size instantly. No software needed.
Przy użyciu PDFlexa OCR:
- Przejdź do PDFlexa OCR
- Wgraj swój zeskanowany plik PDF (przeciągnij i upuść lub kliknij Choose a file)
- Wybierz język dokumentu z listy rozwijanej (obsługiwanych jest 24 języków)
- Wybierz format wyjściowy:
- Przeszukiwalny PDF — zachowuje oryginalny wygląd, dodaje niewidoczną warstwę tekstu
- Zwykły tekst (.txt) — sam wyodrębniony tekst, bez układu
- Kliknij Run OCR
- Pobierz wynik
Przetwarzanie odbywa się w Twojej przeglądarce przy użyciu Tesseract.js. W przypadku dużych plików PDF (30+ stron) przetwarzanie zajmuje kilka minut. Żaden plik nie jest przesyłany na serwer.
Obsługiwane języki obejmują: angielski, francuski, niemiecki, hiszpański, portugalski, włoski, niderlandzki, polski, rosyjski, arabski, chiński (uproszczony), japoński, koreański, hindi, turecki i 9 innych.
Kiedy potrzebny jest OCR?
| Typ dokumentu | Czy potrzebny OCR? |
|---|---|
| Dokument papierowy zeskanowany do PDF | ✅ Tak — to obraz |
| Zdjęcie dokumentu zrobione telefonem | ✅ Tak |
| PDF utworzony z pliku Word/Excel/Dokumentów Google | ❌ Nie — już ma warstwę tekstu |
| PDF wyeksportowany bezpośrednio z oprogramowania (faktury, paragony) | ❌ Nie — już ma tekst |
| Stary zeskanowany dokument archiwalny | ✅ Tak |
| PDF, w którym tekst jest rozmyty lub zniekształcony | ⚠️ OCR może pomóc |
| Formularz PDF, którego nie możesz wypełnić | ✅ Pomogą OCR + Fill PDF |
Szybki sposób sprawdzenia: spróbuj zaznaczyć tekst na stronie. Jeśli możesz podświetlić słowo, PDF już ma warstwę tekstu. Jeśli kursor tworzy tylko prostokąt zaznaczenia wokół obszaru (jak przy zaznaczaniu obrazu), to jest to zeskanowany obraz i potrzebuje OCR.
Jak działa OCR (pod maską)
Turn any PDF into an editable Word document in seconds.
- Renderowanie strony — każda strona pliku PDF jest renderowana w wysokiej rozdzielczości (odpowiednik 300+ DPI) jako obraz
- Wstępne przetwarzanie — obraz jest prostowany, odszumiany i konwertowany do skali szarości
- Wykrywanie tekstu — silnik OCR identyfikuje obszary przypominające tekst (kolumny, linie, słowa)
- Rozpoznawanie znaków — każdy obszar znaku jest porównywany z wytrenowanym modelem dla wybranego języka
- Tworzenie warstwy tekstu — rozpoznane znaki są umieszczane w wykrytych pozycjach nad oryginalnym obrazem
- Rekonstrukcja PDF — tworzony jest nowy plik PDF z oryginalnym obrazem oraz niewidoczną warstwą tekstu
Jakość OCR zależy od: rozdzielczości skanu (wyższa jest lepsza), jakości dokumentu (wyraźny druk kontra blaknący atrament), dopasowania języka oraz tego, czy tekst jest drukowany, czy odręczny. PDFlexa korzysta z Tesseract — najczęściej używanego silnika OCR o otwartym kodzie źródłowym, wytrenowanego na ponad 100 językach.
Wskazówki dla lepszych wyników OCR
Skanuj w rozdzielczości 300 DPI lub wyższej. Większość skanerów konsumenckich domyślnie ustawia 150 DPI, co wystarcza do przeglądania, ale daje słabe wyniki OCR. Użyj 300 DPI dla tekstu, 600 DPI dla bardzo małego druku.
Skanuj w skali szarości lub czarno-biało. Kolorowe skany są większe i nie poprawiają jakości OCR dla standardowych dokumentów tekstowych. Skala szarości to złoty środek.
Upewnij się, że strona jest płaska i prosta. Wygięte strony (od oprawy książki), przekrzywione skany lub cienie z kamery telefonu obniżają dokładność. Większość skanerów płaskich radzi sobie z tym dobrze; skany z aparatu telefonu są najbardziej problematyczne.
Wybierz właściwy język. Tesseract korzysta z wytrenowanych modeli specyficznych dla języka. Niemiecki dokument przetworzony z angielskim OCR będzie miał słabe wyniki dla umlautów (ä, ö, ü). Zawsze dopasuj język.
Duże litery i tekst drukowany są rozpoznawane lepiej niż pismo odręczne. Standardowy OCR jest zaprojektowany dla tekstu drukowanego. Rozpoznawanie pisma odręcznego to osobny (trudniejszy) problem, z którym Tesseract radzi sobie słabo.
Dokładność OCR: czego się spodziewać
| Jakość dokumentu | Oczekiwana dokładność |
|---|---|
| Czysty, pisany na maszynie, płasko zeskanowany przy 300 DPI | 98–99% dokładności znaków |
| Standardowy skan biurowy przy 150 DPI | 92–96% dokładności |
| Stary dokument z blaknącym atramentem | 80–90% dokładności |
| Odręczne notatki | 50–75% (bardzo zróżnicowana) |
| Wielokolumnowa praca naukowa | 90–95% (wykrywanie układu jest trudniejsze) |
| Pismo niełacińskie (arabski, chiński, koreański) | 85–95% przy właściwym języku |
W przypadku dokumentów o krytycznym znaczeniu (umowy, akta prawne), zawsze sprawdzaj wynik OCR pod kątem błędów — zwłaszcza nazw własnych, liczb i dat.
OCR a PDF na Word: jaka jest różnica?
| OCR PDF | PDF na Word | |
|---|---|---|
| Wynik | Przeszukiwalny PDF (ten sam wygląd) lub .txt | Edytowalny .docx |
| Najlepszy do | Uczynienia skanu przeszukiwalnym/dostępnym | Edycji treści w Microsoft Word |
| Układ | Oryginalny układ zachowany idealnie | Układ może się przesunąć podczas konwersji do Worda |
| Zastosowanie | Archiwum, wyszukiwanie, dostępność | Ponowne wykorzystanie i edycja treści |
Jeśli chcesz edytować zeskanowaną treść w Wordzie, najpierw uruchom OCR, a następnie użyj PDF to Word — OCR daje konwerterowi rzeczywisty tekst do pracy zamiast pustych obszarów obrazu.
Najczęściej zadawane pytania
Czy OCR zmienia wygląd mojego PDF-a? Nie. Warstwa tekstu OCR jest niewidoczna — znajduje się za obrazem strony. Plik PDF wygląda identycznie przed i po OCR. Jedyna różnica polega na tym, że tekst jest teraz możliwy do zaznaczenia i przeszukiwania.
Czy OCR może odczytać pismo odręczne? Standardowy OCR jest trenowany do tekstu drukowanego i jest zawodny w przypadku pisma odręcznego. Wyniki są bardzo zróżnicowane w zależności od tego, jak wyraźnie i konsekwentnie uformowane jest pismo. W przypadku ważnych odręcznych dokumentów bardziej wiarygodna jest ręczna transkrypcja.
Ile stron mogę poddać OCR jednocześnie? OCR PDFlexa działające w przeglądarce obsługuje do 50 stron na jedno przesłanie. W przypadku dłuższych dokumentów podziel plik PDF na części, zastosuj OCR do każdej części, a następnie scal wyniki.
Dlaczego OCR trwa tak długo? Każda strona jest przetwarzana indywidualnie: renderowana w wysokiej rozdzielczości, analizowana i rozpoznawana. 20-stronicowy dokument może zająć 1–3 minuty w przeglądarce. Przetwarzanie odbywa się na Twoim urządzeniu — szybkość zależy od procesora i pamięci.
Czy OCR jest darmowy? Tak. OCR PDFlexa działa całkowicie w Twojej przeglądarce przy użyciu otwartoźródłowego Tesseract.js, bez opłat. Bez wymaganego konta, bez dziennego limitu na narzędzie OCR.
Regularnie digitalizujesz dokumenty papierowe? Zobacz nasze narzędzia PDF dla księgowych lub narzędzia PDF dla badaczy po powiązane rozwiązania.