OCR — оптическое распознавание символов — преобразует изображение текста в отсканированном PDF в настоящие символы, доступные для выделения, поиска и копирования. В этом руководстве мы объясним, как работает OCR, когда он нужен и как применить его бесплатно прямо в браузере.
Почему отсканированным PDF нужен OCR?
Когда вы сканируете бумажный документ, сканер создает картинку страницы, а не текстовый файл. Отсканированный PDF — это, по сути, изображение JPEG или TIFF, встроенное в контейнер PDF. Вы можете его просматривать, но:
- Вы не можете выделить или скопировать текст
- Ctrl+F (поиск) не находит ничего
- Программы для чтения с экрана не могут его прочитать (недоступно для людей с ограниченными возможностями)
- Поисковые системы не могут проиндексировать его содержимое
- Вы не можете заполнять поля формы или выделять текст
OCR читает это изображение и создает текстовый слой — невидимый слой распознанных символов, точно наложенный поверх изображения. После OCR документ выглядит идентично, но теперь под изображением есть настоящий текст, с которым можно взаимодействовать.
Как применить OCR к PDF онлайн (бесплатно)
Reduce your PDF file size instantly. No software needed.
С помощью PDFlexa OCR:
- Перейдите в PDFlexa OCR
- Загрузите свой отсканированный PDF (перетащите файл или нажмите Выбрать файл)
- Выберите язык документа из раскрывающегося списка (поддерживается 24 языка)
- Выберите формат вывода:
- PDF с возможностью поиска — сохраняет исходный внешний вид, добавляет невидимый текстовый слой
- Простой текст (.txt) — только извлеченный текст, без макета
- Нажмите Запустить OCR
- Скачайте результат
Обработка происходит в вашем браузере с использованием Tesseract.js. Для больших PDF (30+ страниц) обработка занимает несколько минут. Файл не загружается на сервер.
В число поддерживаемых языков входят: английский, французский, немецкий, испанский, португальский, итальянский, нидерландский, польский, русский, арабский, китайский (упрощенный), японский, корейский, хинди, турецкий и еще 9 языков.
Когда нужен OCR?
| Тип документа | Нужен ли OCR? |
|---|---|
| Бумажный документ, отсканированный в PDF | ✅ Да — это изображение |
| Фото документа, снятое телефоном | ✅ Да |
| PDF, созданный из файла Word/Excel/Google Docs | ❌ Нет — уже есть текстовый слой |
| PDF, экспортированный напрямую из программы (счета, чеки) | ❌ Нет — уже есть текст |
| Старый отсканированный архивный документ | ✅ Да |
| PDF, где текст размыт или искажен | ⚠️ OCR может улучшить ситуацию |
| Форма PDF, которую нельзя заполнить | ✅ Помогут OCR + Fill PDF |
Быстрый способ проверки: попробуйте выделить текст на странице. Если можно выделить слово — в PDF уже есть текстовый слой. Если курсор создает только рамку выделения вокруг области (как при выделении области изображения), это отсканированное изображение, и ему нужен OCR.
Как работает OCR (что происходит «под капотом»)
Turn any PDF into an editable Word document in seconds.
- Отрисовка страницы — каждая страница PDF отрисовывается в высоком разрешении (эквивалент 300+ DPI) как изображение
- Предварительная обработка — изображение выравнивается по наклону, очищается от шума и переводится в оттенки серого
- Обнаружение текста — движок OCR определяет области, похожие на текст (столбцы, строки, слова)
- Распознавание символов — каждая область символа сопоставляется с обученной моделью для выбранного языка
- Создание текстового слоя — распознанные символы размещаются в обнаруженных позициях поверх исходного изображения
- Пересборка PDF — создается новый PDF с исходным изображением плюс невидимым текстовым слоем
Качество OCR зависит от: разрешения скана (чем выше, тем лучше), качества документа (четкая печать против выцветших чернил), соответствия языка и от того, напечатан текст или написан от руки. PDFlexa использует Tesseract — самый распространенный движок OCR с открытым исходным кодом, обученный на более чем 100 языках.
Советы для лучших результатов OCR
Сканируйте с разрешением 300 DPI или выше. У большинства потребительских сканеров по умолчанию установлено 150 DPI, чего достаточно для просмотра, но недостаточно для хорошего OCR. Используйте 300 DPI для текста, 600 DPI для очень мелкого шрифта.
Сканируйте в оттенках серого или черно-белом режиме. Цветные сканы больше по размеру и не улучшают качество OCR для стандартных текстовых документов. Оттенки серого — оптимальный вариант.
Убедитесь, что страница ровная и прямая. Изогнутые страницы (из-за переплета книги), скошенные сканы или тени от камеры телефона снижают точность. Большинство планшетных сканеров хорошо справляются с этим; сканы, сделанные камерой телефона, — самый проблемный случай.
Выбирайте правильный язык. Tesseract использует специфичные для языка обученные модели. Немецкий документ, обработанный с английским OCR, даст плохие результаты на умляутах (ä, ö, ü). Всегда указывайте правильный язык.
Печатный текст крупным шрифтом распознается лучше рукописного. Стандартный OCR разработан для печатного текста. Распознавание рукописного текста — отдельная (более сложная) задача, с которой Tesseract справляется плохо.
Точность OCR: чего ожидать
| Качество документа | Ожидаемая точность |
|---|---|
| Чистый, напечатанный, отсканированный ровно при 300 DPI | 98–99% точности распознавания символов |
| Стандартный офисный скан при 150 DPI | 92–96% точности |
| Старый документ с выцветшими чернилами | 80–90% точности |
| Рукописные заметки | 50–75% (сильно варьируется) |
| Многоколоночная научная статья | 90–95% (сложнее определить макет) |
| Нелатинский алфавит (арабский, китайский, корейский) | 85–95% при правильном языке |
Для важных документов (договоров, юридических записей) всегда проверяйте результат OCR на ошибки — особенно имена собственные, числа и даты.
OCR или PDF в Word: в чем разница?
| OCR PDF | PDF в Word | |
|---|---|---|
| Результат | PDF с возможностью поиска (тот же внешний вид) или .txt | Редактируемый .docx |
| Лучше всего подходит для | Сделать скан доступным для поиска/доступа | Редактирования содержимого в Microsoft Word |
| Макет | Исходный макет сохраняется идеально | Макет может измениться при конвертации в Word |
| Сценарий использования | Архивирование, поиск, доступность | Повторное использование и редактирование содержимого |
Если вы хотите отредактировать отсканированное содержимое в Word, сначала выполните OCR, а затем используйте PDF в Word — OCR дает конвертеру настоящий текст для работы, а не пустые области изображения.
Часто задаваемые вопросы
Меняет ли OCR внешний вид моего PDF? Нет. Текстовый слой OCR невидим — он находится позади изображения страницы. PDF выглядит идентично до и после OCR. Единственное отличие в том, что теперь текст можно выделять и искать.
Может ли OCR читать рукописный текст? Стандартный OCR обучен на печатном тексте и ненадежен для рукописного. Результаты сильно варьируются в зависимости от того, насколько четко и единообразно написан текст от руки. Для важных рукописных документов ручная расшифровка надежнее.
Сколько страниц можно обработать OCR за раз? Браузерный OCR от PDFlexa поддерживает до 50 страниц за одну загрузку. Для более длинных документов разделите PDF на части, примените OCR к каждой части, а затем объедините результаты.
Почему OCR занимает много времени? Каждая страница обрабатывается отдельно: отрисовывается в высоком разрешении, анализируется и распознается. 20-страничный документ может обрабатываться в браузере 1–3 минуты. Обработка происходит на вашем устройстве — скорость зависит от процессора и памяти.
Бесплатен ли OCR? Да. OCR от PDFlexa полностью работает в вашем браузере с использованием Tesseract.js с открытым исходным кодом, бесплатно. Регистрация не требуется, дневного лимита у инструмента OCR нет.