PDF, который выглядит совершенно читаемым для вас, может быть практически непригоден для того, кто использует программу чтения с экрана, навигацию только с клавиатуры или лупу для слабовидящих. Доступность — не нишевая забота, это часто юридическое требование, и это всегда хорошая практика. Вот что на самом деле делает PDF доступным и как приблизиться к этому с помощью уже имеющихся у вас инструментов.
Что на самом деле означает «доступный» для PDF
Доступный PDF — это не просто читаемый документ, а документ, пригодный для использования вспомогательными технологиями. Конкретно это означает:
- Программа чтения с экрана может читать содержимое в правильном порядке, а не хаотично, в зависимости от того, как элементы оказались расположены визуально.
- Текст является настоящим текстом, а не картинкой текста — программы чтения с экрана не могут читать пиксели, только настоящие данные символов.
- У изображений есть альтернативный текст, описывающий, что на них изображено, для пользователей, которые не могут их увидеть.
- Заголовки помечены как заголовки, а не просто оформлены так, чтобы выглядеть как заголовок, — это позволяет пользователям программ чтения с экрана перемещаться по структуре документа, а не листать его линейно.
- Цвет — не единственный способ передачи информации — диаграмма, полагающаяся исключительно на противопоставление красного и зеленого для передачи смысла, исключает читателей с нарушением цветовосприятия.
- У документа логичный порядок перехода по табуляции для тех, кто перемещается с помощью клавиатуры, а не мыши.
PDF может выглядеть совершенно нормально и при этом не соответствовать ни одному из этих пунктов.
Почему это важно не только для соответствия требованиям
Reduce your PDF file size instantly. No software needed.
Юридические требования (такие как ADA в США, Европейский акт о доступности или Section 508 для документов правительства США) реальны и все чаще применяются на практике — но работа над доступностью также просто делает документы лучше для гораздо большего числа людей, чем охватывают конкретные правила:
- Пользователи программ чтения с экрана и люди со слабым зрением — самые очевидные бенефициары, но правильная структура также помогает любому, кто бегло просматривает длинный документ в поисках конкретного раздела.
- Настоящий текст (в сравнении с отсканированными изображениями) доступен для поиска, копирования и работает с инструментами перевода браузера — улучшения доступности и общие улучшения удобства использования сильно пересекаются.
- Документы, распространяемые среди публики, — государственные формы, опубликованные отчеты, образовательные материалы — имеют гораздо более широкую аудиторию, чем файлы только для внутреннего пользования, что делает пробелы в доступности более значимыми.
Самый распространенный сбой доступности: отсканированные документы
Отсканированная страница — даже совершенно четкий, высокоразрешенный скан — это изображение. У нее вообще нет текстового слоя, что означает, что программе чтения с экрана нечего читать; она просто видит картинку. Это самая распространенная и самая легко исправимая проблема доступности в PDF.
Решение — OCR PDF, который распознает текст на отсканированном изображении и строит за ним настоящий, выделяемый текстовый слой. Уже одно это переводит документ из полностью недоступного в хотя бы читаемый вспомогательными технологиями — хотя смотрите оговорки ниже, поскольку сам по себе OCR не добавляет правильную структуру заголовков или порядок чтения.
Как сделать более доступным цифрово созданный PDF
Turn any PDF into an editable Word document in seconds.
Для PDF, экспортированного из Word, Google Docs или аналогичного редактора (не отсканированного), доступность в основном сводится к тому, как был построен исходный документ:
- Используйте настоящие стили заголовков (Заголовок 1, Заголовок 2 и т. д.) в исходном документе, а не просто делайте текст жирным и крупнее, — большинство инструментов экспорта переводят стили заголовков в правильные теги PDF, чего не происходит с текстом, оформленным вручную.
- Добавляйте альтернативный текст к изображениям в исходном документе перед экспортом — это обычно переносится и в разметку PDF.
- Используйте структуру таблицы для табличных данных, а не табуляцию или пробелы для имитации выравнивания — настоящая таблица экспортируется со структурой, по которой программа чтения с экрана может перемещаться; текст, выровненный вручную пробелами, читается просто как запутанный поток слов.
- Давайте ссылкам описательный текст («прочитайте полный отчет» вместо «нажмите здесь») — пользователи программ чтения с экрана часто перемещаются, вызывая список ссылок на странице, где многократно повторяющееся «нажмите здесь» лишено смысла вне контекста.
Правильное выполнение всего этого в исходном документе (Word, Google Docs, вашей CMS) перед конвертацией экономит гораздо больше работы по доступности, чем попытка исправить это постфактум в самом PDF.
Что реально можно исправить, когда PDF уже существует
Как только у вас есть готовый PDF, ваши варианты более узкие, но не нулевые:
- Запустите OCR, если это скан, чтобы хотя бы получить в документе настоящий текст.
- Добавьте текстовые аннотации с помощью Аннотировать PDF, чтобы дополнить содержимое, которому не хватает контекста, хотя это не заменяет правильную структурную разметку.
- Проверьте порядок чтения вручную, попытавшись выделить текст курсором сверху вниз, — если выделение неожиданно скачет, базовый порядок содержимого не соответствует визуальному макету.
Глубокие структурные исправления — правильные теги заголовков, структура таблиц, полная разметка для документа, который никогда не создавался с ними, — как правило, требуют возврата к исходнику и пересборки или специализированного программного обеспечения для устранения проблем доступности, выходящего за рамки того, что могут делать браузерные инструменты для PDF. Если вы работаете над официальным соответствием требованиям для большого объема документов, это стоит знать заранее, а не предполагать, что какой-либо инструмент сможет задним числом добавить полную разметку.
Часто задаваемые вопросы
Является ли PDF с возможностью поиска автоматически доступным PDF? Нет — текст с возможностью поиска (через OCR) необходим, но недостаточен. Полная доступность также требует правильной структуры заголовков, альтернативного текста, логичного порядка чтения и корректной разметки, чего один только OCR не добавляет.
Может ли PDFlexa сделать мой PDF полностью соответствующим стандартам доступности, таким как PDF/UA? Инструмент OCR от PDFlexa решает самый распространенный сбой (отсутствие текстового слоя в отсканированных документах), но полное соответствие PDF/UA включает структурную разметку, которую лучше всего решать на этапе исходного документа или с помощью специализированного программного обеспечения по доступности для уже существующих файлов.
Работает ли добавление альтернативного текста в PDF так же, как в документе Word? Концепция та же, но добавление альтернативного текста напрямую в существующий PDF обычно требует пересборки исходного документа с включенным альтернативным текстом перед конвертацией — задним числом встроить его в готовый PDF более ограниченно.
Почему мой отсканированный документ не проходит проверки доступности даже после OCR? OCR добавляет текстовый слой, но не добавляет автоматически структуру заголовков, альтернативный текст или разметку — отсканированный документ остается по сути неструктурированным PDF, даже когда его текст уже читаем.
Нужно ли специальное программное обеспечение, чтобы проверить, доступен ли мой PDF? Существуют бесплатные проверщики доступности (включая встроенный в Adobe Acrobat и отдельные инструменты вроде PAC — PDF Accessibility Checker), которые отмечают отсутствующие теги, альтернативный текст и структурные проблемы.
Главный вывод
Доступность легче всего обеспечить правильно у истока — с помощью правильных заголовков, альтернативного текста и настоящих таблиц в вашем оригинальном документе Word или Google Doc — и труднее всего исправить постфактум. Если вы начинаете со скана, OCR — обязательный первый шаг, хотя это и не полное решение. Относитесь к доступности как к части того, как вы создаете документ, а не как к галочке, которую нужно поставить впоследствии.
Работаете с отсканированным документом? Начните с OCR PDF — бесплатно, и он строит настоящий текстовый слой прямо в браузере.
Нужно заполнить недостающий контекст в существующем документе? Аннотировать PDF позволяет добавлять заметки и текст прямо на странице.