Một PDF hoàn toàn dễ đọc đối với bạn có thể gần như không thể sử dụng được đối với người dùng trình đọc màn hình, người điều hướng chỉ bằng bàn phím, hoặc người dùng kính lúp cho thị lực kém. Khả năng tiếp cận không phải là mối quan tâm nhỏ lẻ — đó thường là yêu cầu pháp lý, và luôn là một thực hành tốt. Đây là những gì thực sự làm cho một PDF dễ tiếp cận, và cách tiến gần hơn đến điều đó với các công cụ bạn đã có.
"Dễ tiếp cận" thực sự có nghĩa là gì đối với một PDF
Một PDF dễ tiếp cận không chỉ là một PDF dễ đọc — đó là một PDF có thể sử dụng được bởi công nghệ hỗ trợ. Cụ thể, điều đó có nghĩa là:
- Trình đọc màn hình có thể đọc nội dung theo đúng thứ tự, không lộn xộn dựa trên cách các phần tử tình cờ được đặt về mặt hình ảnh.
- Văn bản là văn bản thực, không phải hình ảnh của văn bản — trình đọc màn hình không thể đọc pixel, chỉ đọc dữ liệu ký tự thực.
- Hình ảnh có văn bản thay thế (alt text) mô tả những gì chúng thể hiện, dành cho người dùng không thể nhìn thấy chúng.
- Tiêu đề được gắn thẻ là tiêu đề, không chỉ được tạo kiểu để trông giống tiêu đề — điều này cho phép người dùng trình đọc màn hình điều hướng theo cấu trúc tài liệu thay vì cuộn tuyến tính.
- Màu sắc không phải là cách duy nhất để truyền tải thông tin — một biểu đồ chỉ dựa vào đỏ-so-với-xanh lá để truyền tải ý nghĩa sẽ loại trừ độc giả mù màu.
- Tài liệu có thứ tự tab hợp lý cho bất kỳ ai điều hướng bằng bàn phím thay vì chuột.
Một PDF có thể trông hoàn toàn bình thường mà vẫn thất bại ở mọi tiêu chí này.
Tại sao điều này quan trọng vượt ra ngoài việc tuân thủ
Reduce your PDF file size instantly. No software needed.
Các yêu cầu pháp lý (như ADA ở Mỹ, Đạo Luật Tiếp Cận Châu Âu, hoặc Section 508 cho tài liệu chính phủ Mỹ) là có thật và ngày càng được thực thi nghiêm ngặt hơn — nhưng công việc về khả năng tiếp cận cũng đơn giản làm cho tài liệu tốt hơn cho nhiều người hơn so với phạm vi các quy định cụ thể:
- Người dùng trình đọc màn hình và người có thị lực kém là những đối tượng hưởng lợi rõ ràng nhất, nhưng cấu trúc phù hợp cũng giúp bất kỳ ai lướt qua một tài liệu dài để tìm một phần cụ thể.
- Văn bản thực (so với hình ảnh scan) có thể tìm kiếm, sao chép, và hoạt động với công cụ dịch của trình duyệt — cải thiện khả năng tiếp cận và cải thiện khả năng sử dụng chung chồng lấp nhau rất nhiều.
- Các tài liệu phân phối cho công chúng — biểu mẫu chính phủ, báo cáo đã xuất bản, tài liệu giáo dục — có đối tượng lớn hơn nhiều so với các file chỉ dùng nội bộ, khiến những lỗ hổng về khả năng tiếp cận trở nên nghiêm trọng hơn.
Lỗi khả năng tiếp cận phổ biến nhất: tài liệu đã scan
Một trang đã scan — dù là một bản scan hoàn toàn rõ nét, độ phân giải cao — vẫn là một hình ảnh. Nó hoàn toàn không có lớp văn bản, nghĩa là trình đọc màn hình không có gì để đọc; nó chỉ nhìn thấy một bức ảnh. Đây là vấn đề khả năng tiếp cận phổ biến nhất và cũng dễ khắc phục nhất trong PDF.
Cách khắc phục là OCR PDF, công cụ nhận dạng văn bản trong một hình ảnh đã scan và xây dựng một lớp văn bản thực, có thể chọn được đằng sau nó. Chỉ riêng điều này đã đưa một tài liệu từ hoàn toàn không thể tiếp cận sang ít nhất có thể đọc được bởi công nghệ hỗ trợ — mặc dù xem các lưu ý bên dưới, vì OCR đơn thuần không thêm cấu trúc tiêu đề hay thứ tự đọc phù hợp.
Làm cho một PDF được tạo dưới dạng số dễ tiếp cận hơn
Turn any PDF into an editable Word document in seconds.
Đối với một PDF được xuất từ Word, Google Docs, hoặc tương tự (không phải scan), khả năng tiếp cận chủ yếu phụ thuộc vào cách tài liệu nguồn được xây dựng:
- Sử dụng kiểu tiêu đề thực sự (Heading 1, Heading 2, v.v.) trong tài liệu nguồn thay vì chỉ làm chữ đậm và to hơn — hầu hết các công cụ xuất chuyển kiểu tiêu đề thành thẻ PDF phù hợp, điều mà văn bản được tạo kiểu thủ công không có được.
- Thêm văn bản thay thế cho hình ảnh trong tài liệu nguồn trước khi xuất — điều này thường được giữ lại khi chuyển sang thẻ trong PDF.
- Sử dụng cấu trúc bảng cho dữ liệu dạng bảng, không dùng tab hoặc khoảng trắng để giả lập căn chỉnh — một bảng thực sự xuất ra với cấu trúc mà trình đọc màn hình có thể điều hướng; văn bản căn chỉnh thủ công chỉ đọc như một chuỗi từ ngữ khó hiểu.
- Đặt văn bản mô tả cho liên kết ("đọc báo cáo đầy đủ" thay vì "nhấn vào đây") — người dùng trình đọc màn hình thường điều hướng bằng cách hiển thị danh sách liên kết trên một trang, nơi "nhấn vào đây" lặp lại nhiều lần trở nên vô nghĩa khi tách khỏi ngữ cảnh.
Làm đúng những điều này trong tài liệu nguồn (Word, Google Docs, CMS của bạn) trước khi chuyển đổi tiết kiệm được nhiều công sức về khả năng tiếp cận hơn là cố gắng sửa nó sau trong chính file PDF.
Những gì bạn có thể thực tế sửa sau khi PDF đã tồn tại
Khi bạn đã có một PDF hoàn chỉnh, các lựa chọn của bạn hẹp hơn nhưng không phải là không có:
- Chạy OCR nếu đó là một bản scan, để ít nhất có văn bản thực trong tài liệu.
- Thêm chú thích văn bản với Chú Thích PDF để bổ sung nội dung thiếu ngữ cảnh, mặc dù điều này không thay thế được việc gắn thẻ cấu trúc phù hợp.
- Kiểm tra thứ tự đọc thủ công bằng cách thử chọn văn bản bằng con trỏ từ trên xuống dưới — nếu vùng chọn nhảy lung tung không mong muốn, thứ tự nội dung nền không khớp với bố cục hình ảnh.
Các bản sửa cấu trúc sâu — thẻ tiêu đề phù hợp, cấu trúc bảng, gắn thẻ đầy đủ cho một tài liệu chưa bao giờ được xây dựng với chúng — nói chung đòi hỏi phải quay lại nguồn và xây dựng lại, hoặc phần mềm khắc phục khả năng tiếp cận chuyên dụng vượt ngoài những gì công cụ PDF chạy trên trình duyệt có thể làm. Nếu bạn đang làm việc về tuân thủ chính thức cho khối lượng lớn tài liệu, điều này đáng biết trước thay vì giả định rằng bất kỳ công cụ nào cũng có thể tái tạo đầy đủ việc gắn thẻ sau khi thực tế.
Câu Hỏi Thường Gặp
Một PDF có thể tìm kiếm có tự động là một PDF dễ tiếp cận không? Không — văn bản có thể tìm kiếm (qua OCR) là cần thiết nhưng chưa đủ. Khả năng tiếp cận đầy đủ còn đòi hỏi cấu trúc tiêu đề phù hợp, văn bản thay thế, thứ tự đọc hợp lý, và gắn thẻ chính xác, điều mà OCR đơn thuần không thêm vào.
PDFlexa có thể làm cho PDF của tôi hoàn toàn tuân thủ các tiêu chuẩn khả năng tiếp cận như PDF/UA không? Công cụ OCR của PDFlexa giải quyết lỗi phổ biến nhất (không có lớp văn bản trong tài liệu đã scan), nhưng việc tuân thủ đầy đủ PDF/UA liên quan đến việc gắn thẻ cấu trúc, điều tốt nhất nên được xử lý ở giai đoạn tài liệu nguồn hoặc với phần mềm khả năng tiếp cận chuyên dụng cho các file đã tồn tại.
Việc thêm văn bản thay thế vào PDF có hoạt động giống như trong tài liệu Word không? Khái niệm giống nhau, nhưng việc thêm văn bản thay thế trực tiếp vào một PDF đã tồn tại thường đòi hỏi tài liệu nguồn phải được xây dựng lại với văn bản thay thế đã bao gồm trước khi chuyển đổi — việc thêm vào một PDF hoàn chỉnh bị hạn chế hơn.
Tại sao tài liệu đã scan của tôi vẫn không đạt kiểm tra khả năng tiếp cận ngay cả sau khi OCR? OCR thêm một lớp văn bản, nhưng không tự động thêm cấu trúc tiêu đề, văn bản thay thế, hoặc gắn thẻ — một tài liệu đã scan vẫn về cơ bản là một PDF không có cấu trúc ngay cả khi văn bản của nó đã có thể đọc được.
Tôi có cần phần mềm đặc biệt để kiểm tra xem PDF của tôi có dễ tiếp cận không? Có các trình kiểm tra khả năng tiếp cận miễn phí (bao gồm một trình được tích hợp sẵn trong Adobe Acrobat, và các công cụ độc lập như PAC — PDF Accessibility Checker) đánh dấu các thẻ bị thiếu, văn bản thay thế, và các vấn đề cấu trúc.
Kết luận
Khả năng tiếp cận dễ làm đúng nhất ngay từ nguồn — tiêu đề phù hợp, văn bản thay thế, và bảng thực trong tài liệu Word hoặc Google Doc gốc của bạn — và khó tái tạo nhất sau khi thực tế. Nếu bạn bắt đầu từ một bản scan, OCR là bước đầu tiên thiết yếu, mặc dù nó không phải là toàn bộ giải pháp. Hãy coi khả năng tiếp cận là một phần của cách bạn xây dựng tài liệu, không phải một ô cần đánh dấu sau này.
Đang làm việc từ một tài liệu đã scan? Bắt đầu với OCR PDF — miễn phí, và xây dựng lớp văn bản thực ngay trong trình duyệt của bạn.
Cần bổ sung ngữ cảnh còn thiếu vào một tài liệu có sẵn? Chú Thích PDF cho phép bạn thêm ghi chú và văn bản trực tiếp trên trang.