Trích Xuất Văn Bản Từ Bất Kỳ PDF hoặc Hình Ảnh Nào
OCR hơn 30 ngôn ngữ. Xuất dưới dạng PDF có thể tìm kiếm, Word DOCX, TXT hoặc Markdown. Chạy hoàn toàn trong trình duyệt của bạn — không có gì được tải lên máy chủ.
Kéo và thả hoặc nhấp để tải lên
PDF quét, JPG, PNG, WebP hoặc TIFF
Tối đa 100 trang mỗi PDF · Hỗ trợ nhiều hình ảnh
Đang khởi tạo…
Tệp của bạn đã sẵn sàng
Ngôn ngữ được hỗ trợ
Định dạng xuất
- PDF có thể tìm kiếm (được đề xuất) — Giữ nguyên bố cục gốc; văn bản có thể chọn được trong bất kỳ trình xem PDF nào
- Tài liệu Word (.docx) — Mở và chỉnh sửa trong Microsoft Word hoặc Google Docs
- Văn bản thuần (.txt) — Đầu ra văn bản sạch, được mã hóa UTF-8
- Markdown (.md) — Văn bản có cấu trúc được nhóm theo đoạn văn
Riêng Tư 100%
Tất cả quá trình xử lý OCR chạy trong trình duyệt của bạn bằng WebAssembly. Tệp của bạn không bao giờ được gửi đến bất kỳ máy chủ nào — kể cả máy chủ của chúng tôi. Việc xử lý riêng tư như đọc một tài liệu trên chính màn hình của bạn.
Tại sao nên sử dụng AI OCR của PDFlexa?
Công Cụ Tesseract LSTM
Được hỗ trợ bởi mạng nơ-ron LSTM của Tesseract — tiêu chuẩn ngành cho OCR mã nguồn mở, với độ chính xác từ ngữ 95–99% trên tài liệu sạch.
Bố Cục Được Giữ Nguyên
Việc xuất PDF có thể tìm kiếm giữ nguyên hình ảnh trang gốc và thêm một lớp văn bản vô hình — bảo toàn mọi lề, cột và yếu tố hình ảnh.
Xử Lý Nền
Một Web Worker chuyên dụng chạy OCR trong một luồng nền — tab trình duyệt của bạn vẫn hoàn toàn tương tác trong khi các tài liệu lớn, nhiều trang được xử lý.
33 Ngôn Ngữ
Từ tiếng Ả Rập và tiếng Trung đến tiếng Ukraina và tiếng Thái — bao phủ hầu như mọi ngôn ngữ chính trên thế giới, bao gồm cả chữ viết từ phải sang trái.
4 Định Dạng Xuất
PDF có thể tìm kiếm, Word DOCX, TXT thuần túy và Markdown — xuất trực tiếp sang định dạng phù hợp với quy trình làm việc của bạn, không cần bước chuyển đổi.
Không Lưu Giữ Dữ Liệu
Vì quá trình xử lý không bao giờ rời khỏi trình duyệt của bạn, nên không có tệp nào cần lưu giữ hoặc xóa. Tài liệu của bạn riêng tư như một tệp trên bàn làm việc của chính bạn.
Cách Trích xuất Văn bản từ PDF Đã quét
Tải Lên PDF hoặc Hình Ảnh Đã Quét Của Bạn
Kéo và thả một PDF, JPG, PNG, WebP hoặc TIFF đã quét vào khu vực tải lên, hoặc nhấp vào "Chọn tệp" để duyệt. Hỗ trợ PDF nhiều trang và nhiều tệp hình ảnh.
Chọn Ngôn Ngữ và Định Dạng Đầu Ra
Chọn ngôn ngữ mà tài liệu được viết trong số 33 tùy chọn có sẵn. Sau đó chọn định dạng xuất ưa thích của bạn — PDF có thể tìm kiếm được khuyến nghị để có khả năng tương thích tối đa.
Nhấp Vào "Bắt Đầu OCR" và Tải Xuống
Công cụ OCR xử lý tài liệu của bạn trong một worker nền. Thanh tiến trình hiển thị trang hiện đang được xử lý. Khi hoàn tất, hãy tải xuống kết quả của bạn ngay lập tức.
Câu hỏi Thường gặp về OCR
OCR là gì và nó hoạt động như thế nào?
OCR (Nhận dạng Ký tự Quang học) chuyển đổi hình ảnh văn bản — tài liệu đã quét, ảnh chụp các trang in, hoặc PDF chỉ có hình ảnh — thành các ký tự máy có thể đọc được. Công cụ phân tích các mẫu pixel và ánh xạ chúng thành chữ cái, số và dấu câu. Pdflexa sử dụng Tesseract, công cụ OCR mã nguồn mở chính xác nhất thế giới, chạy hoàn toàn trong trình duyệt của bạn.
Công cụ OCR chấp nhận những định dạng tệp nào?
Bạn có thể tải lên các tệp PDF đã quét cũng như hình ảnh JPEG/JPG, PNG, WebP và TIFF. PDF nhiều trang được xử lý theo từng trang (tối đa 100 trang mỗi tệp). Tải lên hàng loạt cho phép bạn thực hiện OCR trên nhiều hình ảnh cùng lúc.
Công cụ OCR hỗ trợ bao nhiêu ngôn ngữ?
Công cụ OCR hỗ trợ 33 ngôn ngữ bao gồm tiếng Việt, tiếng Anh, tiếng Tây Ban Nha, tiếng Pháp, tiếng Đức, tiếng Trung (Giản thể và Phồn thể), tiếng Nhật, tiếng Hàn, tiếng Ả Rập, tiếng Nga, tiếng Hindi và nhiều hơn nữa. Chọn đúng ngôn ngữ tài liệu trước khi xử lý để tối đa hóa độ chính xác.
Tài liệu của tôi có được tải lên máy chủ của Pdflexa không?
Không. Mọi bước — hiển thị PDF, nhận dạng OCR và tạo đầu ra — chạy hoàn toàn bên trong trình duyệt của bạn bằng WebAssembly và JavaScript. Tệp của bạn không bao giờ rời khỏi thiết bị của bạn, khiến đây trở thành công cụ OCR riêng tư nhất hiện có trực tuyến.
Tôi có thể xuất những định dạng đầu ra nào?
Bạn có thể xuất văn bản đã nhận dạng dưới dạng PDF có thể tìm kiếm (hình ảnh gốc với lớp văn bản vô hình, giúp nó có thể chọn và sao chép trong bất kỳ trình xem PDF nào), TXT thuần túy, Microsoft Word DOCX, hoặc Markdown. Tất cả các định dạng đều giữ nguyên thứ tự đọc hợp lý của văn bản.
Độ chính xác của nhận dạng văn bản như thế nào?
Độ chính xác phụ thuộc vào chất lượng tài liệu, độ phân giải và ngôn ngữ. Các bản quét sạch, độ phân giải cao (300 DPI trở lên) bằng ngôn ngữ được hỗ trợ thường đạt độ chính xác từ ngữ trên 98% với công cụ LSTM của Tesseract. Chữ viết tay, phông chữ trang trí, tài liệu có độ tương phản thấp hoặc các trang có ngôn ngữ hỗn hợp sẽ có độ chính xác thấp hơn.
Tôi có thể OCR một PDF lớn với nhiều trang không?
Có. Công cụ OCR xử lý các trang theo tuần tự bằng cách sử dụng Web Worker nền, vì vậy giao diện trình duyệt của bạn luôn phản hồi nhanh. Hỗ trợ tối đa 100 trang mỗi tệp. Đối với các tài liệu rất lớn, việc xử lý có thể mất vài phút — chỉ báo tiến trình theo thời gian thực hiển thị trang nào đang được xử lý.
OCR có giữ nguyên bố cục tài liệu gốc không?
Việc xuất PDF có thể tìm kiếm giữ nguyên hoàn hảo bố cục hình ảnh gốc, vì hình ảnh trang được giữ nguyên và văn bản được viết dưới dạng lớp phủ vô hình. Đối với các bản xuất TXT, DOCX và Markdown, văn bản được trích xuất theo thứ tự đọc, nhưng định dạng hình ảnh (cột, bảng) được ước lượng gần đúng thay vì tái tạo chính xác.