แยกข้อความจาก PDF หรือรูปภาพใดก็ได้
OCR มากกว่า 30 ภาษา ส่งออกเป็น PDF ที่ค้นหาได้ Word DOCX, TXT หรือ Markdown ทำงานทั้งหมดในเบราว์เซอร์ของคุณ — ไม่มีการอัปโหลดสิ่งใดไปยังเซิร์ฟเวอร์
ลากแล้ววางหรือคลิกเพื่ออัปโหลด
PDF ที่สแกน, JPG, PNG, WebP หรือ TIFF
สูงสุด 100 หน้าต่อ PDF · รองรับหลายรูปภาพ
กำลังเริ่มต้น…
ไฟล์ของคุณพร้อมแล้ว
ภาษาที่รองรับ
รูปแบบการส่งออก
- PDF ที่ค้นหาได้ (แนะนำ) — รักษาเลย์เอาต์ต้นฉบับ; ข้อความสามารถเลือกได้ในโปรแกรมดู PDF ใดก็ได้
- เอกสาร Word (.docx) — เปิดและแก้ไขใน Microsoft Word หรือ Google Docs
- ข้อความธรรมดา (.txt) — ผลลัพธ์ข้อความที่สะอาด เข้ารหัส UTF-8
- Markdown (.md) — ข้อความที่มีโครงสร้างจัดกลุ่มตามย่อหน้า
เป็นส่วนตัว 100%
การประมวลผล OCR ทั้งหมดทำงานภายในเบราว์เซอร์ของคุณโดยใช้ WebAssembly ไฟล์ของคุณจะไม่ถูกส่งไปยังเซิร์ฟเวอร์ใดๆ — แม้แต่ของเราเอง การประมวลผลเป็นส่วนตัวเหมือนกับการอ่านเอกสารบนหน้าจอของคุณเอง
ทำไมต้องใช้ PDFlexa AI OCR?
เอนจิน Tesseract LSTM
ขับเคลื่อนโดยเครือข่ายประสาท LSTM ของ Tesseract — มาตรฐานอุตสาหกรรมสำหรับ OCR โอเพนซอร์ส ด้วยความแม่นยำคำ 95–99% บนเอกสารที่ชัดเจน
รักษาเลย์เอาต์
การส่งออก PDF ที่ค้นหาได้จะคงภาพหน้าเดิมไว้ครบถ้วนและเพิ่มเลเยอร์ข้อความที่มองไม่เห็น — รักษาทุกขอบ คอลัมน์ และองค์ประกอบภาพ
การประมวลผลเบื้องหลัง
Web Worker เฉพาะจะรัน OCR ในเธรดเบื้องหลัง — แท็บเบราว์เซอร์ของคุณยังคงตอบสนองได้อย่างสมบูรณ์ในขณะที่ประมวลผลเอกสารขนาดใหญ่หลายหน้า
33 ภาษา
ตั้งแต่อาหรับและจีนไปจนถึงยูเครนและไทย — ครอบคลุมภาษาหลักของโลกเกือบทั้งหมด รวมถึงอักษรที่เขียนจากขวาไปซ้าย
4 รูปแบบการส่งออก
PDF ที่ค้นหาได้, Word DOCX, TXT ธรรมดา และ Markdown — ส่งออกโดยตรงไปยังรูปแบบที่เหมาะกับขั้นตอนการทำงานของคุณ โดยไม่ต้องแปลง
ไม่มีการเก็บรักษาข้อมูล
เนื่องจากการประมวลผลไม่เคยออกจากเบราว์เซอร์ของคุณ จึงไม่มีไฟล์ที่ต้องเก็บรักษาหรือลบ เอกสารของคุณเป็นส่วนตัวเหมือนไฟล์บนโต๊ะทำงานของคุณเอง
วิธีแยกข้อความจาก PDF ที่สแกน
อัปโหลด PDF หรือรูปภาพที่สแกนของคุณ
ลากและวาง PDF, JPG, PNG, WebP หรือ TIFF ที่สแกนลงในพื้นที่อัปโหลด หรือคลิก "เลือกไฟล์" เพื่อเรียกดู รองรับ PDF หลายหน้าและไฟล์รูปภาพหลายไฟล์
เลือกภาษาและรูปแบบผลลัพธ์
เลือกภาษาที่เอกสารเขียนจากตัวเลือกที่มีอยู่ 33 ตัวเลือก จากนั้นเลือกรูปแบบการส่งออกที่คุณต้องการ — แนะนำให้ใช้ PDF ที่ค้นหาได้เพื่อความเข้ากันได้สูงสุด
คลิก "เริ่ม OCR" และดาวน์โหลด
เอนจิน OCR จะประมวลผลเอกสารของคุณในเวิร์กเกอร์เบื้องหลัง แถบความคืบหน้าจะแสดงหน้าที่กำลังประมวลผลอยู่ในขณะนั้น เมื่อเสร็จสิ้น ให้ดาวน์โหลดผลลัพธ์ของคุณได้ทันที
คำถามที่พบบ่อยเกี่ยวกับ OCR
OCR คืออะไรและทำงานอย่างไร?
OCR (การรู้จำอักขระด้วยแสง) แปลงภาพข้อความ — เอกสารที่สแกน ภาพถ่ายของหน้าที่พิมพ์ หรือ PDF ที่เป็นภาพเท่านั้น — ให้เป็นอักขระที่เครื่องสามารถอ่านได้ เอนจินจะวิเคราะห์รูปแบบพิกเซลและจับคู่กับตัวอักษร ตัวเลข และเครื่องหมายวรรคตอน Pdflexa ใช้ Tesseract ซึ่งเป็นเอนจิน OCR โอเพนซอร์สที่แม่นยำที่สุดในโลก ทำงานทั้งหมดในเบราว์เซอร์ของคุณ
เครื่องมือ OCR รองรับรูปแบบไฟล์ใดบ้าง?
คุณสามารถอัปโหลดไฟล์ PDF ที่สแกนรวมถึงภาพ JPEG/JPG, PNG, WebP และ TIFF PDF หลายหน้าจะถูกประมวลผลทีละหน้า (สูงสุด 100 หน้าต่อไฟล์) การอัปโหลดแบบกลุ่มช่วยให้คุณทำ OCR กับรูปภาพหลายภาพพร้อมกันได้
เอนจิน OCR รองรับกี่ภาษา?
เอนจิน OCR รองรับ 33 ภาษา รวมถึงไทย อังกฤษ สเปน ฝรั่งเศส เยอรมัน จีน (ตัวย่อและตัวเต็ม) ญี่ปุ่น เกาหลี อาหรับ รัสเซีย ฮินดี และอื่นๆ เลือกภาษาเอกสารที่ถูกต้องก่อนประมวลผลเพื่อให้ได้ความแม่นยำสูงสุด
เอกสารของฉันถูกอัปโหลดไปยังเซิร์ฟเวอร์ของ Pdflexa หรือไม่?
ไม่ ทุกขั้นตอน — การเรนเดอร์ PDF การรู้จำ OCR และการสร้างผลลัพธ์ — ทำงานทั้งหมดภายในเบราว์เซอร์ของคุณโดยใช้ WebAssembly และ JavaScript ไฟล์ของคุณจะไม่มีวันออกจากอุปกรณ์ของคุณ ทำให้นี่เป็นเครื่องมือ OCR ที่เป็นส่วนตัวที่สุดที่มีให้บริการทางออนไลน์
ฉันสามารถส่งออกรูปแบบผลลัพธ์ใดได้บ้าง?
คุณสามารถส่งออกข้อความที่รู้จำได้เป็น PDF ที่ค้นหาได้ (ภาพต้นฉบับพร้อมเลเยอร์ข้อความที่มองไม่เห็น ทำให้สามารถเลือกและคัดลอกได้ในโปรแกรมดู PDF ใดก็ได้), TXT ธรรมดา, Microsoft Word DOCX หรือ Markdown รูปแบบทั้งหมดจะรักษาลำดับการอ่านเชิงตรรกะของข้อความไว้
การรู้จำข้อความมีความแม่นยำเพียงใด?
ความแม่นยำขึ้นอยู่กับคุณภาพเอกสาร ความละเอียด และภาษา การสแกนที่ชัดเจนความละเอียดสูง (300 DPI ขึ้นไป) ในภาษาที่รองรับมักจะมีความแม่นยำของคำมากกว่า 98% ด้วยเอนจิน LSTM ของ Tesseract ลายมือ ฟอนต์ตกแต่ง เอกสารที่มีความคมชัดต่ำ หรือหน้าที่มีภาษาผสมจะมีความแม่นยำต่ำกว่า
ฉันสามารถทำ OCR กับ PDF ขนาดใหญ่ที่มีหลายหน้าได้หรือไม่?
ได้ เอนจิน OCR ประมวลผลหน้าตามลำดับโดยใช้ Web Worker เบื้องหลัง ดังนั้นอินเทอร์เฟซเบราว์เซอร์ของคุณจึงตอบสนองได้ตลอดเวลา รองรับสูงสุด 100 หน้าต่อไฟล์ สำหรับเอกสารขนาดใหญ่มาก การประมวลผลอาจใช้เวลาสองสามนาที — ตัวบ่งชี้ความคืบหน้าแบบเรียลไทม์จะแสดงว่าหน้าใดกำลังถูกประมวลผล
OCR รักษาเลย์เอาต์เอกสารต้นฉบับไว้หรือไม่?
การส่งออก PDF ที่ค้นหาได้จะรักษาเลย์เอาต์ภาพต้นฉบับไว้อย่างสมบูรณ์แบบ เนื่องจากภาพหน้ายังคงสภาพเดิมและข้อความถูกเขียนเป็นเลเยอร์ทับที่มองไม่เห็น สำหรับการส่งออก TXT, DOCX และ Markdown ข้อความจะถูกแยกออกตามลำดับการอ่าน แต่การจัดรูปแบบภาพ (คอลัมน์ ตาราง) จะถูกประมาณการมากกว่าที่จะทำซ้ำได้อย่างแม่นยำ