مدعوم بالذكاء الاصطناعي

استخرج النص من أي ملف PDF أو صورة

OCR بأكثر من 30 لغة. صدّر كملف PDF قابل للبحث، أو Word DOCX، أو TXT، أو Markdown. يعمل بالكامل في متصفحك — لا يُرفع أي شيء إلى خادم.

اسحب وأسقط أو انقر للتحميل

PDF ممسوح، JPG، PNG، WebP أو TIFF

بحد أقصى 100 صفحة لكل PDF · دعم صور متعددة

اللغات المدعومة

العربية البلغارية الصينية (المبسطة) الصينية (التقليدية) الكرواتية التشيكية الدنماركية الهولندية الإنجليزية الفنلندية الفرنسية الألمانية اليونانية العبرية الهندية المجرية الإندونيسية الإيطالية اليابانية الكورية النرويجية البولندية البرتغالية الرومانية الروسية الصربية السلوفاكية السلوفينية الإسبانية السويدية التايلاندية التركية الأوكرانية

صيغ التصدير

  • PDF قابل للبحث (موصى به) — الحفاظ على التخطيط الأصلي؛ النص قابل للتحديد في أي عارض PDF
  • مستند Word (.docx) — افتح وحرّر في Microsoft Word أو Google Docs
  • نص عادي (.txt) — نص خرج نظيف، بترميز UTF-8
  • Markdown (.md) — نص منظم مجمّع في فقرات

خصوصية 100%

تعمل جميع عمليات معالجة OCR داخل متصفحك باستخدام WebAssembly. لا تُرسَل ملفاتك أبدًا إلى أي خادم — ولا حتى خوادمنا. المعالجة خاصة مثل قراءة مستند على شاشتك الخاصة.

لماذا OCR الذكاء الاصطناعي من PDFlexa؟

محرك Tesseract LSTM

مدعوم بشبكة Tesseract العصبية LSTM — المعيار الصناعي لتقنية OCR مفتوحة المصدر، بدقة كلمات تتراوح بين 95–99% على المستندات الواضحة.

الحفاظ على التخطيط

يحافظ تصدير ملف PDF القابل للبحث على صورة الصفحة الأصلية سليمة ويضيف طبقة نص غير مرئية — مما يحافظ على كل هامش وعمود وعنصر مرئي.

المعالجة في الخلفية

يُشغّل Web Worker مخصص عملية OCR في خيط خلفي — تبقى علامة تبويب متصفحك تفاعلية بالكامل أثناء معالجة المستندات الكبيرة متعددة الصفحات.

33 لغة

من العربية والصينية إلى الأوكرانية والتايلاندية — يغطي عمليًا كل لغة رئيسية في العالم، بما في ذلك الكتابات من اليمين إلى اليسار.

4 صيغ للتصدير

PDF قابل للبحث، وWord DOCX، وTXT عادي، وMarkdown — صدّر مباشرة إلى الصيغة التي تناسب سير عملك، دون خطوة تحويل.

صفر احتفاظ بالبيانات

بما أن المعالجة لا تغادر متصفحك أبدًا، لا توجد ملفات للاحتفاظ بها أو حذفها. مستنداتك خاصة مثل ملف على مكتبك الخاص.

كيفية استخراج النص من ملف PDF ممسوح ضوئيًا

ارفع ملف PDF أو الصورة الممسوحة ضوئيًا

اسحب وأفلت ملف PDF أو JPG أو PNG أو WebP أو TIFF ممسوحًا ضوئيًا في منطقة الرفع، أو انقر على "اختر ملفًا" للتصفح. تُدعم ملفات PDF متعددة الصفحات وملفات الصور المتعددة.

اختر اللغة وصيغة الإخراج

اختر اللغة التي كُتب بها المستند من بين 33 خيارًا متاحًا. ثم اختر صيغة التصدير المفضلة لديك — يُنصح باستخدام PDF قابل للبحث لأقصى توافق.

انقر على "بدء OCR" ثم قم بالتنزيل

يعالج محرك OCR مستندك في وحدة عمل خلفية. يُظهر شريط التقدم الصفحة التي تتم معالجتها حاليًا. عند الانتهاء، نزّل نتيجتك فورًا.

الأسئلة الشائعة حول OCR

ما هو OCR وكيف يعمل؟

يحوّل OCR (التعرف الضوئي على الحروف) صور النص — المستندات الممسوحة ضوئيًا، أو صور الصفحات المطبوعة، أو ملفات PDF التي تحتوي على صور فقط — إلى أحرف قابلة للقراءة آليًا. يحلل المحرك أنماط البكسل ويطابقها مع الحروف والأرقام وعلامات الترقيم. تستخدم Pdflexa Tesseract، وهو أدق محرك OCR مفتوح المصدر في العالم، ويعمل بالكامل في متصفحك.

ما صيغ الملفات التي تقبلها أداة OCR؟

يمكنك رفع ملفات PDF ممسوحة ضوئيًا بالإضافة إلى صور JPEG/JPG وPNG وWebP وTIFF. تُعالَج ملفات PDF متعددة الصفحات صفحة بصفحة (حتى 100 صفحة لكل ملف). يتيح لك الرفع الدفعي إجراء OCR على عدة صور في وقت واحد.

كم عدد اللغات التي يدعمها محرك OCR؟

يدعم محرك OCR 33 لغة، بما في ذلك العربية والإنجليزية والإسبانية والفرنسية والألمانية والصينية (المبسطة والتقليدية) واليابانية والكورية والروسية والهندية والمزيد. اختر لغة المستند الصحيحة قبل المعالجة لتحقيق أقصى دقة.

هل يُرفَع مستندي إلى خوادم Pdflexa؟

لا. تعمل كل خطوة — عرض ملف PDF، والتعرف عبر OCR، وإنشاء المخرجات — بالكامل داخل متصفحك باستخدام WebAssembly وJavaScript. لا تغادر ملفاتك جهازك أبدًا، مما يجعل هذه الأداة أكثر أدوات OCR خصوصية المتاحة عبر الإنترنت.

ما صيغ الإخراج التي يمكنني تصديرها؟

يمكنك تصدير النص المتعرَّف عليه كملف PDF قابل للبحث (الصورة الأصلية مع طبقة نص غير مرئية، مما يجعله قابلًا للتحديد والنسخ في أي عارض PDF)، أو نص عادي TXT، أو Word DOCX من Microsoft، أو Markdown. تحافظ جميع الصيغ على ترتيب القراءة المنطقي للنص.

ما مدى دقة التعرف على النص؟

تعتمد الدقة على جودة المستند والدقة والوضوح واللغة. عادةً ما تحقق المسحات الضوئية الواضحة عالية الدقة (300 نقطة بالبوصة أو أعلى) بلغة مدعومة دقة كلمات تتجاوز 98% باستخدام محرك LSTM من Tesseract. سيكون للخط اليدوي والخطوط الزخرفية والمستندات منخفضة التباين أو الصفحات ذات اللغات المختلطة دقة أقل.

هل يمكنني إجراء OCR على ملف PDF كبير يحتوي على صفحات كثيرة؟

نعم. يعالج محرك OCR الصفحات بالتسلسل باستخدام Web Worker في الخلفية، بحيث تبقى واجهة متصفحك سريعة الاستجابة طوال الوقت. يُدعم حتى 100 صفحة لكل ملف. بالنسبة للمستندات الكبيرة جدًا، قد تستغرق المعالجة بضع دقائق — يُظهر مؤشر تقدم في الوقت الفعلي الصفحة التي تتم معالجتها.

هل يحافظ OCR على تخطيط المستند الأصلي؟

يحافظ تصدير PDF القابل للبحث على التخطيط المرئي الأصلي بشكل مثالي، لأن صورة الصفحة تبقى سليمة ويُكتب النص كطبقة تراكب غير مرئية. بالنسبة لتصديرات TXT وDOCX وMarkdown، يُستخرج النص بترتيب القراءة، لكن التنسيق المرئي (الأعمدة، الجداول) يُقارَب وليس معادًا إنتاجه بدقة.

أدوات ذات صلة