متن را از هر PDF یا تصویری استخراج کنید
OCR به بیش از ۳۰ زبان. خروجی بهصورت PDF قابل جستجو، Word DOCX، TXT یا Markdown. کاملاً در مرورگر شما اجرا میشود — چیزی به سرور بارگذاری نمیشود.
بکشید و رها کنید یا برای بارگذاری کلیک کنید
PDF اسکنشده، JPG، PNG، WebP یا TIFF
حداکثر ۱۰۰ صفحه در هر PDF · پشتیبانی از چند تصویر
در حال آمادهسازی…
فایل شما آماده است
زبانهای پشتیبانیشده
قالبهای خروجی
- PDF قابل جستجو (پیشنهادی) — چیدمان اصلی حفظ شده؛ متن در هر نمایشگر PDF قابل انتخاب است
- سند Word (.docx) — در Microsoft Word یا Google Docs باز و ویرایش کنید
- متن ساده (.txt) — خروجی متنی تمیز، با کدگذاری UTF-8
- مارکداون (.md) — متن ساختاریافته گروهبندیشده در پاراگرافها
۱۰۰٪ خصوصی
تمام پردازش OCR با استفاده از WebAssembly در مرورگر شما اجرا میشود. فایلهای شما هرگز به هیچ سروری — حتی سرور ما — ارسال نمیشوند. پردازش بهاندازه خواندن یک سند روی صفحه نمایش خودتان خصوصی است.
چرا OCR هوش مصنوعی PDFlexa؟
موتور Tesseract LSTM
با قدرت شبکه عصبی LSTM از Tesseract — استاندارد صنعتی برای OCR متنباز، با دقت کلمه ۹۵ تا ۹۹٪ روی اسناد تمیز.
حفظ چیدمان
خروجی PDF قابل جستجو تصویر اصلی صفحه را دستنخورده نگه میدارد و یک لایه متن نامرئی اضافه میکند — و هر حاشیه، ستون و عنصر بصری را حفظ میکند.
پردازش در پسزمینه
یک Web Worker اختصاصی، OCR را در یک رشته پسزمینه اجرا میکند — تب مرورگر شما در حین پردازش اسناد بزرگ و چندصفحهای کاملاً تعاملی باقی میماند.
۳۳ زبان
از عربی و چینی گرفته تا اوکراینی و تایلندی — عملاً هر زبان مهم جهان از جمله خطهای راستبهچپ را پوشش میدهد.
۴ فرمت خروجی
PDF قابل جستجو، Word DOCX، TXT ساده و Markdown — مستقیماً به فرمتی که با جریان کاری شما سازگار است خروجی بگیرید، بدون مرحله تبدیل.
بدون نگهداری داده
از آنجا که پردازش هرگز مرورگر شما را ترک نمیکند، هیچ فایلی برای نگهداری یا حذف وجود ندارد. اسناد شما بهاندازه فایلی روی میز خودتان خصوصی هستند.
چگونه متن را از یک PDF اسکنشده استخراج کنیم
فایل PDF یا تصویر اسکنشده خود را بارگذاری کنید
یک PDF، JPG، PNG، WebP یا TIFF اسکنشده را به ناحیه بارگذاری بکشید و رها کنید، یا برای مرور روی «انتخاب فایل» کلیک کنید. فایلهای PDF چندصفحهای و چندین فایل تصویری پشتیبانی میشوند.
زبان و فرمت خروجی را انتخاب کنید
زبانی را که سند به آن نوشته شده از میان ۳۳ گزینه موجود انتخاب کنید. سپس فرمت خروجی مورد نظر خود را انتخاب کنید — PDF قابل جستجو برای حداکثر سازگاری توصیه میشود.
روی «شروع OCR» کلیک کنید و دانلود کنید
موتور OCR سند شما را در یک کارگر پسزمینه پردازش میکند. یک نوار پیشرفت نشان میدهد که کدام صفحه در حال حاضر پردازش میشود. پس از اتمام، نتیجه خود را فوراً دانلود کنید.
سؤالات متداول درباره OCR
OCR چیست و چگونه کار میکند؟
OCR (بازشناسی نوری حروف) تصاویر متن — اسناد اسکنشده، عکسهای صفحات چاپی، یا PDFهای صرفاً تصویری — را به کاراکترهای قابل خواندن توسط ماشین تبدیل میکند. موتور الگوهای پیکسلی را تحلیل کرده و آنها را به حروف، اعداد و علائم نگارشی نگاشت میکند. Pdflexa از Tesseract، دقیقترین موتور OCR متنباز جهان که کاملاً در مرورگر شما اجرا میشود، استفاده میکند.
ابزار OCR چه فرمتهای فایلی را میپذیرد؟
میتوانید فایلهای PDF اسکنشده و همچنین تصاویر JPEG/JPG، PNG، WebP و TIFF را بارگذاری کنید. فایلهای PDF چندصفحهای صفحه به صفحه پردازش میشوند (تا ۱۰۰ صفحه در هر فایل). بارگذاری دستهای به شما امکان میدهد چندین تصویر را همزمان OCR کنید.
موتور OCR چند زبان را پشتیبانی میکند؟
موتور OCR از ۳۳ زبان از جمله فارسی، انگلیسی، اسپانیایی، فرانسوی، آلمانی، چینی (سادهشده و سنتی)، ژاپنی، کرهای، عربی، روسی، هندی و موارد دیگر پشتیبانی میکند. برای به حداکثر رساندن دقت، زبان صحیح سند را قبل از پردازش انتخاب کنید.
آیا سند من به سرورهای Pdflexa بارگذاری میشود؟
خیر. هر مرحله — رندر PDF، بازشناسی OCR و تولید خروجی — کاملاً درون مرورگر شما با استفاده از WebAssembly و JavaScript اجرا میشود. فایلهای شما هرگز دستگاه شما را ترک نمیکنند و این کار آن را به خصوصیترین ابزار OCR آنلاین موجود تبدیل میکند.
چه فرمتهای خروجی میتوانم استخراج کنم؟
میتوانید متن شناساییشده را بهصورت PDF قابل جستجو (تصویر اصلی با لایه متن نامرئی که آن را در هر نمایشگر PDF قابل انتخاب و کپی میکند)، TXT ساده، Word DOCX مایکروسافت یا Markdown استخراج کنید. همه فرمتها ترتیب منطقی خواندن متن را حفظ میکنند.
دقت بازشناسی متن چقدر است؟
دقت به کیفیت سند، وضوح تصویر و زبان بستگی دارد. اسکنهای تمیز و با وضوح بالا (۳۰۰ DPI یا بیشتر) در زبانی پشتیبانیشده معمولاً با موتور LSTM از Tesseract به دقت کلمه بیش از ۹۸٪ میرسند. دستنویس، فونتهای تزئینی، اسناد کمکنتراست یا صفحات با زبانهای مخلوط دقت پایینتری خواهند داشت.
آیا میتوانم روی یک PDF بزرگ با صفحات زیاد OCR انجام دهم؟
بله. موتور OCR صفحات را بهترتیب با استفاده از یک Web Worker پسزمینه پردازش میکند، بنابراین رابط مرورگر شما در تمام مدت پاسخگو باقی میماند. تا ۱۰۰ صفحه در هر فایل پشتیبانی میشود. برای اسناد بسیار بزرگ، پردازش ممکن است چند دقیقه طول بکشد — یک نشانگر پیشرفت بلادرنگ نشان میدهد کدام صفحه در حال پردازش است.
آیا OCR چیدمان اصلی سند را حفظ میکند؟
خروجی PDF قابل جستجو چیدمان بصری اصلی را کاملاً حفظ میکند، زیرا تصویر صفحه دستنخورده باقی میماند و متن بهصورت یک لایه روکش نامرئی نوشته میشود. برای خروجیهای TXT، DOCX و Markdown، متن به ترتیب خواندن استخراج میشود، اما قالببندی بصری (ستونها، جداول) تقریبی است نه دقیقاً بازتولیدشده.