מבוסס AI

חלצו טקסט מכל קובץ PDF או תמונה

OCR ביותר מ-30 שפות. ייצוא כ-PDF ניתן לחיפוש, Word DOCX, TXT או Markdown. פועל לחלוטין בדפדפן שלכם — שום דבר לא מועלה לשרת.

גרור ושחרר או לחץ להעלאה

PDF סרוק, JPG, PNG, WebP או TIFF

מקסימום 100 עמודים לכל PDF · תמיכה במספר תמונות

שפות נתמכות

ערבית בולגרית סינית (מפושטת) סינית (מסורתית) קרואטית צ'כית דנית הולנדית אנגלית פינית צרפתית גרמנית יוונית עברית הינדי הונגרית אינדונזית איטלקית יפנית קוריאנית נורווגית פולנית פורטוגזית רומנית רוסית סרבית סלובקית סלובנית ספרדית שוודית תאית טורקית אוקראינית

פורמטי ייצוא

  • PDF עם חיפוש (מומלץ) — פריסה מקורית נשמרת; הטקסט ניתן לבחירה בכל מציג PDF
  • מסמך Word (.docx) — פתחו וערכו ב-Microsoft Word או Google Docs
  • טקסט רגיל (.txt) — פלט טקסט נקי, מקודד UTF-8
  • Markdown (.md) — טקסט מובנה מקובץ לפי פסקאות

פרטיות של 100%

כל עיבוד ה-OCR פועל בתוך הדפדפן שלכם באמצעות WebAssembly. הקבצים שלכם לעולם אינם נשלחים לשום שרת — אפילו לא שלנו. העיבוד פרטי כמו קריאת מסמך על המסך שלכם עצמכם.

למה ה-OCR מבוסס הבינה המלאכותית של PDFlexa?

מנוע Tesseract LSTM

מופעל על ידי הרשת העצבית LSTM של Tesseract — תקן התעשייה עבור OCR בקוד פתוח, עם דיוק מילים של 95–99% במסמכים נקיים.

פריסה נשמרת

ייצוא ה-PDF הניתן לחיפוש שומר על תמונת העמוד המקורית ללא פגע ומוסיף שכבת טקסט בלתי נראית — שומר על כל שוליים, עמודה ואלמנט חזותי.

עיבוד ברקע

Web Worker ייעודי מריץ OCR בחוט רקע — לשונית הדפדפן שלכם נשארת אינטראקטיבית לחלוטין בזמן עיבוד מסמכים גדולים ורבי-עמודים.

33 שפות

מערבית וסינית ועד אוקראינית ותאית — מכסה כמעט כל שפה עולמית עיקרית, כולל כתבים מימין לשמאל.

4 פורמטים לייצוא

PDF ניתן לחיפוש, Word DOCX, טקסט TXT פשוט ו-Markdown — ייצוא ישירות לפורמט המתאים לתהליך העבודה שלכם, ללא שלב המרה.

אפס שמירת נתונים

מכיוון שהעיבוד לעולם לא עוזב את הדפדפן שלכם, אין קבצים לשמור או למחוק. המסמכים שלכם פרטיים כמו קובץ על השולחן שלכם עצמכם.

איך לחלץ טקסט מקובץ PDF סרוק

העלו את קובץ ה-PDF או התמונה הסרוקים שלכם

גררו ושחררו קובץ PDF סרוק, JPG, PNG, WebP או TIFF לאזור ההעלאה, או לחצו על "בחר קובץ" לעיון. קבצי PDF רבי-עמודים ומספר קבצי תמונה נתמכים.

בחרו שפה ופורמט פלט

בחרו את השפה שבה נכתב המסמך מתוך 33 אפשרויות זמינות. לאחר מכן בחרו את פורמט הייצוא המועדף עליכם — מומלץ PDF ניתן לחיפוש להתאמה מרבית.

לחצו על "התחל OCR" והורידו

מנוע ה-OCR מעבד את המסמך שלכם ב-worker ברקע. סרגל התקדמות מציג איזה עמוד מעובד כרגע. כשהתהליך יסתיים, הורידו את התוצאה שלכם באופן מיידי.

שאלות נפוצות על OCR

מהו OCR וכיצד הוא פועל?

OCR (זיהוי תווים אופטי) הופך תמונות של טקסט — מסמכים סרוקים, תצלומים של עמודים מודפסים, או קבצי PDF המכילים תמונות בלבד — לתווים הניתנים לקריאה על ידי מחשב. המנוע מנתח דפוסי פיקסלים וממפה אותם לאותיות, מספרים וסימני פיסוק. Pdflexa משתמשת ב-Tesseract, מנוע ה-OCR בקוד פתוח המדויק ביותר בעולם, הפועל כולו בדפדפן שלכם.

אילו פורמטי קבצים כלי ה-OCR מקבל?

תוכלו להעלות קבצי PDF סרוקים וכן תמונות JPEG/JPG, PNG, WebP ו-TIFF. קבצי PDF רבי-עמודים מעובדים עמוד אחר עמוד (עד 100 עמודים לקובץ). העלאה קבוצתית מאפשרת לכם לבצע OCR על מספר תמונות בבת אחת.

כמה שפות מנוע ה-OCR תומך?

מנוע ה-OCR תומך ב-33 שפות, כולל עברית, אנגלית, ספרדית, צרפתית, גרמנית, סינית (מפושטת ומסורתית), יפנית, קוריאנית, ערבית, רוסית, הינדי ועוד. בחרו את שפת המסמך הנכונה לפני העיבוד כדי למקסם את הדיוק.

האם המסמך שלי מועלה לשרתים של Pdflexa?

לא. כל שלב — עיבוד ה-PDF, זיהוי ה-OCR ויצירת הפלט — פועל כולו בתוך הדפדפן שלכם באמצעות WebAssembly ו-JavaScript. הקבצים שלכם לעולם לא עוזבים את המכשיר שלכם, מה שהופך את זה לכלי ה-OCR הפרטי ביותר הזמין באינטרנט.

אילו פורמטי פלט אני יכול לייצא?

תוכלו לייצא את הטקסט המזוהה כ-PDF ניתן לחיפוש (תמונה מקורית עם שכבת טקסט בלתי נראית, ההופכת אותו לניתן לבחירה ולהעתקה בכל מציג PDF), TXT פשוט, Word DOCX של Microsoft, או Markdown. כל הפורמטים שומרים על סדר הקריאה הלוגי של הטקסט.

עד כמה מדויק זיהוי הטקסט?

הדיוק תלוי באיכות המסמך, ברזולוציה ובשפה. סריקות נקיות ברזולוציה גבוהה (300 DPI ומעלה) בשפה נתמכת משיגות בדרך כלל דיוק מילים של מעל 98% עם מנוע ה-LSTM של Tesseract. כתב יד, גופנים דקורטיביים, מסמכים בעלי ניגודיות נמוכה או עמודים בשפות מעורבות יהיו בעלי דיוק נמוך יותר.

האם אני יכול לבצע OCR על קובץ PDF גדול עם עמודים רבים?

כן. מנוע ה-OCR מעבד עמודים ברצף באמצעות Web Worker ברקע, כך שממשק הדפדפן שלכם נשאר רספונסיבי לאורך כל הדרך. עד 100 עמודים לקובץ נתמכים. עבור מסמכים גדולים מאוד, העיבוד עשוי לקחת מספר דקות — מחוון התקדמות בזמן אמת מציג איזה עמוד מעובד.

האם ה-OCR שומר על פריסת המסמך המקורית?

ייצוא ה-PDF הניתן לחיפוש שומר בצורה מושלמת על הפריסה החזותית המקורית, מכיוון שתמונת העמוד נשארת שלמה והטקסט נכתב כשכבת-על בלתי נראית. עבור ייצוא ל-TXT, DOCX ו-Markdown, הטקסט מחולץ בסדר הקריאה, אך העיצוב החזותי (עמודות, טבלאות) מקורב ולא משוחזר במדויק.

כלים קשורים