AI 기반

모든 PDF나 이미지에서 텍스트 추출

30개 이상의 언어로 OCR. 검색 가능한 PDF, Word DOCX, TXT 또는 Markdown으로 내보내기. 완전히 브라우저 내에서 실행됩니다 — 서버에는 아무것도 업로드되지 않습니다.

드래그하거나 클릭하여 업로드

스캔한 PDF, JPG, PNG, WebP 또는 TIFF

PDF당 최대 100페이지 · 여러 이미지 지원

지원 언어

아랍어 불가리아어 중국어(간체) 중국어(번체) 크로아티아어 체코어 덴마크어 네덜란드어 영어 핀란드어 프랑스어 독일어 그리스어 히브리어 힌디어 헝가리어 인도네시아어 이탈리아어 일본어 한국어 노르웨이어 폴란드어 포르투갈어 루마니아어 러시아어 세르비아어 슬로바키아어 슬로베니아어 스페인어 스웨덴어 태국어 터키어 우크라이나어

내보내기 형식

  • 검색 가능한 PDF(권장) — 원본 레이아웃 보존; 모든 PDF 뷰어에서 텍스트 선택 가능
  • Word 문서(.docx) — Microsoft Word 또는 Google Docs에서 열고 편집
  • 일반 텍스트(.txt) — 깔끔한 텍스트 출력, UTF-8 인코딩
  • Markdown(.md) — 단락별로 그룹화된 구조화된 텍스트

100% 비공개

모든 OCR 처리는 WebAssembly를 사용하여 브라우저 내에서 실행됩니다. 파일은 어떤 서버로도 전송되지 않습니다 — 저희 서버로도 마찬가지입니다. 처리 과정은 자신의 화면에서 문서를 읽는 것만큼이나 비공개입니다.

PDFlexa AI OCR을 사용해야 하는 이유

Tesseract LSTM 엔진

Tesseract의 LSTM 신경망 기반 — 오픈소스 OCR의 업계 표준으로, 깨끗한 문서에서 95–99%의 단어 정확도를 제공합니다.

레이아웃 보존

검색 가능한 PDF 내보내기는 원본 페이지 이미지를 그대로 유지하고 보이지 않는 텍스트 레이어를 추가합니다 — 모든 여백, 열, 시각 요소를 보존합니다.

백그라운드 처리

전용 Web Worker가 백그라운드 스레드에서 OCR을 실행합니다 — 크고 여러 페이지로 구성된 문서를 처리하는 동안에도 브라우저 탭은 완전히 상호작용 가능한 상태를 유지합니다.

33개 언어

아랍어와 중국어부터 우크라이나어와 태국어까지 — 오른쪽에서 왼쪽으로 쓰는 문자 체계를 포함하여 세계 주요 언어를 거의 모두 다룹니다.

4가지 내보내기 형식

검색 가능한 PDF, Word DOCX, 일반 TXT, Markdown — 변환 단계 없이 워크플로에 맞는 형식으로 바로 내보내세요.

데이터 보관 없음

처리 과정이 브라우저를 절대 벗어나지 않으므로 보관하거나 삭제할 파일이 없습니다. 문서는 자신의 책상 위 파일만큼이나 비공개입니다.

스캔한 PDF에서 텍스트를 추출하는 방법

스캔한 PDF나 이미지 업로드

스캔한 PDF, JPG, PNG, WebP 또는 TIFF를 업로드 영역에 드래그 앤 드롭하거나 "파일 선택"을 클릭하여 찾아보세요. 여러 페이지 PDF와 여러 이미지 파일이 지원됩니다.

언어 및 출력 형식 선택

33개의 사용 가능한 옵션 중에서 문서가 작성된 언어를 선택하세요. 그런 다음 원하는 내보내기 형식을 선택하세요 — 최대 호환성을 위해 검색 가능한 PDF를 권장합니다.

"OCR 시작"을 클릭하고 다운로드

OCR 엔진이 백그라운드 워커에서 문서를 처리합니다. 진행률 표시줄에 현재 처리 중인 페이지가 표시됩니다. 완료되면 결과를 즉시 다운로드하세요.

OCR에 대한 자주 묻는 질문

OCR이란 무엇이며 어떻게 작동하나요?

OCR(광학 문자 인식)은 스캔된 문서, 인쇄된 페이지의 사진, 이미지로만 구성된 PDF 등 텍스트 이미지를 기계가 읽을 수 있는 문자로 변환합니다. 엔진은 픽셀 패턴을 분석하여 문자, 숫자, 문장 부호에 매핑합니다. Pdflexa는 세계에서 가장 정확한 오픈소스 OCR 엔진인 Tesseract를 사용하며, 브라우저 내에서 완전히 실행됩니다.

OCR 도구는 어떤 파일 형식을 지원하나요?

스캔된 PDF 파일과 JPEG/JPG, PNG, WebP, TIFF 이미지를 업로드할 수 있습니다. 여러 페이지의 PDF는 페이지별로 처리됩니다(파일당 최대 100페이지). 일괄 업로드를 사용하면 여러 이미지를 한 번에 OCR 처리할 수 있습니다.

OCR 엔진은 몇 개의 언어를 지원하나요?

OCR 엔진은 한국어, 영어, 스페인어, 프랑스어, 독일어, 중국어(간체 및 번체), 일본어, 아랍어, 러시아어, 힌디어 등 33개 언어를 지원합니다. 정확도를 최대화하려면 처리 전에 올바른 문서 언어를 선택하세요.

제 문서가 Pdflexa 서버에 업로드되나요?

아니요. PDF 렌더링, OCR 인식, 출력 생성 등 모든 단계가 WebAssembly와 JavaScript를 사용하여 브라우저 내에서 완전히 실행됩니다. 파일이 기기를 벗어나는 일이 절대 없어 온라인에서 가장 프라이빗한 OCR 도구입니다.

어떤 출력 형식으로 내보낼 수 있나요?

인식된 텍스트를 검색 가능한 PDF(원본 이미지에 보이지 않는 텍스트 레이어가 있어 모든 PDF 뷰어에서 선택 및 복사 가능), 일반 TXT, Microsoft Word DOCX 또는 Markdown으로 내보낼 수 있습니다. 모든 형식은 텍스트의 논리적 읽기 순서를 유지합니다.

텍스트 인식은 얼마나 정확한가요?

정확도는 문서 품질, 해상도, 언어에 따라 달라집니다. 지원되는 언어로 된 300 DPI 이상의 깨끗하고 고해상도 스캔은 Tesseract의 LSTM 엔진으로 일반적으로 98% 이상의 단어 정확도를 달성합니다. 손글씨, 장식체 글꼴, 저대비 문서 또는 언어가 혼합된 페이지는 정확도가 낮아집니다.

페이지가 많은 큰 PDF도 OCR 처리할 수 있나요?

네. OCR 엔진은 백그라운드 Web Worker를 사용하여 페이지를 순차적으로 처리하므로 브라우저 인터페이스가 항상 반응성을 유지합니다. 파일당 최대 100페이지가 지원됩니다. 매우 큰 문서의 경우 처리에 몇 분이 걸릴 수 있습니다 — 실시간 진행률 표시기가 현재 처리 중인 페이지를 보여줍니다.

OCR이 원본 문서 레이아웃을 보존하나요?

검색 가능한 PDF 내보내기는 페이지 이미지가 그대로 유지되고 텍스트가 보이지 않는 오버레이로 작성되기 때문에 원본 시각적 레이아웃을 완벽하게 보존합니다. TXT, DOCX, Markdown 내보내기의 경우 텍스트는 읽기 순서대로 추출되지만 시각적 서식(열, 표)은 정확히 재현되기보다 근사치로 표현됩니다.

관련 도구