OCR(광학 문자 인식)은 스캔한 PDF 안의 텍스트 이미지를 실제로 선택하고, 검색하고, 복사할 수 있는 문자로 변환합니다. 이 가이드는 OCR이 어떻게 작동하는지, 언제 필요한지, 브라우저에서 무료로 적용하는 방법을 설명합니다.
스캔한 PDF에 왜 OCR이 필요한가요?
종이 문서를 스캔하면 스캐너는 페이지의 그림을 만듭니다 — 텍스트 파일이 아닙니다. 스캔한 PDF는 본질적으로 PDF 컨테이너 안에 삽입된 JPEG나 TIFF입니다. 볼 수는 있지만:
- 텍스트를 선택하거나 복사할 수 없습니다
- Ctrl+F(찾기)를 사용해도 결과가 0개입니다
- 화면 읽기 프로그램이 읽을 수 없습니다(접근성 없음)
- 검색 엔진이 콘텐츠를 색인화할 수 없습니다
- 양식 필드를 채우거나 텍스트를 강조 표시할 수 없습니다
OCR은 그 이미지를 읽어 텍스트 레이어 — 이미지 위에 정확히 겹쳐진 인식된 문자의 보이지 않는 레이어 — 를 생성합니다. OCR 후 문서는 동일하게 보이지만, 이제 상호작용할 수 있는 실제 텍스트가 그 밑에 있습니다.
PDF에 온라인으로 OCR을 적용하는 방법 (무료)
Reduce your PDF file size instantly. No software needed.
PDFlexa OCR 사용하기:
- PDFlexa OCR 페이지로 이동
- 스캔한 PDF 업로드(드래그 앤 드롭 또는 파일 선택 클릭)
- 드롭다운에서 문서의 언어 선택(24개 언어 지원)
- 출력 형식 선택:
- 검색 가능한 PDF — 원본 모양을 유지하고 보이지 않는 텍스트 레이어를 추가
- 일반 텍스트(.txt) — 추출된 텍스트만, 레이아웃 없음
- OCR 실행 클릭
- 결과 다운로드
이 처리는 Tesseract.js를 사용해 브라우저 안에서 실행됩니다. 큰 PDF(30페이지 이상)는 처리에 몇 분 걸립니다. 파일이 서버에 업로드되는 일은 없습니다.
지원되는 언어: 영어, 프랑스어, 독일어, 스페인어, 포르투갈어, 이탈리아어, 네덜란드어, 폴란드어, 러시아어, 아랍어, 중국어(간체), 일본어, 한국어, 힌디어, 터키어 외 9개.
OCR이 필요한 경우
| 문서 유형 | OCR 필요 여부? |
|---|---|
| 종이 문서를 PDF로 스캔 | ✅ 필요 — 이미지임 |
| 휴대폰으로 촬영한 문서 사진 | ✅ 필요 |
| Word/Excel/Google 문서에서 만든 PDF | ❌ 불필요 — 이미 텍스트 레이어 있음 |
| 소프트웨어에서 직접 내보낸 PDF (송장, 영수증) | ❌ 불필요 — 이미 텍스트 있음 |
| 오래된 스캔 보관 문서 | ✅ 필요 |
| 텍스트가 흐릿하거나 깨진 PDF | ⚠️ OCR로 개선될 수 있음 |
| 입력할 수 없는 양식 PDF | ✅ OCR + PDF 채우기가 도움이 됨 |
빠른 확인 방법: 페이지의 텍스트를 선택해보세요. 단어를 강조 표시할 수 있다면 PDF에 이미 텍스트 레이어가 있는 것입니다. 커서가 특정 영역 주위에만 선택 상자를 만든다면(이미지 영역을 선택하듯) 스캔된 이미지이며 OCR이 필요합니다.
OCR 작동 원리 (내부적으로)
Turn any PDF into an editable Word document in seconds.
- 페이지 렌더링 — PDF의 각 페이지가 고해상도(300+ DPI 상당)로 이미지로 렌더링됨
- 전처리 — 이미지의 기울기를 보정하고, 노이즈를 제거하고, 그레이스케일로 변환
- 텍스트 감지 — OCR 엔진이 텍스트처럼 보이는 영역(열, 줄, 단어)을 식별
- 문자 인식 — 각 문자 영역을 선택한 언어의 학습된 모델과 대조
- 텍스트 레이어 생성 — 인식된 문자가 감지된 위치에 배치됨
- PDF 재구성 — 원본 이미지와 보이지 않는 텍스트 레이어를 결합한 새 PDF 생성
OCR 품질은 스캔 해상도(높을수록 좋음), 문서 품질(선명한 인쇄 vs. 흐릿한 잉크), 언어 일치 여부, 텍스트가 인쇄된 것인지 손글씨인지에 따라 달라집니다. PDFlexa는 Tesseract를 사용합니다 — 100개 이상의 언어로 학습된 가장 널리 사용되는 오픈소스 OCR 엔진입니다.
더 나은 OCR 결과를 위한 팁
300 DPI 이상으로 스캔하세요. 대부분의 가정용 스캐너는 기본값이 150 DPI인데, 보기에는 충분하지만 OCR 결과는 좋지 않습니다. 텍스트에는 300 DPI, 매우 작은 글씨에는 600 DPI를 사용하세요.
그레이스케일 또는 흑백으로 스캔하세요. 컬러 스캔은 파일이 더 크고 일반 텍스트 문서의 OCR 품질을 향상시키지 않습니다. 그레이스케일이 가장 적절합니다.
페이지가 평평하고 곧게 펴져 있도록 하세요. 책 제본으로 인한 휜 페이지, 기울어진 스캔, 휴대폰 카메라의 그림자는 모두 정확도를 떨어뜨립니다. 대부분의 플랫베드 스캐너는 이를 잘 처리합니다; 휴대폰 카메라 스캔이 가장 문제가 됩니다.
올바른 언어를 선택하세요. Tesseract는 언어별로 학습된 모델을 사용합니다. 독일어 문서를 영어 OCR로 처리하면 움라우트(ä, ö, ü)에서 결과가 좋지 않습니다. 항상 언어를 일치시키세요.
큰 대문자와 인쇄된 텍스트가 손글씨보다 OCR이 더 잘 됩니다. 표준 OCR은 인쇄된 텍스트를 위해 설계되었습니다. 손글씨 인식은 Tesseract가 잘 처리하지 못하는 별개의(더 어려운) 문제입니다.
OCR 정확도: 기대치
| 문서 품질 | 예상 정확도 |
|---|---|
| 깨끗하고, 인쇄되고, 300 DPI로 평평하게 스캔 | 98~99% 문자 정확도 |
| 표준 사무실 스캔 (150 DPI) | 92~96% 정확도 |
| 잉크가 바랜 오래된 문서 | 80~90% 정확도 |
| 손글씨 메모 | 50~75% (편차 큼) |
| 여러 단으로 된 학술 논문 | 90~95% (레이아웃 감지가 더 어려움) |
| 비라틴 문자(아랍어, 중국어, 한국어) | 올바른 언어 설정 시 85~95% |
중요한 문서(계약서, 법률 기록)의 경우 항상 OCR 결과를 검토해 오류를 확인하세요 — 특히 고유명사, 숫자, 날짜.
OCR vs. PDF를 Word로: 차이점은 무엇인가요?
| OCR PDF | PDF를 Word로 | |
|---|---|---|
| 출력 | 검색 가능한 PDF(동일한 모양) 또는 .txt | 편집 가능한 .docx |
| 가장 적합한 경우 | 스캔본을 검색 가능/접근 가능하게 만들기 | Microsoft Word에서 콘텐츠 편집하기 |
| 레이아웃 | 원본 레이아웃이 완벽하게 유지됨 | Word 변환에서 레이아웃이 바뀔 수 있음 |
| 사용 사례 | 보관, 검색, 접근성 | 콘텐츠 재사용 및 편집 |
스캔된 콘텐츠를 Word에서 편집하고 싶다면 먼저 OCR을 실행한 후 PDF를 Word로를 사용하세요 — OCR은 변환기에게 빈 이미지 영역이 아니라 실제 텍스트를 제공합니다.
자주 묻는 질문
OCR이 PDF의 모양을 바꾸나요? 아니요. OCR 텍스트 레이어는 보이지 않습니다 — 페이지 이미지 뒤에 위치합니다. PDF는 OCR 전후 동일하게 보입니다. 유일한 차이는 이제 텍스트를 선택하고 검색할 수 있다는 점입니다.
OCR이 손글씨를 읽을 수 있나요? 표준 OCR은 인쇄된 텍스트로 학습되었으며 손글씨에는 신뢰성이 낮습니다. 손글씨가 얼마나 명확하고 일관되게 쓰였는지에 따라 결과가 크게 달라집니다. 중요한 손글씨 문서라면 수동 필사가 더 신뢰할 수 있습니다.
한 번에 몇 페이지까지 OCR할 수 있나요? PDFlexa의 브라우저 기반 OCR은 업로드당 최대 50페이지를 지원합니다. 더 긴 문서는 PDF를 나눠서 각 부분을 OCR한 후 결과를 병합하세요.
OCR이 왜 시간이 오래 걸리나요? 각 페이지가 개별적으로 처리됩니다: 고해상도로 렌더링, 분석, 인식. 20페이지 문서는 브라우저에서 1~3분 걸릴 수 있습니다. 처리가 기기에서 실행되므로 속도는 CPU와 메모리에 따라 달라집니다.
OCR은 무료인가요? 네. PDFlexa OCR은 오픈소스 Tesseract.js를 사용해 브라우저 안에서 완전히 무료로 실행됩니다. 계정도 필요 없고 OCR 도구에 일일 제한도 없습니다.
정기적으로 종이 기록을 디지털화하시나요? 관련 워크플로우는 회계사를 위한 PDF 도구 또는 연구자를 위한 PDF 도구를 참고하세요.