OCR(光学文字認識)は、スキャンされたPDF内のテキストの画像を、実際に選択・検索・コピーが可能な文字に変換します。このガイドでは、OCRの仕組み、必要になる場面、そしてブラウザ内で無料で適用する方法を解説します。
スキャンされたPDFにOCRが必要な理由
紙の文書をスキャンすると、スキャナーはページの「画像」を作成します——テキストファイルではありません。スキャンされたPDFは、実質的にはPDFという入れ物に埋め込まれたJPEGやTIFFです。閲覧はできますが、次のことができません。
- テキストを選択・コピーできない
- Ctrl+F(検索)を使っても結果が0件になる
- スクリーンリーダーが読み上げられない(アクセシビリティに欠ける)
- 検索エンジンがその内容をインデックスできない
- フォーム項目への入力やテキストのハイライトができない
OCRはその画像を読み取り、テキストレイヤーを生成します——画像の上に正確に重ねられた、認識済み文字の見えないレイヤーです。OCR後は文書の見た目は全く同じですが、その下には実際に操作可能なテキストが存在するようになります。
オンラインでPDFにOCRを適用する方法(無料)
Reduce your PDF file size instantly. No software needed.
PDFlexa OCRを使う場合:
- PDFlexa OCRにアクセスします
- スキャンされたPDFをアップロードします(ドラッグ&ドロップ、またはファイルを選択をクリック)
- ドロップダウンから文書の言語を選びます(24言語に対応)
- 出力形式を選びます。
- 検索可能なPDF — 見た目はそのままに、見えないテキストレイヤーを追加します
- プレーンテキスト(.txt) — 抽出されたテキストのみで、レイアウトはありません
- OCRを実行をクリックします
- 結果をダウンロードします
処理はTesseract.jsを使ってブラウザ内で行われます。大きなPDF(30ページ以上)の場合、処理に数分かかります。ファイルがサーバーにアップロードされることはありません。
対応言語には次が含まれます: 英語、フランス語、ドイツ語、スペイン語、ポルトガル語、イタリア語、オランダ語、ポーランド語、ロシア語、アラビア語、中国語(簡体字)、日本語、韓国語、ヒンディー語、トルコ語、その他9言語。
OCRが必要になるのはどんな場合か
| 文書の種類 | OCRが必要か |
|---|---|
| 紙の文書をPDFにスキャンしたもの | ✅ はい——画像です |
| スマートフォンで撮影した文書の写真 | ✅ はい |
| Word/Excel/GoogleドキュメントファイルからのPDF | ❌ いいえ——すでにテキストレイヤーがあります |
| ソフトウェアから直接書き出されたPDF(請求書、領収書など) | ❌ いいえ——すでにテキストがあります |
| 古いスキャン済みのアーカイブ文書 | ✅ はい |
| テキストがぼやけている、または乱れているPDF | ⚠️ OCRで改善する可能性があります |
| 入力できないフォームPDF | ✅ OCR+PDF入力ツールが役立ちます |
手早く確認する方法:ページ上のテキストを選択してみましょう。単語をハイライトできれば、そのPDFにはすでにテキストレイヤーがあります。カーソルで(画像の範囲を選ぶときのような)選択ボックスしか作れない場合は、スキャンされた画像であり、OCRが必要です。
OCRの仕組み(内部で行われていること)
Turn any PDF into an editable Word document in seconds.
- ページのレンダリング — PDFの各ページが高解像度(300DPI相当以上)の画像としてレンダリングされます
- 前処理 — 画像の傾き補正、ノイズ除去、グレースケールへの変換が行われます
- テキスト検出 — OCRエンジンが、テキストらしく見える領域(列、行、単語)を特定します
- 文字認識 — 各文字領域が、選択した言語向けに訓練されたモデルと照合されます
- テキストレイヤーの作成 — 認識された文字が、検出された位置に、元の画像の上に配置されます
- PDFの再構築 — 元の画像に見えないテキストレイヤーを加えた新しいPDFが作成されます
OCRの品質は、スキャンの解像度(高いほど良い)、文書の品質(鮮明な印刷か薄れたインクか)、言語の一致、テキストが印刷されたものか手書きかによって左右されます。PDFlexaは、100以上の言語で訓練された、最も広く使われているオープンソースのOCRエンジンであるTesseractを使用しています。
より良いOCR結果を得るコツ
300DPI以上でスキャンする。 一般的な家庭用スキャナーはデフォルトで150DPIに設定されていることが多く、閲覧には十分ですが、OCRの結果は芳しくありません。テキストには300DPI、非常に小さな文字には600DPIを使いましょう。
グレースケールまたは白黒でスキャンする。 カラースキャンはファイルサイズが大きくなり、標準的なテキスト文書ではOCRの品質は向上しません。グレースケールが最適です。
ページが平らでまっすぐであることを確認する。 (製本による)湾曲したページ、傾いたスキャン、スマートフォンのカメラによる影は、いずれも精度を下げます。ほとんどのフラットベッドスキャナーはこれをうまく処理しますが、スマートフォンのカメラによるスキャンは最も問題が起こりやすいです。
正しい言語を選ぶ。 Tesseractは言語ごとに訓練されたモデルを使用します。ドイツ語の文書を英語のOCRで処理すると、ウムラウト(ä、ö、ü)の認識精度が低くなります。必ず言語を正しく合わせましょう。
大文字や印刷されたテキストは、手書き文字よりもOCRの精度が高くなります。 標準的なOCRは印刷されたテキスト向けに設計されています。手書き文字認識は別の(より難しい)課題であり、Tesseractはこれをうまく処理できません。
OCRの精度:期待できる水準
| 文書の品質 | 期待できる精度 |
|---|---|
| きれいな印刷物を300DPIで平らにスキャンしたもの | 文字精度98〜99% |
| 標準的なオフィススキャン(150DPI) | 精度92〜96% |
| インクが薄れた古い文書 | 精度80〜90% |
| 手書きのメモ | 50〜75%(大きくばらつく) |
| 多段組みの学術論文 | 90〜95%(レイアウト検出がより難しい) |
| 非ラテン文字(アラビア語、中国語、韓国語) | 正しい言語を選べば85〜95% |
重要な文書(契約書、法的記録など)については、特に固有名詞、数字、日付に誤りがないか、必ずOCRの出力を確認してください。
OCRとPDFからWordへの変換の違いは何か
| PDFのOCR | PDFからWordへの変換 | |
|---|---|---|
| 出力 | 検索可能なPDF(見た目は同じ)または.txt | 編集可能な.docx |
| 最適な用途 | スキャンを検索可能・アクセス可能にする | Microsoft Word上でコンテンツを編集する |
| レイアウト | オリジナルのレイアウトが完全に保持される | Word変換時にレイアウトがずれることがある |
| 用途 | アーカイブ、検索、アクセシビリティ | コンテンツの再利用と編集 |
スキャンされたコンテンツをWordで編集したい場合は、まずOCRを実行し、その後PDFをWordに変換を使いましょう——OCRによって、変換ツールは空白の画像領域ではなく実際のテキストを扱えるようになります。
よくある質問
OCRを行うとPDFの見た目は変わりますか? いいえ。OCRのテキストレイヤーは見えないものであり、ページの画像の背後に配置されます。PDFはOCRの前後で全く同じ見た目です。唯一の違いは、テキストが選択・検索可能になることです。
OCRは手書き文字を読み取れますか? 標準的なOCRは印刷されたテキスト向けに訓練されており、手書き文字に対しては信頼性がありません。結果は、手書き文字がどれだけ明瞭かつ一貫して書かれているかによって大きく異なります。重要な手書き文書については、手作業での書き起こしの方が信頼性が高いです。
一度にOCRできるページ数はどれくらいですか? PDFlexaのブラウザベースのOCRは、1回のアップロードにつき最大50ページに対応しています。より長い文書については、PDFを複数の部分に分割し、それぞれにOCRをかけた後、結果を結合してください。
OCRに時間がかかるのはなぜですか? 各ページは個別に処理されます——高解像度でレンダリングされ、解析され、認識されます。20ページの文書はブラウザ内で1〜3分かかることがあります。処理はお使いのデバイス上で行われるため、速度はCPUとメモリに依存します。
OCRは無料ですか? はい。PDFlexaのOCRは、オープンソースのTesseract.jsを使い、すべてブラウザ内で無料で動作します。アカウントは不要で、OCRツールに1日あたりの制限もありません。