PDFのOCR — スキャンページからテキストを抽出

スキャンや画像のみのPDFを、検索可能で選択可能なテキストに変換します。10言語を認識し、テキストを.txtファイルに抽出するか、非表示のテキストレイヤー付きの検索可能なPDFを作成できます。すべてブラウザ内で実行されます。

主な機能

10以上の言語

英語、中国語(簡体字・繁体字)、日本語、韓国語、スペイン語、フランス語、ドイツ語、ポルトガル語、アラビア語を認識できます。複数を同時に組み合わせることも可能です。

検索可能なPDF

非表示のテキストレイヤー付きのPDFを作成し、スキャンページをどのリーダーでも検索可能・選択可能にします。

テキスト抽出

認識されたテキストをページ区切り付きのプレーンな.txtファイルに抽出し、編集やコピーができる状態にします。

フルコントロール

出力形式、OCR品質、特定のページ範囲を選択できます。文書全体を処理する必要はありません。

100%プライベート

すべての処理はブラウザ内でローカルに行われます。ファイルがサーバーにアップロードされることはありません。

インストール不要・無料

ブラウザがあればどのデバイスでも利用できます。登録不要、透かしなし、完全無料です。

PDFのOCRとは?

OCR(光学文字認識)は、テキストの画像を機械可読なテキストに変換します。スキャンPDFは実質的にページの画像であり、単語を検索、コピー、選択することはできません。このツールは各ページをレンダリングし、ニューラルネットワークOCRエンジンでテキストを認識してから、認識されたテキストをエクスポートするか、非表示のテキストレイヤーとしてPDFに書き戻すことができます。その結果、単語を検索したり、文章を選択してコピーしたり、コンテンツを自動的にインデックス化できる文書が得られます。すべての処理はブラウザ内でローカルに行われるため、文書がデバイスの外に出ることはありません。

PDFをOCRする方法

OCRの実行はわずか数ステップです。すべてブラウザ内で行われます。

1

スキャンPDFをアップロード

スキャンまたは画像のみのPDFをドラッグ&ドロップするか、アップロード領域をクリックして選択します。

2

オプションを選択

言語、出力形式(テキストまたは検索可能なPDF)、品質、任意のページ範囲を選択します。既定値はほとんどの文書でうまく機能します。

3

OCRを開始

「OCRを開始」をクリックします。選択された各ページが自動的にレンダリングおよび認識されます。

4

結果をダウンロード

抽出された.txtファイルまたは検索可能なPDFをダウンロードします。テキスト出力の場合、プレビューに認識されたコンテンツが表示されます。

知っておくと便利

最良の結果を得るには、鮮明で高解像度のスキャンを使用し、正しい言語を選択してください。非常に小さい、ぼやけた、または装飾が強いテキストは、精度が低く認識される場合があります。パスワード保護されたPDFは、OCRの前にロックを解除する必要があります。最初のOCR実行では認識エンジンと言語データが読み込まれるため、数秒かかることがあります。以降の実行は高速です。高品質の設定は精度を向上させますが、処理が遅くなります。アラビア語と一部の文字体系は、その言語のみを選択すると最もよく認識されます。

よくある質問