PDFをOCRして検索可能にする方法
スキャンしたPDFをOCRで検索可能にする手順を解説。文書の言語を選択すると、テキストレイヤーはブラウザ内でローカルに追加され、ファイルはサーバーに送信されません。
テキストを認識スキャンしたPDFは文字を撮影した画像です。見た目は読めても、検索ボックス、コピー&ペースト、テキスト抽出のどれにとってもページは空のままです。OCR(光学文字認識)は文字を認識し、スキャンの上に見えないテキストレイヤーを追加してこれを解決します。このガイドではAmiPDFのOCR PDFツールを使った方法を説明します。認識はすべてブラウザ内で実行され、ファイルが端末から出ることはありません。これは契約書、医療記録、ID書類を扱ううえで重要です。文書の言語を1つ以上選ぶと、ツールが各ページを認識し、出力は同じPDFのまま、検索とコピーが可能になります。
OCRを実行する手順
OCRツールを開いてスキャンを追加する
AmiPDFのOCR PDFツールを開き、スキャンしたPDFをアップロード領域にドロップします。ツールのページ上限までのスキャン文書を受け付けます。長い書籍のスキャンは、先にPDF分割で部分ごとに切ってから処理してください。

文書の言語を選択する
文書に含まれるすべての言語を、1回の実行上限まで選択します。テキストが実際に混在している場合は2~3言語を選ぶと認識精度が上がります。文書に含まれない言語を追加しても実行が遅くなるだけです。エンジンと言語パックは初回のみダウンロードされ、その後はキャッシュされます。

認識を実行する
開始をクリックし、ページごとの進行状況を確認します。認識はWebAssemblyを使って端末上で行われます。10ページのスキャンなら、マシンの性能にもよりますが通常は数分です。実行が完了するまでタブを開いたままにしてください。出力はツールが自動的にまとめます。

検索可能なPDFをダウンロードする
結果を保存します。見た目は同じ文書で、その下に見えないテキストレイヤーが追加されています。検索はどのPDFリーダーでも機能し、コピー&ペーストで実際のテキストが得られます。後からPDF to Markdownで内容を取り出すこともできます。ボタンから、認識された生テキストを.txtファイルとしてすばやく確認することもできます。

良い結果を得るために
きれいなスキャンほどよく認識される
傾きがなく、照明が均一な300 DPIのページが最適です。傾いたスマートフォンの写真は端の精度が落ちます。スマートフォンのカメラで撮影した場合は、先に傾きを補正してトリミングしてください。PDFのトリミングツールは、認識を妨げる黒い枠を除去できます。
テキストプレビューを確認する
OCRは統計的な処理であり、特に珍しいフォントや低コントラストでは100%の精度は保証されません。抽出テキスト表示でいくつかの段落を抜き取り確認してから検索に頼り、出力が文字化けしている場合は言語を調整して再実行してください。
テキストベースのPDFではOCRを省く
文書に既にテキストレイヤーがあるとツールが知らせた場合、OCRは不要です。PDF to Wordのような抽出ツールが直接機能し、数秒で完了します。
よくある質問
ファイルは本当にどこにもアップロードされないのですか?
そのとおりです。認識はWebAssemblyによってブラウザ内で実行されます。通信はOCRエンジンと言語パックの初回ダウンロードのみで、以降はキャッシュされます。
言語はいくつまで選べますか?
ページに表示される1回の実行上限までです。言語は自由に組み合わせられ、たとえば1つのバイリンガル契約書で英語と中国語を選べますが、文書にない言語は選ばないでください。実行が遅くなるだけです。
OCRでスキャンの見た目は変わりますか?
いいえ。ページは元の外観を保ちます。認識されたテキストはスキャンの下に配置される見えないレイヤーとして追加されます。同じ文書のまま、検索とコピーが機能するようになります。