theonehub.app

FILES — ファイル・画像・PDF

PDFの文字を選べないときに確認すること

PDFの文字を選べないときに確認することのアイキャッチ

文字が見えているPDFでも、その文字が画像として保存されている場合があります。ただし「選べない」理由は画像化だけではないので、操作モードと文書の制限から確認します。

この記事の目次

選択ツールを確認する

画像範囲の選択や手のひらツールではなく、文字を選択するモードかを確認します。Macのプレビューではテキスト選択の設定と、コピーを制限する暗号化の情報が確認対象になります。制限された文書は、提供者に必要な利用方法を相談します。

画像として保存されたページを見分ける

紙をスキャンしたページには、見える画像と検索用の文字情報が別に存在することがあります。文字のない画像だけなら、対応するOCR機能で認識する必要があります。ページによって画像と文字が混在するPDFもあります。

認識結果を原本と比べる

OCRを使ったら、氏名、金額、日付、記号を確認します。「0とO」「1とl」のような違いに加え、段組みの読む順番にも注意します。正しい文章に見えても数字だけ誤る場合があるため、重要部分は照合します。

用途に合わせて保存する

検索が目的なら検索可能なPDF、表計算が目的なら列の構造を確認したデータなど、次の作業に合う出力を選びます。原本と認識結果を残し、OCRで得た文字を原本の保証された転記として扱わないようにします。

文字選択と文書の状態を確認し、OCR後は原本と照合する
文字選択と文書の状態を確認し、OCR後は原本と照合する
画像を選ぶと拡大できます。
  1. 文字選択モードや、文書に設定された制限を確認します。
  2. 画像だけのページには、対応するOCR機能で文字情報を付けます。
  3. 認識した文字、数字、読む順番を原本と比べます。

見えている文字と検索に使う文字は同じとは限らない

紙を撮った画像には、文字の形がピクセルとして記録されています。OCRは、その形を読み取って文字として扱える情報を作る処理です。画像の見た目が残っている一方で、裏側の検索用テキストだけが誤っていることもあるため、画面が元の紙と似ているだけでは認識の正しさを判断できません。

たとえば画面に「100」と見えていても、コピーした結果に英字が混ざることがあります。検索で見つからない原因が、原本に言葉がないことではなく、認識された文字の違いである可能性もあります。確認するときは、見た目、選択、コピー、検索を分けて試します。

選択できないPDFすべてにOCRをかける必要もありません。選択ツールの違いや文書の制限が原因なら、それぞれに合った対応をします。利用が制限された資料は、制限を取り除く手段を探す前に、提供者へ利用目的を確認してください。

作業例:スキャンした資料を後から検索する

過去の資料を案件名で検索したい場面を考えます。元PDFを残し、検索用コピーへOCRを実行します。認識する言語を選べる場合は、文書の言語に合わせます。画像の傾きや切れで文字自体を読めないなら、認識設定を変える前に撮影やスキャンを見直します。

処理後は案件名だけでなく、本文からいくつか言葉を選んで検索します。目的のページが見つかったら、その言葉をコピーしてテキストとして確認します。案件名がよく似た別の文字になっていると、今後同じ言葉で検索しても見つけにくくなります。

Adobe Acrobatには、認識が不確かな語を確認・修正するための案内があります。修正機能を使う場合も、元の画像と照合するのは利用者の作業です。自動的に提案された候補を、原本を見ずにまとめて正解としないでください。

表を再利用するときは列の意味まで見る

OCRの文字を表計算へ移すときは、一文字ずつの正誤に加えて、どの値がどの見出しに属するかを確認します。列がずれると、数字自体は合っていても別の商品の価格として扱ってしまうことがあります。

確認対象見比べる内容
名前・識別番号似た文字、先頭のゼロ、記号
金額・数量桁、小数点、マイナス、単位
表の構造見出しと値、行の対応、途中の折り返し
段組みの本文左右の段を読む順序、注記の混入

検索用として十分な結果と、集計に使える結果は同じではありません。重要な数字を使って判断する作業では、原本と照合する範囲を先に決め、確認済みの部分が分かるように記録します。

参考リンク