スキャンを OCR でテキスト化(英語)
オフライン OCR でスキャンした PDF からテキストを抽出します。認識は英語のみで、出力は検索可能な PDF ではなくプレーンな .txt ファイルです。手書きや低解像度スキャンに期待できる精度の範囲を正確に説明します。英語 OCR の境界と、結果が不十分な場合の代替手段を正直に説明します。
1FileTool の OCR ツールは、スキャン PDF を Mac 上でプレーンテキストファイルに変換します——アップロードなし、クラウド OCR サービスなし。認識するのは英語テキストのみで、検索可能な PDF ではなく .txt ファイルを書き出します。
まず元ファイルを守る
Replace source はデフォルトでオンです。出力が元ファイルを上書きし、バックアップは残りません。手順を始める前に Settings › General を開いて Replace source をオフにするか、別の出力フォルダを選んでください。
スキャンに OCR を実行する
- PDF Tools › OCR を開きます(ツールページ)。
- スキャン PDF をドロップします。
- 実行します。各ページは 300 DPI でレンダリングされてから認識されるので、長いスキャンは時間がかかります——進捗はページ単位です。
- 出力先にある
<name>_ocr.txtを確認します。ページは--- Page Break ---の行で区切られています。
得られるもの(と得られないもの)
- 出力はプレーンな
.txt——単語と改行だけで、レイアウトもフォントもありません。2段組みのスキャンはそのまま読み通されます。 - 認識は英語のみ。他言語のページは文字化けするか空になります。
- コントラストが適度なきれいで平らなスキャンはよく認識されます。手書き、スタンプ、傾いた写真、薄い感熱紙の文字は手作業での修正が必要です。
- OCR は検索可能な PDF を生成しません——テキストを抽出するだけです。Word で編集可能な段落がほしい場合は Scanned PDF to Word を使います。
テキストを別の形式でほしい場合
- Scanned PDF to Word は同じ OCR を実行し、プレーンな段落の
.docxを書き出します——PDF を Word にを参照。 - PDF Tools › Extract Text はデジタル PDF の埋め込みテキストレイヤーをコピーします——即座に完了しますが、スキャンにはテキストレイヤーがないため何も見つかりません。
関連ページ
- PDF を Word に:visual モードと text モード
- PDF の保護と墨消し——Detect PII がファイルをスキャンだと報告したら先に OCR を
- ローカル OCR とプライバシー
- ファイルがアップロードされない理由
- PDF を圧縮する
使用するツール