PDF を Word に:visual モードと text モード、スキャン PDF
PDF をオフラインで .docx に変換します——visual モードは各ページを画像として埋め込みレイアウトを保持し、text モードは編集可能な段落を出力します。テキストレイヤーのないスキャンには Scanned PDF to Word が対応します。
1FileTool は Mac 上で PDF をオフラインで Word に変換します——ファイルがアップロードされることはなく、結果は <name>_converted.docx として出力されます。この用途には3つのツールがあり、レイアウトと編集可能なテキストのどちらを重視するかで選びます。
まず元ファイルを守る
Replace source はデフォルトでオンです。出力が元ファイルを上書きし、バックアップは残りません。手順を始める前に Settings › General を開いて Replace source をオフにするか、別の出力フォルダを選んでください。
3つのツール
- PDF Tools › PDF to Word——visual モード。各ページがページ全体の画像として .docx に埋め込まれるため、Word ファイルは PDF と見た目が同じです。レイアウトが重要なときに最適です。(PDF to Word)
- PDF Tools › Scanned PDF to Word——各ページに OCR を実行し、プレーンな段落を書き出します。PDF がスキャンで編集可能なテキストが必要なときに最適です。(Scanned PDF to Word)
- PDF Tools › Batch PDF to Word——ドロップしたフォルダ全体に visual モードを適用します。(Batch PDF to Word)
各モードの出力
Visual モード——PDF to Word と Batch PDF to Word のデフォルト——は各 PDF ページをレンダリングし、画像として文書に配置します。フォント、表、画像、段組みレイアウトがピクセル単位で残ります。トレードオフは、内部のテキストが画像の一部になるため、Word で編集できないことです。
Text モード——Scanned PDF to Word が使う方式——は実際のテキストを抽出して普通の段落として書き込みます。結果は完全に編集可能ですが、複雑なレイアウトは単純な段落フローに潰れます:複数段のスキャンは1列のテキストになります。
スキャン PDF を変換する
スキャンはページの写真です——コピーできるテキストレイヤーがありません。Scanned PDF to Word は各ページに英語 OCR を実行し、認識した語を段落として書き出します:
- スキャン PDF を Scanned PDF to Word にドロップします。
- 実行します。OCR は通常の変換より目に見えて時間がかかります——各ページをレンダリングして認識する必要があるためです。
<name>_converted.docxを開いて校正します。きれいなスキャンの OCR はかなり正確ですが、手書き、スタンプ、薄い文字は修正が必要です。
Word ファイルではなく文字だけ必要なら、OCR がプレーンな .txt を書き出します。
結果が空で返ってきたら
テキストレイヤーも認識可能な画像内容もない PDF は、Scanned PDF to Word を試すよう促すエラーで失敗することがあります。そのツールでファイルを再実行してください——抽出ではなく OCR を行います。