PDFをWordに変換して編集できる形にする
ウェブ上の「PDFをWordに変換」は、ほぼ同じ仕組みで動きます。文書を見えないサーバーへ送り、そこで変換し、.docx を返すというものです。このサイトはその方式を使いません。代わりに、このサイトにはWordへの変換機能がありません。ここに .docx を作るボタンは置きません。PDFから文字を読み取る処理も、Wordファイルを書く処理も、このサイトには含まれていないからです。以下で説明するのは実際に使える方法と、変換結果が元の文書と完全には一致しないという事実です。
まず、Wordにする必要があるか考える
- その中の1〜2ページだけ必要なら、PDFのページ抽出で必要なページだけを取り出し、PDFの分割なら1ページずつに分けられます。文字が選択できるままの、小さいPDFになります。
- サイズが大きすぎて送れないなら、PDF圧縮で中身を小さくします。重さはほぼ写真に集中しています。
- 編集ではなく読むだけなら、PDFのままで構いません。ブラウザーとスマートフォンで開けて、どの端末でも同じに見えるという利点がある一方で、変換したファイルはその利点を失いやすいものです。
PDFからWordへの変換は、なぜ崩れるのか
PDFのページは、決まった位置に字形を置いて線を描くという指示の集まりです。Wordは、段落・スタイル・表組みという「流れる」形式です。PDFの中に「ここが見出し」「ここが本文段落」という区別は書かれていないので、変換ソフトは推測するしかありません。その推測が当たり外れするため、できたファイルはあとから直す必要が生じるのが通常です。
PDFの中に何が入っているのかを確かめるため、このサイトのテスト用PDFをこのサイト自身の解析コードで開いてみました。各ページにはフォントが含まれ、文字は読み取れる文字ではなく字形の番号として描画されています(<31> Tj、<42> Tj という命令です)。文字として戻すには、番号に加えてフォントの文字対応表を読む必要があります。このサイトにはその処理がないため、ここに文字取り出しの機能は用意していません。
変換で失われやすいもの:
- 行の並びと段組みの位置。PDFの文字は置かれた場所に留まりますが、Wordでは文章の幅に合わせて並びが変わります。
- 書体。PDFに埋め込まれていない書体は持って帰れません。別の書体に差し替わると、行の並びが変わります。
- スタイル。文字を大きくしただけでは見出しかどうかは分かりません。そのため見出しは、たいてい少し大きいだけの本文として取り込まれます。
- 表と罫線。PDFの表は線と文字の置き場所の集まりです。セルを復元するには推測が必要です。
- ヘッダー・フッター・ページ番号・フォーム項目。消えるか、通常の文字として貼られます。
- リンクとしおり。残るときもあり、失われるときもあります。
文字が入っているPDFなら:コピーするか、自分で変換する
一番早く、何もインストールせずに済む方法。今のブラウザーはPDFを自分で開けます。
- ChromeやEdgeでPDFを開きます。ファイルはブラウザーの窓にドラッグしても開けます。
Ctrl+A(macOSはCmd+A)で全体を選びます。Ctrl+Cでコピーし、Word・Pages・テキストエディターに貼り付けます。- Wordに貼るときは、何を残したいかを選びます。テキストのみ保持は装飾をすべて落とします。貼り付けのオプション→HTMLは見出し・太字・簡単な表を残します。元の書式を保持はビューアーの書式を持ち込むので、たいてい一番散らかります。
数ページなら、変換されたファイルを直すより早く済み、元のPDFはそのまま残ります。
書類全体をやる場合:自分のパソコンで動く無料の変換ソフト。手元で動くので、文書は送信されません。
- LibreOffice Draw(無料、Windows・macOS・Linux)はPDFを開け、ファイル → 書き出し → Word 2007-365 (.docx)で保存できます。無料でオフラインで動きますが、あとから整える前提で使うのが現実的です。PDFは図形の集まりとして取り込まれるため、レイアウトは近似で戻ります。
- Popplerの
pdftotextは文字をファイルに書き出します。pdftotext -layout report.pdf report.txtを、エディターで開いてWordに貼り付けます。-layoutは段組みの位置を保つので表や帳票に向きます。-f 3 -l 6ならページ範囲も指定できます。
Word自身でPDFを開けます。ファイル→開くでPDFを選ぶと、編集できる文書に組み直されます。Microsoft 365を使っているなら一番手軽ですが、これはクラウドでの変換です。文書はサーバーの側で処理されるので、送信と同じ扱いで考えます。
PDFがスキャンの場合:変換する対象がない
スキャンはページの絵です。文字がファイルの中に書かれていないので、どの変換ソフトも、ブラウザーだけで動くものも、スキャンPDFを編集できるWord文書にはできません。足りない工程は、絵から文字を読むOCR(光学文字認識)です。PDFの文字起こしで、送信せずにこれを行う方法と、終わったあとに確認が必要な理由を説明しています。
このサイトでできること、できないこと
このサイトは、PDFから文字を読むこと、.docxを書くこと、OCRを実行すること、ファイルを外部へ送ることをいずれもできません。全ページでサーバーとの接続を禁止しているため、ページはどのサーバーとも通信しません。変換のまわりにある「ページ側の作業」なら、次ができます。
- ファイルを小さくするならPDFのページ抽出とPDFの分割。
- 送るには重すぎるならPDF圧縮。
- 文字に触れずにできる修正ならPDFにページ番号を付けるとPDFの結合。
- 編集用ではなくページを何枚か見たいだけならPDFをJPGに変換。
よくある質問
PDFをWordに無料・送信せずに変換する方法はありますか。
文字がPDFに入っているならあります。自分のブラウザーのPDFビューアーで文字を選んでコピーし、Wordに貼り付けてください。書類全体ならLibreOffice DrawとPopplerのpdftotextが無料で手元で動きます。Wordのファイル→開くでも変換できますが、サーバー側で処理されるので送信と同じ扱いです。
変換後のファイルが元のPDFと見え方が違っているのはなぜですか。
PDFには段落・見出し・表が保存されていないからです。置かれた座標と字形としてしか保存していないので、どこで段落が終わるのか、どの行が見出しなのかを推測しています。埋め込まれていない書体が別の書体に置き換わっただけでも、行の並びは変わります。
Wordに変換した後も文字は選択したり検索したりできますか。
PDFに文字が入っていれば、変換後も文字として残るので選択と検索ができます。重要なのは逆の場合です。スキャンは文字がファイルに無いため、変換すると文字の絵で埋まった文書になり、誰も検索も編集もできません。
スキャンしたPDFを編集できるWord文書にできますか。
そのままではできません。ページが画像なので、まずOCRで文字を認識し、その結果を文書として組み立て直す必要があります。OCRは別の工程であり、変換後に結果を確かめる作業も別に必要です。