PDFをWordに変換して編集できる形にする

ウェブ上の「PDFをWordに変換」は、ほぼ同じ仕組みで動きます。文書を見えないサーバーへ送り、そこで変換し、.docx を返すというものです。このサイトはその方式を使いません。代わりに、このサイトにはWordへの変換機能がありません。ここに .docx を作るボタンは置きません。PDFから文字を読み取る処理も、Wordファイルを書く処理も、このサイトには含まれていないからです。以下で説明するのは実際に使える方法と、変換結果が元の文書と完全には一致しないという事実です。

まず、Wordにする必要があるか考える

PDFからWordへの変換は、なぜ崩れるのか

PDFのページは、決まった位置に字形を置いて線を描くという指示の集まりです。Wordは、段落・スタイル・表組みという「流れる」形式です。PDFの中に「ここが見出し」「ここが本文段落」という区別は書かれていないので、変換ソフトは推測するしかありません。その推測が当たり外れするため、できたファイルはあとから直す必要が生じるのが通常です。

PDFの中に何が入っているのかを確かめるため、このサイトのテスト用PDFをこのサイト自身の解析コードで開いてみました。各ページにはフォントが含まれ、文字は読み取れる文字ではなく字形の番号として描画されています(<31> Tj、<42> Tj という命令です)。文字として戻すには、番号に加えてフォントの文字対応表を読む必要があります。このサイトにはその処理がないため、ここに文字取り出しの機能は用意していません。

変換で失われやすいもの:

文字が入っているPDFなら:コピーするか、自分で変換する

一番早く、何もインストールせずに済む方法。今のブラウザーはPDFを自分で開けます。

  1. ChromeやEdgeでPDFを開きます。ファイルはブラウザーの窓にドラッグしても開けます。
  2. Ctrl+A(macOSはCmd+A)で全体を選びます。
  3. Ctrl+Cでコピーし、Word・Pages・テキストエディターに貼り付けます。
  4. Wordに貼るときは、何を残したいかを選びます。テキストのみ保持は装飾をすべて落とします。貼り付けのオプション→HTMLは見出し・太字・簡単な表を残します。元の書式を保持はビューアーの書式を持ち込むので、たいてい一番散らかります。

数ページなら、変換されたファイルを直すより早く済み、元のPDFはそのまま残ります。

書類全体をやる場合:自分のパソコンで動く無料の変換ソフト。手元で動くので、文書は送信されません。

Word自身でPDFを開けます。ファイル→開くでPDFを選ぶと、編集できる文書に組み直されます。Microsoft 365を使っているなら一番手軽ですが、これはクラウドでの変換です。文書はサーバーの側で処理されるので、送信と同じ扱いで考えます。

PDFがスキャンの場合:変換する対象がない

スキャンはページの絵です。文字がファイルの中に書かれていないので、どの変換ソフトも、ブラウザーだけで動くものも、スキャンPDFを編集できるWord文書にはできません。足りない工程は、絵から文字を読むOCR(光学文字認識)です。PDFの文字起こしで、送信せずにこれを行う方法と、終わったあとに確認が必要な理由を説明しています。

このサイトでできること、できないこと

このサイトは、PDFから文字を読むこと、.docxを書くこと、OCRを実行すること、ファイルを外部へ送ることをいずれもできません。全ページでサーバーとの接続を禁止しているため、ページはどのサーバーとも通信しません。変換のまわりにある「ページ側の作業」なら、次ができます。

よくある質問

PDFをWordに無料・送信せずに変換する方法はありますか。

文字がPDFに入っているならあります。自分のブラウザーのPDFビューアーで文字を選んでコピーし、Wordに貼り付けてください。書類全体ならLibreOffice DrawとPopplerのpdftotextが無料で手元で動きます。Wordのファイル→開くでも変換できますが、サーバー側で処理されるので送信と同じ扱いです。

変換後のファイルが元のPDFと見え方が違っているのはなぜですか。

PDFには段落・見出し・表が保存されていないからです。置かれた座標と字形としてしか保存していないので、どこで段落が終わるのか、どの行が見出しなのかを推測しています。埋め込まれていない書体が別の書体に置き換わっただけでも、行の並びは変わります。

Wordに変換した後も文字は選択したり検索したりできますか。

PDFに文字が入っていれば、変換後も文字として残るので選択と検索ができます。重要なのは逆の場合です。スキャンは文字がファイルに無いため、変換すると文字の絵で埋まった文書になり、誰も検索も編集もできません。

スキャンしたPDFを編集できるWord文書にできますか。

そのままではできません。ページが画像なので、まずOCRで文字を認識し、その結果を文書として組み立て直す必要があります。OCRは別の工程であり、変換後に結果を確かめる作業も別に必要です。