PDFをWordに変換

ホームに戻る
PDFファイルを追加してください — またはここにドラッグ
PDF

このPDF→Word変換ツールについて

PDFからテキストを取り出し、編集可能な文書として返すツールです。PDF.jsでファイルがすでに持っているテキストオブジェクト、つまりすべての文字とそのページ上の座標を読み取り、垂直座標を比較して行単位にまとめ直します。結果はWord互換の.docファイル、またはプレーンな.txtとして書き出されます。

期待値は正確に定めておくべきです。「PDFをWordに」という言葉は、どの変換ツールにも果たせない約束をするからです。PDFは各グリフがページのどこに置かれるかを記述するだけで、あるテキストのまとまりが見出しだったのか、箇条書きだったのか、表のセルだったのか、2段組みだったのかは記録しません。その構造を復元するのは推測であり、このツールは推測しません。得られるのは読む順に段落へ整理されたテキストです。忠実な複製ではなく、書き直すための清潔な出発点です。

テキストの抽出も文書の組み立てもブラウザ内で行われます。ファイルを渡す必要のある変換サービスと違い、アップロードがありません。

PDFを編集可能な文書に変換する手順

  1. PDFを読み込みます。 ドロップ領域へドラッグしてください。実際のテキストレイヤーが必要です。スキャンの場合は下をご覧ください。
  2. 出力を選びます。 Word文書はWord、Googleドキュメント、LibreOfficeのいずれでも開ける.docを作ります。プレーンテキストは書式のまったくない.txtを作ります。
  3. 変換します。 各ページのテキストが順に読み取られ、行と段落にまとめられます。
  4. ダウンロードして整えます。 開いてみると見出し、箇条書き、表はやり直しが必要です。単語とその順序は正確です。

引き継がれるものと引き継がれないもの

要素結果
本文テキスト読む順に正確に抽出
段落の区切り行の位置から復元
ページ区切り保持
見出し・スタイル失われる。すべて本文になる
テキストの行として平坦化
画像・グラフ含まれない
段組みファイル内部の順で読まれ入り混じることがある

PDFがスキャンの場合

スキャン文書にはテキストオブジェクトではなくページの写真が入っています。このツールが抽出するものがないため、テキストが見つからないと表示されます。文字を視覚的に認識してテキストファイルを作るOCRツールをお使いください。

どちらであるかはどのPDFビューアーでも判別できます。文をマウスで選択してみてください。カーソルが現れて単語がハイライトされるなら、この変換ツールが機能します。ページ全体に矩形の選択しか出ないならスキャンです。

よくある質問

変換された文書がPDFとまるで違って見えるのはなぜですか。

PDFが文書構造ではなくグリフの位置を保存しているためです。何が見出しで何が表で何が箇条書きだったかという記録がないため、どの変換ツールも確実には復元できません。このツールはテキストを忠実に抽出し、書式は利用者に委ねます。

PDFから何も抽出されませんでした。なぜですか。

ほぼ確実にスキャンです。テキストレイヤーがなくページの画像だけが入ったファイルです。文字を視覚的に認識するOCRツールをお使いください。

表は保持されますか。

いいえ。PDFにおける表のセルは位置指定されたテキストにすぎないため、通常の行として出力されます。複雑な表はたいてい作り直しが必要です。

.docと.txtの出力の違いは何ですか。

.docは段落とページ区切りを保ち、Word、Googleドキュメント、LibreOfficeで開けます。.txtは構造のまったくない純粋なテキストで、他のソフトへ取り込む際に有用です。

PDFの画像も含まれますか。

いいえ。テキストレイヤーだけが抽出されます。ページを絵として得たい場合はPDF→JPG変換をお使いください。

文書はアップロードされますか。

いいえ。PDF.jsがブラウザ内でテキストを読み、出力ファイルもローカルで組み立てられてからダウンロードされます。

関連ツール