PDFをテキストに変換

PDFのテキストをすべてTXTファイルに取り出し、検索・編集・再利用できるようにします。

PDFからテキストを抽出 — レイアウトのない中身だけ

必要なのは言葉だけ、ということがあります。契約書の一節を引用したい、報告書をスクリプトに読み込ませたい、長大な文書から数字を1つ探したい、マニュアルの内容を別のシステムへ移したい——そんなときPDFの丁寧な組版はただの邪魔です。プレーンテキストへ抽出すれば、段組みもヘッダーも書式もない中身が、どんなソフトでも読めるファイルとして手に入ります。

PDFをアップロードすると、テキストが抽出されてTXTファイルに書き出され、すぐダウンロードできます。プレーンテキストには書式がないため、結果は元の文書に比べて極めて小さく、メモ帳、TextEdit、どのコードエディタ、どのスクリプトでも瞬時に開きます。検索、索引作成、他のアプリへのコピー、自動処理への投入に最適です。

重要な制限がひとつあります。このツールはPDFの中に保存されたテキスト層を読むため、Word、Excel、ブラウザ、レイアウトソフトから書き出された文書で機能します。紙をスキャンして作られたPDFには文字ではなくページの写真が入っているので、取り出すテキスト層がなく結果は空になります。その場合は文字認識が必要です。書式付きで取り戻したいときは「PDFをWordに」をお使いください。サービスは無料で、処理後にファイルを削除します。

よくある質問

PDFからテキストを抽出するには?

このページで文書をアップロードし、できあがったTXTファイルをダウンロードします。抽出はたいてい数秒で終わります。

出力ファイルが空なのはなぜですか?

そのPDFはほぼ間違いなくスキャンです。スキャンしたページはテキストではなくテキストの画像なので、文字認識なしでは取り出すものがありません。

書式は保たれますか?

いいえ、意図的にそうしています。プレーンテキストに書式はありません。フォントも段組みもスタイルもなく、読む順序どおりの言葉が得られます。レイアウトが必要なら「PDFをWordに」をお使いください。

表はどうなりますか?

表の中身はテキストとして抽出されますが、枠そのものはプレーンテキストでは表現できません。使える表が必要ならWordに変換してください。

文字コードは何ですか?

テキストはUTF-8で書き出されます。あらゆる文字体系に対応する標準の文字コードなので、日本語も非ラテン文字も正しく出力されます。

このツールは無料ですか?

はい。無料で、登録も1日の上限もなく、抽出が終わり次第PDFはサーバーから削除されます。