📄 PDF テキスト抽出
PDF をドラッグ&ドロップするとページ別にテキストを抽出。コピーまたは .txt としてダウンロード可能。すべてブラウザ内で処理されます。
完全無料
登録不要
ブラウザ完結
5 言語対応
ダークモード
🔒 プライバシーについて
- ・すべての処理はあなたのブラウザ内で完結します
- ・PDF データは一切サーバーに送信されません
- ・保存ログ・アップロード履歴・データベース等は存在しません
- ・登録・ログイン・課金は一切不要です
⚠ スキャンされた画像ベースの PDF からはテキストを抽出できません (OCR が必要です)。テキストレイヤーを持つ PDF にのみ対応します。
📂
PDF をドラッグ&ドロップ、またはクリックで選択
📖 つまずきやすいポイント
pdf.js を使って PDF に埋め込まれたテキストレイヤーをページ別に取り出します。処理はブラウザ内で完結し、ファイルは送信されません。取り出せるのは「文字として書き込まれた情報」だけで、段落・表・見出しといった構造は PDF 側に存在しません — PDF は文字を座標に置いた描画命令の集まりであって、文書構造を持つ形式ではないからです。
| ケース | 何が起きるか | どうする |
|---|---|---|
| 抽出したテキストの並び順がおかしい | PDF の中身は「この位置にこの文字を描け」という命令の列で、読む順序は保証されていません。2 段組の論文なら左段と右段が交互に混ざり、表なら罫線が消えてセルの中身だけが横一列に並びます。ヘッダーやページ番号も本文の途中に割り込みます。これは抽出の失敗ではなく、PDF に順序情報が無いことの結果です。 | まず「レイアウト保持」をオンにしてください — Y 座標が近い文字をまとめて 1 行として復元するので、段組でも行単位までは正しく並びます。そのうえで段組は目視で切り分けます。表を扱いたい場合はテキスト抽出ではなく表抽出のアプローチに切り替えてください (Tabula・Camelot・pdftotext -layout など)。列がずれるのは幅の推定に失敗しているだけなので、等幅で出力してから列位置で切ると復元できることがあります。 |
| 文字化けする・コピーすると別の文字になる | PDF はフォントに埋め込まれたグリフ番号で文字を描きます。その番号を Unicode に戻すための対応表 (ToUnicode CMap) が埋め込まれていないと、抽出側は正しい文字を復元できません。作成ツールがサブセット埋め込みをしたときに欠けやすく、画面では正常に読めるのにコピーすると意味の無い文字列になるのが典型的な症状です。旧い日本語 PDF や、DTP ソフトから書き出した PDF でよく起きます。 |
抽出側では直せません。作り直せるなら、フォントを埋め込み直して書き出すのが唯一の根本策です。手元にあるのが完成した PDF だけなら、そのページを画像として書き出して OCR にかけるのが実務上いちばん速いです (OCR ツール)。文字化けの有無は抽出結果を数行だけ目で読めば即座に判別できます — 全ページを処理してから気付くと時間を無駄にするので、必ず先頭ページで確認してください。 |
| 抽出結果が 0 文字になる | 紙をスキャンした PDF や、スマートフォンで撮影して PDF 化したものはページ全体が 1 枚の画像で、テキストレイヤーがそもそも存在しません。文字が見えているので気付きにくいのですが、ファイルの中身は写真と同じです。官公庁の配布資料、契約書のスキャン、古い紙資料の電子化などはほぼこれに当たります。 | OCR に回してください — OCR ツールは Tesseract で日本語と英語を認識し、同じくブラウザに依存しない形で処理します。判別は簡単で、ページ数のわりに抽出文字数が極端に少ない (1 ページあたり数文字以下) ならスキャン PDF です。混在型 — テキストページとスキャンページが 1 つのファイルに同居しているもの — もよくあるので、ページ別の文字数表示を見て、0 文字のページだけ OCR に回すと無駄がありません。 |
抽出できたことと、使ってよいことは別です。PDF には「内容の抽出を禁止」という権限フラグを立てられますが、このフラグはビューアの自主的な運用であって、技術的な保護ではありません — pdf.js を含む多くの実装は無視します。フラグが立っていないから自由に使える、という判断はできません。本文の再配布や翻案の可否は、あくまで元の資料の著作権と利用条件で決まります。なお、このページの処理はすべてブラウザ内で完結するので、社外秘の PDF を読み込んでもファイルは外に出ません。ただし抽出したテキストを別のサービスに貼り付けた時点で、その保証は無くなります。
📖 使い方
-
1
PDF を読み込むPDF をドラッグ&ドロップ、またはクリックして選択。pdf.js が自動でテキストを抽出します。
-
2
オプションを調整レイアウト保持・ページ番号付与をチェックボックスで切り替え。再描画されます。
-
3
コピーまたはダウンロード全テキストをクリップボードにコピー、または .txt ファイルとしてダウンロード。
❓ よくある質問
スキャンされた PDF からテキストを抽出できますか?
画像のみで構成された PDF は OCR が必要なため抽出できません。テキストレイヤーがある PDF にのみ対応します。
PDF はサーバーに送信されますか?
いいえ。pdf.js がブラウザ内でテキストを抽出します。ファイルはネットワーク経由で送信されません。
レイアウト保持と非保持の違いは?
保持を有効にすると改行や空白を維持します。無効の場合は段落として連結された読みやすいテキストになります。
🔗 関連ツール
🐛 このツールで問題が発生しましたか?
完全無料・登録不要。再現手順だけでも結構です。届いたご報告は運営者に直接届き、修正の参考にします。
✅
ご報告ありがとうございます!
運営者に届きました。改善の参考にさせていただきます。