Text being extracted from a PDF into a Word documentDOCX

PDF Word 変換 — アップロードせずに編集可能なテキストを抽出

PDF からテキストを取り出し、編集できる .docx にします。すべてブラウザ内で動作します。元のレイアウトは再現しません。その点は、ダウンロード前に明示します。

🔒 100% ブラウザ内📝 テキスト抽出🔍 スキャン検出 登録不要
🔒

PDF は一度もアップロードされません

解析も .docx の書き出しも、すべてブラウザ内で行われます。削除すべきサーバー上のコピーは存在せず、保管期間を信用する必要もありません。

🔍

スキャンファイルは事前に検出

スキャンには OCR なしで抽出できるテキストがありません。置いた時点でチェックしてお知らせします。説明のない空の Word ファイルをお渡しすることはありません。

👁️

ダウンロード前に確認できる

私たちが調べた他のどの PDF Word 変換ツールとも違い、プレビューで実際に復元された内容と、読み取りではなく推定で得られた見出し・リストの数を確認できます。

📄

プレーンテキストモード

構造の推定は外れることがあります。ワンクリックで推定を完全にオフにし、誤って見出しに昇格されたもののない、素直に流れるテキストを得られます。

PDF Word 変換が見かけより難しい理由

Word から PDF への変換は描画の問題です。記述されたレイアウトを受け取り、描けばよい。PDF から Word はその逆ですが、逆方向は対称ではありません。逆向きの変換は再構築の問題であり、再構築は描画よりはるかに難しいのです。

PDF が保存するのは字形であって文章ではない

PDF ファイルには段落も見出しも記録されていません。記録されているのは、特定の座標に個々の文字を描けという命令です。PDF を Word に変換するとは、位置データから構造を逆算するということです。

Word ファイルは「これは『四半期報告』というテキストを含む見出し 1 である」と言います。PDF は「フォント F2 を 22 ポイントで設定し、x=72 y=782 に移動し、四-半-期の字形を表示せよ」と言います。ファイルのどこにも見出しである印はありません。周囲より大きいという事実から推測するしかないのです。

段落を逆算しなければならない理由

テキストは座標付きの断片として届き、単語の途中で分割されていることも、単語間のスペースが丸ごと欠けていることも珍しくありません。読める文章を復元するには、垂直位置で断片を行にまとめ、水平の隙間が示唆する箇所にスペースを挿入し、そのうえで、どの改行が折り返しで、どれが段落の境界かを判定する必要があります。

これらの工程はすべてヒューリスティックです。本ツールのものは文書化されテストされていますが、それでも推測は推測です。だからこのページは、出力のどの部分が推測なのかを明示し、すべてを事実であるかのように提示しません。

スキャン文書という問題

スキャンされた PDF に入っているのはテキストの画像であって、テキストではありません。OCR なしには、どれだけ解析しても文字は復元できません。

これはあらゆる PDF Word 変換ツールにおける、最もよくある失望の原因です。多くの人が「このツールは動かない」と結論づける理由でもあります。同僚がスキャンした契約書を入れたら、何も入っていない Word ファイルが返ってくる——たいてい何の説明もなしに。

OCR とは何か、なぜ本ツールにないのか

光学文字認識(OCR)は画像を見て、どの形がどの文字かを判定します。テキストレイヤーを読むのとはまったく別の技術で、比較的低速であり、ブラウザ版を作るには認識モデルを訪問者全員に配信する必要があります。

そこで本ツールは次善の策をとります。状況を検出し、ファイルを置いた直後の最初の画面ではっきりお伝えするのです。検出処理は、スキャンページが完全には空でないことも考慮しています。スキャナーはページ番号を印字し、部分的な OCR は残骸を残すため、ごく少数の文字しかないページはテキストではなくスキャンとして扱います。

この PDF Word 変換ツールが実際にすること

これはテキスト抽出ツールであって、レイアウト変換ツールではありません。PDF の文字を、編集可能な Word ファイルとして復元します。元のページデザインは再現しません。

テキスト抽出とレイアウト変換の違い

「PDF を Word に」と言うとき、人が意味するものは実は 2 種類あります。レイアウト変換は文書を再構築しようとします。表は表として、段組みは段組みとして、画像は元の位置に。それには商用エンジンか大がかりなサーバー側の仕組みが必要で、優れた実装はすべてサーバー側です。

テキスト抽出が取り出すのは、文字、読み順、そして確信を持って推定できる範囲の基本構造です。条項の引用、段落の再利用、レポートからの数値の取り出しといった多くの実務では、それで用が足ります。

向いている人 — 向いていない人

向いているのは、PDF の中のテキストを編集・引用・再利用したい方、そして文書を見知らぬサーバーにアップロードしたくない方です。

向いていないのは、Word ファイルが PDF と同じ見た目である必要がある場合、表の多い文書の場合、そしてスキャンの場合です。これらのケースと、代わりに使うべきものは、このページの後半で説明しています。

PDF からテキストを抽出する 3 ステップ

1

PDF を置く

上のボックスに PDF をドラッグするか、クリックして選択します。ディスクから直接ブラウザに読み込まれ、アップロードがないため、大きな文書でも回線を待たずにすぐ処理が始まります。

2

抽出プレビューを確認する

ファイルが読み込まれた瞬間に、実際に復元された内容、推定された見出しとリスト項目の数、スキャンや段組みらしきページの有無が表示されます。これは意図的にダウンロードより前です。うまくいくはずのなかったファイルに時間を使わず、その場で判断できます。

3

DOCX をダウンロード

Word、Google ドキュメント、LibreOffice、Pages で開ける標準の Word ファイルを書き出します。推定された見出しがおかしければ、プレーンテキストモードをオンにしてもう一度書き出してください。一瞬で終わり、すべての解釈をスキップします。

PDF Word 抽出で得られるもの — 得られないもの

あらゆる PDF Word 変換ツールが、どこかにこの線を引いています。ただ、その線がどこにあるかを見せないだけです。

確実に抽出されるもの

本文テキスト。1 段組みの文書における読み順。埋め込みフォント名から判定される太字と斜体。ハイパーリンクの表示テキスト。

一般的なレポート、書簡、記事なら、これで内容の実質すべてです。

推定されるもの — ときに間違うもの

見出しレベル、段落の境界、箇条書きと番号付きリスト。これらはファイルから読み取るのではなく座標から導くもので、まさにその理由から、プレビューでは「推定」としてラベル付けしています。

フォントサイズから見出しレベルを推測する仕組み

文書内で最も出現頻度の高い文字サイズを本文サイズとみなし、それより十分大きいものを昇格させます。1.6 倍以上は見出し 1、1.35 倍は見出し 2、1.15 倍は見出し 3 です。

平均ではなく最頻値を使うのは意図的です。平均は大きなタイトルに引きずられて上がり、そうなると当のタイトルが見出しとして認識されなくなります。基準値は文書全体で計算するため、大きな文字だけで組まれた表紙が、以降のページの判定を歪めることもありません。

サイズではなく太さや色で見出しを表す文書では、見出しは検出されません。これは実在する制限であり、プレーンテキストモードはそのためにあります。

非対応のもの

表は表としてではなく、ばらけたテキストとして出力されます。画像は引き継がれません。ヘッダー、フッター、ページ番号は、置かれていた位置の通常テキストとして抽出されます。正確なレイアウト、配置、フォント、サイズは一切再現されません。

表、画像、スキャンページ

段組みのページは、黙って交互に混ぜるのではなく、検出してフラグを立てます。段をまたぐ読み順は本当に曖昧だからです。2 段組みの学術論文は、段ごとに縦へ読むことも、ページを横へ読むこともでき、ファイルにはどちらか書かれていません。

スキャンページからは何も得られません。その旨は、書き出す前に報告されます。

抽出能力の一覧

項目状態備考
本文テキスト確実テキストレイヤーから復元
読み順(1 段組み)確実行の位置でクラスタリング
太字と斜体確実埋め込みフォント名から判定
ハイパーリンクのテキスト確実表示テキストのみ、リンク先は対象外
見出しレベル推定相対フォントサイズから。誤る場合あり
段落の境界推定行間の垂直方向の隙間から
箇条書きと番号付きリスト推定行頭記号とインデントから
段組みの読み順推定検出してフラグ。並べ替えはしない
非対応ばらけたテキストとして出力
画像非対応Word ファイルには含まれない
ヘッダーとフッター非対応通常のテキストとして現れる
ページレイアウトとフォント非対応再現されない
スキャンページ非対応OCR が必要。検出して報告

PDF Word 抽出でできること

PDF Word 抽出の現実的な用途には共通の形があります。ほしいのは文字であって、デザインではない、ということです。

契約書やレポートからの引用

PDF から条項を手で打ち直せば、まさに誤りが許されない種類の文書で転記ミスを招きます。抽出なら文言を一字一句そのまま取り出せます。そして契約書なら、ファイルが一度も手元を離れていないという事実は、決して些細なことではありません。

研究論文のテキストの再利用

学術 PDF はこのツールの典型的な用途であり、同時にその限界の典型例でもあります。テキストはきれいに取り出せますが、2 段組みの論文にはフラグが立ちます。読み順が本当に曖昧だからです。抽出したうえで、手作業で並べ替えてください。

請求書からのデータの取り出し

請求書の明細は表の中にあり、グリッドではなくばらけたテキストとして出力されます。それでも打ち直すよりは速く、数字は印字どおり正確に取り出せます。

古い文書の再活用

古い PDF のパンフレットやマニュアルを編集可能な原稿に戻す作業は、たいてい文字が目的で、デザインは目的ではありません。デザインはどのみち作り直すのが普通だからです。

ここでプライバシーが重要な理由

人が最も抽出したがる文書——契約書、医療機関からの書簡、財務諸表——は、最もアップロードすべきでない文書でもあります。ローカル処理は、この問いに答えるのではなく、問いそのものを消し去ります。

サーバー型の変換ツールを使うべき場合

必要なもの使うべきもの理由
表を表のまま保持Adobe、Smallpdf、または Word 本体レイアウトの再構築が必要
PDF と同じ見た目の Word ファイル商用の変換ツール本ツールはレイアウトを再現しない
スキャン文書からのテキストOCR ツール読み取るテキストレイヤーが存在しない
画像の引き継ぎ商用の変換ツール本ツールでは抽出しない
文字だけを、プライベートに本ツール何もアップロードされない
テキストの編集と再引用本ツールテキストと基本構造で十分

PDF Word 変換のあとに:編集・再変換・共有

PDF Word 変換が最後の工程になることはまれです。テキストが Word に入り、編集を終えたら、PDF へ戻すのが自然な次の一手です。当サイトの Word PDF 変換ツールも完全にブラウザ内で動作するため、往復のどこにもサーバーは登場しません。

元の素材が複数の PDF に分かれているなら、先に結合して一度で抽出するほうが、何度も抽出して Word 上で結果をつなぎ合わせるより効率的です。

ここにあるものはすべて同じ原則で動いています。ファイルはお使いのマシンに留まります。同種のツールは無料 PDF ツールのページに、画像ツールはすべての無料ブラウザツールにまとめてあります。

Why PDF to Word conversion has to reverse-engineer structureA Word file records that a block of text is a heading followed by a paragraph. A PDF records only that individual characters are drawn at particular coordinates, so paragraphs and headings must be inferred from position and size.What a Word file storesHeading 1"Quarterly Report"Paragraph"Revenue grew across every""segment during the period."List item"North region led growth"Structure is recordedNothing has to be guessedWhat a PDF storesTf /F2 22Td 72 782 · Tj "Quarterly"Td 196 782 · Tj "Report"Tf /F1 11Td 72 742 · Tj "Revenue grew"Td 178 742 · Tj "across every"Td 72 726 · Tj "segment during"Td 86 690 · Tj "•"Td 98 690 · Tj "North region led"Only glyphs and coordinatesParagraphs must be inferred
Word ファイルは「これは見出しである」と記録します。PDF が記録するのは「この座標に文字を描いた」ということだけ。構造を推測しなければならないのはそのためです。

3 ステップ、アカウント不要・アップロード不要

Step one: drop a PDF onto the page.pdf
1

PDF を置くだけ。ブラウザ内でローカルに読み込まれます。

Step two: compare the original page with what was extractedOriginalExtracted
2

ダウンロードを決める前に、実際に何が復元されたかを確認できます。

Step three: download the editable Word documentDOCX
3

どこでも編集できる標準の .docx を書き出します。

この抽出ツールが復元するもの、推測するもの、できないもの

多くの変換ツールは、出力が元と一致するかのような説明をします。本ツールは一致しません。それを取り繕っても、あなたの時間を無駄にするだけです。実際の内訳はこちらです。

What this extractor recovers, guesses, and cannot doReliably extracted: body text, reading order in single-column documents, bold and italic, and hyperlink text. Inferred and possibly wrong: heading levels, paragraph boundaries, lists, and multi-column reading order. Not supported: tables as tables, images, headers and footers, and scanned pages, which need OCR.Reliably extractedBody textReading order (single column)Bold and italicHyperlink textInferred — may be wrong?Heading levels?Paragraph boundaries?Bulleted and numbered lists?Multi-column orderNot supportedTables as tablesImagesHeaders and footersScanned pages (no OCR)
A text-layer PDF versus a scanned PDFA text-layer PDF contains selectable characters and can be extracted. A scanned PDF contains only a photograph of text, so without OCR there is nothing to extract.Text-layer PDFCharacters are selectableExtractableText, order,bold and italicScanned PDFJust a picture of textNeeds OCRWe detect thisand tell you
スキャンされた PDF に入っているのはテキストの画像であって、テキストではありません。空の文書をお渡しする代わりに、置いた時点で検出してお知らせします。

PDF Word 変換 — よくある質問

はい、上限もありません。抽出はお使いのハードウェア上で実行されるため、転嫁すべきファイルごとの費用が発生しません。1 日あたりの制限も、ウォーターマークも、有料プランもありません。

いいえ。PDF はブラウザのメモリに読み込まれ、.docx もそこで生成されます。開発者ツールを開き、抽出中にネットワークタブを見てください。何も送信されていません。

スキャンに入っているのはテキストの画像であってテキストではなく、読み取るには OCR が必要だからです。このブラウザ内ツールに OCR はありません。ファイルを置いた時点でスキャンを検出し、書き出す前にお知らせするので、原因が分からないまま悩むことはありません。そうした文書には OCR ツールをお使いください。

なりません。ダウンロード後に気づかせるより、先にはっきり申し上げます。ここでの PDF Word 変換はテキストであってデザインではありません。これはテキスト抽出ツールです。得られるのは文字、読み順、太字と斜体、推定された見出しとリストです。ページレイアウト、フォント、表、画像は再現されません。

いいえ。表のセルは Word の表としてではなく、読み順のばらけたテキストとして出力されます。字形の座標から表構造を再構築するのは不確実性が高く、微妙に間違った表より、自由に並べ直せるテキストのほうが役に立つと考えています。

できます。抽出は文書全体に対して行われ、Word ファイルを生成する前に、書き出し対象をページ範囲で絞り込めます。

Adobe は商用エンジンを載せた自社サーバーで PDF Word 変換を実行し、レイアウトの再現は本ツールよりはるかに優れています。ただし文書のアップロードが必要です。レイアウトが重要なら Adobe を、文字とプライバシーが重要ならこちらをお使いください。

標準の .docx なので、Word、Google ドキュメント、LibreOffice、Pages で編集できます。編集が終わったら、同じくブラウザ内で動作する Word PDF 変換ツールで PDF に戻せます。

T

TinyImagePro エンジニアリングチーム

私たちは、データを一切アップロードしないブラウザ内ファイルツールを作っています。この PDF Word 抽出ツールは、テキストレイヤーの読み取りに pdf.js を、字形の座標から段落と見出しを再構築する専用の推定処理を、Word ファイルの書き出しに docx ライブラリを使用しています。すべてお使いのマシン上で動作します。

TinyImagePro について