Text being extracted from a PDF into a Word documentDOCX

PDF 轉 Word——不上傳檔案就擷取出可編輯的文字

把 PDF 裡的文字取出來,變成可以編輯的 .docx。完全在你的瀏覽器裡執行。它不會重現原始版面——而且在你下載之前就會明說。

🔒 100% 瀏覽器內完成📝 文字擷取🔍 可偵測掃描檔 免註冊
🔒

你的 PDF 永遠不會上傳

解析 PDF 與寫出 .docx 都在你的瀏覽器裡完成。伺服器上不存在需要刪除的副本,也沒有所謂的「保留時間」需要你去相信。

🔍

掃描檔一開始就會被指出

掃描檔沒有 OCR 就沒有文字可擷取。我們在拖入時就檢查並明說,而不是產出一份毫無解釋的空白 Word 檔。

👁️

下載前先看得到

和我們調查過的其他所有 PDF 轉 Word 工具不同,預覽會精確顯示還原出了什麼,並標明有多少標題和清單是推斷出來的,而不是讀出來的。

📄

純文字模式

結構推斷有可能出錯。一鍵就能完全關閉它,得到乾淨的連續文字,沒有任何被錯誤升級成標題的段落。

為什麼 PDF 轉 Word 比看起來難得多

Word 轉 PDF 是個算繪問題:拿到描述好的版面,把它畫出來。PDF 轉 Word 是反過來,而這個反向並不對稱。往回走是個重建問題,重建比繪製難得多。

PDF 存的是字符,不是句子

PDF 檔案不記錄段落或標題。它記錄的是「在特定座標畫出個別字元」的指令——這正是為什麼 PDF 轉 Word 意味著從位置資料反推結構。

Word 檔案會說「這是一個標題 1,內容是『季度報告』」。PDF 說的則是「用 22 點的字型 F2,移到 x=72 y=782,畫出字符 Q-u-a-r-t-e-r-l-y」。檔案裡沒有任何東西標記它是標題。只能從「它比周圍所有東西都大」這個事實去推斷。

為什麼段落必須反向重建

文字是以座標上的碎片形式出現的,常常在字詞中間被切斷,而且經常完全缺少字詞之間的空格。要還原可讀的文句,得先依垂直位置把碎片聚成行、在水平間距暗示的地方補上空格,再判斷哪些換行只是折行、哪些是段落邊界。

這裡的每一步都是啟發式的猜測。我們的規則有文件記載、也經過測試,但終究是猜的——而這個頁面會標明輸出的哪些部分是猜的,而不是把一切都當成事實呈現。

掃描文件的問題

掃描的 PDF 裝的是文字的圖片,不是文字。沒有 OCR,再怎麼解析也還原不出字。

這是所有 PDF 轉 Word 轉換器最常見的一種失望,也是許多人斷定「這些工具根本沒用」的原因。你把同事掃描的合約拖進去,拿回來的是一份什麼都沒有的 Word 檔——通常連一句解釋都沒有。

OCR 是什麼,以及這個工具為什麼沒有

光學字元辨識(OCR)是看著圖片,判斷哪些形狀是哪些字母。它和讀取文字層是完全不同的技術,速度也慢得多,而瀏覽器版本意味著要把一整個辨識模型送到每位訪客手上。

所以我們做了次好的事:偵測到這種情況就直白地說,而且是在你拖入檔案後看到的第一件事裡說。偵測也考慮到掃描頁很少完全空白——掃描器會蓋上頁碼,殘缺的 OCR 也會留下碎屑——所以只有零星幾個字元的頁面會被判定為掃描頁,而不是文字頁。

這個 PDF 轉 Word 工具實際做的事

這是一個文字擷取器,不是版面轉換器。它把 PDF 裡的文字還原成可編輯的 Word 檔,但不會重現原始的頁面設計。

文字擷取 vs 版面轉換

人們說「PDF 轉 Word」時,其實指兩件很不一樣的事。版面轉換試圖重建整份文件:表格還是表格、分欄還是分欄、圖片留在原位。這需要商用引擎或大量伺服器端機制,而做得好的實作全都在伺服器端。

文字擷取取的是文字、閱讀順序,以及所有能有把握推斷出的基本結構。對非常多實際任務來說——引用一則條款、重用一個段落、把報告裡的數字取出來——這就是全部所需。

誰適合用——誰不適合

適合你,如果你想把 PDF 裡的文字取出來編輯、引用或再利用,而且不希望文件被上傳到陌生人的伺服器。

不適合你,如果你需要 Word 檔看起來和 PDF 一樣、文件裡表格很多,或它是掃描檔。這些情況以及該改用什麼,下面都有說明。

三步從 PDF 擷取文字

1

拖入 PDF

把 PDF 拖到上面的方框裡,或點擊選取。檔案從硬碟直接讀進瀏覽器——沒有上傳環節,所以大型文件會立刻開始處理,不必等網路。

2

查看擷取預覽

檔案一讀完,你就能看到實際還原出了什麼、有多少標題和清單項目是推斷的,以及是否有頁面看起來是掃描檔或分欄版面。這一步刻意放在下載之前,所以如果這份檔案本來就行不通,你可以直接離開,不浪費時間。

3

下載你的 DOCX

匯出標準的 Word 檔,可在 Word、Google 文件、LibreOffice 或 Pages 開啟。如果推斷出的標題看起來不對,開啟純文字模式再匯出一次——只要一秒,並且會略過所有解讀。

PDF 轉 Word 擷取得到什麼——擷取不到什麼

每一個 PDF 轉 Word 工具都在某處畫下這條界線。多數工具只是從不讓你看到界線在哪。

可靠擷取

內文文字。閱讀順序(單欄文件)。粗體與斜體,從內嵌字型名稱推得。超連結的可見文字。

對一般的報告、書信或文章而言,這實際上就是全部內容。

推斷而來——有時會錯

標題層級、段落邊界、項目符號與編號清單。這些是從幾何位置推導出來的,不是從檔案裡讀出來的——預覽把它們標記為「推斷」,正是因為這個原因。

標題層級是怎麼從字級猜出來的

我們把文件中最常見的字符高度當作內文字級,再把明顯更大的內容升級:1.6 倍以上為標題 1,1.35 倍為標題 2,1.15 倍為標題 3。

用最常見值而不是平均值,是刻意的——平均值會被大字標題往上拉,反而讓那個標題無法被認出是標題。基準值也是跨整份文件計算的,所以全用大字排版的扉頁不會扭曲之後每一頁的判斷。

用字重或顏色而非字級來標示標題的文件,其標題不會被偵測到。這是實實在在的限制,純文字模式正是為此而存在。

不支援

表格會輸出為零散文字,而不是表格。圖片不會被帶過去。頁首、頁尾與頁碼會依它們所在的位置被當成普通文字擷取。精確的版面、位置、字型與字級完全不會被重現。

表格、圖片與掃描頁

分欄頁面會被偵測並標示,而不是被無聲地交錯——因為跨欄的閱讀順序確實是模稜兩可的:一篇雙欄學術論文可以逐欄往下讀,也可以橫著整頁讀,而檔案裡沒有記載該用哪一種。

掃描頁不會產出任何內容,並且會在你匯出之前如實回報。

擷取能力一覽

項目狀態說明
內文文字可靠從文字層還原
閱讀順序(單欄)可靠依行位置聚合
粗體與斜體可靠從內嵌字型名稱推得
超連結文字可靠可見文字,不含連結目標
標題層級推斷依相對字級判斷;可能出錯
段落邊界推斷依行與行之間的垂直間距
項目符號與編號清單推斷依前導符號與縮排
分欄閱讀順序推斷偵測並標示,不做重排
表格不支援輸出為零散文字
圖片不支援不會帶進 Word 檔
頁首與頁尾不支援以普通文字出現
頁面版面與字型不支援不會重現
掃描頁面不支援需要 OCR;會偵測並回報

PDF 轉 Word 擷取可以用來做什麼

PDF 轉 Word 擷取的實際用途都有一個共同的形狀:你要的是文字,不是設計。

從合約與報告裡引用條文

靠重打把一則條款從 PDF 裡抄出來,恰恰是在最不容許出錯的文件裡邀請抄寫錯誤。擷取讓你一字不差地拿到原文——而對一份合約來說,「它從未離開你的電腦」絕不是可有可無的細節。

重用研究論文的文字

學術 PDF 是這個工具的經典場景,也是它極限的經典場景:文字能乾淨地取出來,但雙欄論文會被標示——因為跨欄的閱讀順序確實無法確定。先擷取,再手動排序。

把發票裡的資料取出來

發票的品項明細放在表格裡,取出時會是零散文字而非表格。即便如此仍比重打快,而且數字會和印出來的一模一樣。

翻新舊文件

把一份舊的 PDF 型錄或手冊變回可編輯的文案,要的通常是文字而非設計——反正設計本來就要換掉。

為什麼隱私在這裡格外重要

人們最想擷取的文件——合約、醫療信函、財務報表——正是最不該被上傳的文件。在本機處理,等於直接讓這個問題消失,而不是回答它。

什麼情況下該改用伺服器端轉換器

如果你需要…請使用原因
表格維持表格形式Adobe、Smallpdf 或 Word 本身需要版面重建
Word 檔看起來和 PDF 一樣商用轉換器我們不重現版面
掃描文件裡的文字OCR 工具沒有可讀取的文字層
圖片一併帶過去商用轉換器這裡不擷取圖片
只要文字,且要私密這個工具不會上傳任何內容
編輯與再引用文字這個工具文字加基本結構就夠用

PDF 轉 Word 之後:編輯、轉回、分享

PDF 轉 Word 很少是最後一步。文字進了 Word、編輯完之後,把它轉回 PDF 是自然的下一步——我們的 Word 轉 PDF 轉換器同樣完全在瀏覽器裡執行,所以這趟來回從不經過任何伺服器。

如果你的素材分散在好幾份 PDF 裡,請先把它們合併再一次擷取,而不是擷取好幾次、再到 Word 裡拼接結果。

這裡的一切都遵循同一條原則:檔案留在你自己的電腦上。同類工具都在免費 PDF 工具頁面,圖片工具則在全部免費瀏覽器工具

Why PDF to Word conversion has to reverse-engineer structureA Word file records that a block of text is a heading followed by a paragraph. A PDF records only that individual characters are drawn at particular coordinates, so paragraphs and headings must be inferred from position and size.What a Word file storesHeading 1"Quarterly Report"Paragraph"Revenue grew across every""segment during the period."List item"North region led growth"Structure is recordedNothing has to be guessedWhat a PDF storesTf /F2 22Td 72 782 · Tj "Quarterly"Td 196 782 · Tj "Report"Tf /F1 11Td 72 742 · Tj "Revenue grew"Td 178 742 · Tj "across every"Td 72 726 · Tj "segment during"Td 86 690 · Tj "•"Td 98 690 · Tj "North region led"Only glyphs and coordinatesParagraphs must be inferred
Word 檔案會記錄某段內容是標題。PDF 只記錄字元被畫在哪些座標上——這正是為什麼結構必須用猜的。

三步完成,不用帳號,不用上傳

Step one: drop a PDF onto the page.pdf
1

拖入 PDF。它會在你的瀏覽器裡本機讀取。

Step two: compare the original page with what was extractedOriginalExtracted
2

在決定下載之前,先確認實際還原出了什麼。

Step three: download the editable Word documentDOCX
3

匯出標準 .docx,在任何地方都能編輯。

這個擷取器能還原什麼、猜什麼、做不到什麼

多數轉換器的自我介紹,都彷彿輸出會和原稿一模一樣。這個工具做不到,而假裝做得到只會浪費你的時間。實際的能力清單如下。

What this extractor recovers, guesses, and cannot doReliably extracted: body text, reading order in single-column documents, bold and italic, and hyperlink text. Inferred and possibly wrong: heading levels, paragraph boundaries, lists, and multi-column reading order. Not supported: tables as tables, images, headers and footers, and scanned pages, which need OCR.Reliably extractedBody textReading order (single column)Bold and italicHyperlink textInferred — may be wrong?Heading levels?Paragraph boundaries?Bulleted and numbered lists?Multi-column orderNot supportedTables as tablesImagesHeaders and footersScanned pages (no OCR)
A text-layer PDF versus a scanned PDFA text-layer PDF contains selectable characters and can be extracted. A scanned PDF contains only a photograph of text, so without OCR there is nothing to extract.Text-layer PDFCharacters are selectableExtractableText, order,bold and italicScanned PDFJust a picture of textNeeds OCRWe detect thisand tell you
掃描的 PDF 裝的是文字的圖片,不是文字。我們在拖入時就會偵測並告訴你,而不是遞給你一份空文件。

PDF 轉 Word 常見問題

是的,而且沒有上限。擷取跑在你自己的硬體上,我們不會產生按檔案計的成本,也就沒有要轉嫁給你的費用。沒有每日限額、沒有浮水印、沒有付費方案。

不會。PDF 被讀進瀏覽器記憶體,.docx 也在那裡寫出。打開開發者工具,在擷取時觀察 Network 面板——沒有任何東西被送出去。

因為掃描檔裝的是文字的圖片而不是文字,要讀懂它需要 OCR,而這個瀏覽器端工具不具備 OCR。我們在你拖入檔案時就會偵測掃描檔,並在匯出前告訴你,不會讓你一頭霧水。這類文件請改用 OCR 工具。

不會——我們寧可直說,也不想讓你下載之後才發現。這裡的 PDF 轉 Word 指的是文字,不是設計。這是一個文字擷取器:你會得到文字、閱讀順序、粗體與斜體,以及推斷出的標題和清單。頁面版面、字型、表格和圖片不會被重現。

不會。表格儲存格會依閱讀順序輸出為零散文字,而不是 Word 表格。從字符座標重建表格結構的可靠度太低,與其給你一個細節悄悄出錯的表格,不如給你可以自行重排的文字更有用。

可以。擷取會跑完整份文件,而你可以在產生 Word 檔之前把匯出限定在某個頁面範圍。

Adobe 的 PDF 轉 Word 用商用引擎在它的伺服器上執行,版面重現得比我們好得多,但也必須上傳你的文件。如果版面重要,用 Adobe;如果文字重要、隱私也重要,用這個。

在 Word、Google 文件、LibreOffice 或 Pages 裡編輯它——這是標準的 .docx。改完之後,用我們的 Word 轉 PDF 工具把它轉回 PDF,那個工具同樣在你的瀏覽器裡執行。

T

TinyImagePro 工程團隊

我們做的是永不上傳你資料的瀏覽器端檔案工具。這個 PDF 轉 Word 擷取器用 pdf.js 讀取文字層,用自行開發的推斷流程從字符座標重建段落與標題,再用 docx 函式庫寫出 Word 檔——全部在你的電腦上完成。

關於 TinyImagePro