為什麼 PDF 轉 Word 比看起來難得多
Word 轉 PDF 是個算繪問題:拿到描述好的版面,把它畫出來。PDF 轉 Word 是反過來,而這個反向並不對稱。往回走是個重建問題,重建比繪製難得多。
PDF 存的是字符,不是句子
PDF 檔案不記錄段落或標題。它記錄的是「在特定座標畫出個別字元」的指令——這正是為什麼 PDF 轉 Word 意味著從位置資料反推結構。
Word 檔案會說「這是一個標題 1,內容是『季度報告』」。PDF 說的則是「用 22 點的字型 F2,移到 x=72 y=782,畫出字符 Q-u-a-r-t-e-r-l-y」。檔案裡沒有任何東西標記它是標題。只能從「它比周圍所有東西都大」這個事實去推斷。
為什麼段落必須反向重建
文字是以座標上的碎片形式出現的,常常在字詞中間被切斷,而且經常完全缺少字詞之間的空格。要還原可讀的文句,得先依垂直位置把碎片聚成行、在水平間距暗示的地方補上空格,再判斷哪些換行只是折行、哪些是段落邊界。
這裡的每一步都是啟發式的猜測。我們的規則有文件記載、也經過測試,但終究是猜的——而這個頁面會標明輸出的哪些部分是猜的,而不是把一切都當成事實呈現。
掃描文件的問題
掃描的 PDF 裝的是文字的圖片,不是文字。沒有 OCR,再怎麼解析也還原不出字。
這是所有 PDF 轉 Word 轉換器最常見的一種失望,也是許多人斷定「這些工具根本沒用」的原因。你把同事掃描的合約拖進去,拿回來的是一份什麼都沒有的 Word 檔——通常連一句解釋都沒有。
OCR 是什麼,以及這個工具為什麼沒有
光學字元辨識(OCR)是看著圖片,判斷哪些形狀是哪些字母。它和讀取文字層是完全不同的技術,速度也慢得多,而瀏覽器版本意味著要把一整個辨識模型送到每位訪客手上。
所以我們做了次好的事:偵測到這種情況就直白地說,而且是在你拖入檔案後看到的第一件事裡說。偵測也考慮到掃描頁很少完全空白——掃描器會蓋上頁碼,殘缺的 OCR 也會留下碎屑——所以只有零星幾個字元的頁面會被判定為掃描頁,而不是文字頁。
這個 PDF 轉 Word 工具實際做的事
這是一個文字擷取器,不是版面轉換器。它把 PDF 裡的文字還原成可編輯的 Word 檔,但不會重現原始的頁面設計。
文字擷取 vs 版面轉換
人們說「PDF 轉 Word」時,其實指兩件很不一樣的事。版面轉換試圖重建整份文件:表格還是表格、分欄還是分欄、圖片留在原位。這需要商用引擎或大量伺服器端機制,而做得好的實作全都在伺服器端。
文字擷取取的是文字、閱讀順序,以及所有能有把握推斷出的基本結構。對非常多實際任務來說——引用一則條款、重用一個段落、把報告裡的數字取出來——這就是全部所需。
誰適合用——誰不適合
適合你,如果你想把 PDF 裡的文字取出來編輯、引用或再利用,而且不希望文件被上傳到陌生人的伺服器。
不適合你,如果你需要 Word 檔看起來和 PDF 一樣、文件裡表格很多,或它是掃描檔。這些情況以及該改用什麼,下面都有說明。
三步從 PDF 擷取文字
拖入 PDF
把 PDF 拖到上面的方框裡,或點擊選取。檔案從硬碟直接讀進瀏覽器——沒有上傳環節,所以大型文件會立刻開始處理,不必等網路。
查看擷取預覽
檔案一讀完,你就能看到實際還原出了什麼、有多少標題和清單項目是推斷的,以及是否有頁面看起來是掃描檔或分欄版面。這一步刻意放在下載之前,所以如果這份檔案本來就行不通,你可以直接離開,不浪費時間。
下載你的 DOCX
匯出標準的 Word 檔,可在 Word、Google 文件、LibreOffice 或 Pages 開啟。如果推斷出的標題看起來不對,開啟純文字模式再匯出一次——只要一秒,並且會略過所有解讀。
PDF 轉 Word 擷取得到什麼——擷取不到什麼
每一個 PDF 轉 Word 工具都在某處畫下這條界線。多數工具只是從不讓你看到界線在哪。
可靠擷取
內文文字。閱讀順序(單欄文件)。粗體與斜體,從內嵌字型名稱推得。超連結的可見文字。
對一般的報告、書信或文章而言,這實際上就是全部內容。
推斷而來——有時會錯
標題層級、段落邊界、項目符號與編號清單。這些是從幾何位置推導出來的,不是從檔案裡讀出來的——預覽把它們標記為「推斷」,正是因為這個原因。
標題層級是怎麼從字級猜出來的
我們把文件中最常見的字符高度當作內文字級,再把明顯更大的內容升級:1.6 倍以上為標題 1,1.35 倍為標題 2,1.15 倍為標題 3。
用最常見值而不是平均值,是刻意的——平均值會被大字標題往上拉,反而讓那個標題無法被認出是標題。基準值也是跨整份文件計算的,所以全用大字排版的扉頁不會扭曲之後每一頁的判斷。
用字重或顏色而非字級來標示標題的文件,其標題不會被偵測到。這是實實在在的限制,純文字模式正是為此而存在。
不支援
表格會輸出為零散文字,而不是表格。圖片不會被帶過去。頁首、頁尾與頁碼會依它們所在的位置被當成普通文字擷取。精確的版面、位置、字型與字級完全不會被重現。
表格、圖片與掃描頁
分欄頁面會被偵測並標示,而不是被無聲地交錯——因為跨欄的閱讀順序確實是模稜兩可的:一篇雙欄學術論文可以逐欄往下讀,也可以橫著整頁讀,而檔案裡沒有記載該用哪一種。
掃描頁不會產出任何內容,並且會在你匯出之前如實回報。
擷取能力一覽
| 項目 | 狀態 | 說明 |
|---|---|---|
| 內文文字 | 可靠 | 從文字層還原 |
| 閱讀順序(單欄) | 可靠 | 依行位置聚合 |
| 粗體與斜體 | 可靠 | 從內嵌字型名稱推得 |
| 超連結文字 | 可靠 | 可見文字,不含連結目標 |
| 標題層級 | 推斷 | 依相對字級判斷;可能出錯 |
| 段落邊界 | 推斷 | 依行與行之間的垂直間距 |
| 項目符號與編號清單 | 推斷 | 依前導符號與縮排 |
| 分欄閱讀順序 | 推斷 | 偵測並標示,不做重排 |
| 表格 | 不支援 | 輸出為零散文字 |
| 圖片 | 不支援 | 不會帶進 Word 檔 |
| 頁首與頁尾 | 不支援 | 以普通文字出現 |
| 頁面版面與字型 | 不支援 | 不會重現 |
| 掃描頁面 | 不支援 | 需要 OCR;會偵測並回報 |
PDF 轉 Word 擷取可以用來做什麼
PDF 轉 Word 擷取的實際用途都有一個共同的形狀:你要的是文字,不是設計。
從合約與報告裡引用條文
靠重打把一則條款從 PDF 裡抄出來,恰恰是在最不容許出錯的文件裡邀請抄寫錯誤。擷取讓你一字不差地拿到原文——而對一份合約來說,「它從未離開你的電腦」絕不是可有可無的細節。
重用研究論文的文字
學術 PDF 是這個工具的經典場景,也是它極限的經典場景:文字能乾淨地取出來,但雙欄論文會被標示——因為跨欄的閱讀順序確實無法確定。先擷取,再手動排序。
把發票裡的資料取出來
發票的品項明細放在表格裡,取出時會是零散文字而非表格。即便如此仍比重打快,而且數字會和印出來的一模一樣。
翻新舊文件
把一份舊的 PDF 型錄或手冊變回可編輯的文案,要的通常是文字而非設計——反正設計本來就要換掉。
為什麼隱私在這裡格外重要
人們最想擷取的文件——合約、醫療信函、財務報表——正是最不該被上傳的文件。在本機處理,等於直接讓這個問題消失,而不是回答它。
什麼情況下該改用伺服器端轉換器
| 如果你需要… | 請使用 | 原因 |
|---|---|---|
| 表格維持表格形式 | Adobe、Smallpdf 或 Word 本身 | 需要版面重建 |
| Word 檔看起來和 PDF 一樣 | 商用轉換器 | 我們不重現版面 |
| 掃描文件裡的文字 | OCR 工具 | 沒有可讀取的文字層 |
| 圖片一併帶過去 | 商用轉換器 | 這裡不擷取圖片 |
| 只要文字,且要私密 | 這個工具 | 不會上傳任何內容 |
| 編輯與再引用文字 | 這個工具 | 文字加基本結構就夠用 |
PDF 轉 Word 之後:編輯、轉回、分享
PDF 轉 Word 很少是最後一步。文字進了 Word、編輯完之後,把它轉回 PDF 是自然的下一步——我們的 Word 轉 PDF 轉換器同樣完全在瀏覽器裡執行,所以這趟來回從不經過任何伺服器。
如果你的素材分散在好幾份 PDF 裡,請先把它們合併再一次擷取,而不是擷取好幾次、再到 Word 裡拼接結果。
這裡的一切都遵循同一條原則:檔案留在你自己的電腦上。同類工具都在免費 PDF 工具頁面,圖片工具則在全部免費瀏覽器工具。