Text being extracted from a PDF into a Word documentDOCX

PDF ke Word — Ekstrak Teks yang Bisa Diedit Tanpa Meng-upload File Anda

Mengambil teks dari PDF ke dalam .docx yang bisa Anda edit. Berjalan sepenuhnya di browser Anda. Alat ini tidak mereproduksi tata letak asli, dan mengatakannya sebelum Anda mengunduh.

🔒 100% di browser📝 Ekstraksi teks🔍 Mendeteksi hasil pindai Tanpa daftar
🔒

PDF Anda tidak pernah di-upload

Pem-parsing-an dan penulisan .docx sama-sama terjadi di browser Anda. Tidak ada salinan di server yang perlu dihapus, dan tidak ada masa penyimpanan yang harus Anda percayai.

🔍

File hasil pindai terdeteksi sejak awal

Hasil pindai tidak punya teks yang bisa diekstrak tanpa OCR. Kami memeriksanya begitu file dilepaskan dan mengatakannya, alih-alih menghasilkan file Word kosong tanpa penjelasan.

👁️

Lihat dulu sebelum mengunduh

Tidak seperti setiap alat PDF ke Word lain yang kami survei, pratinjaunya menampilkan persis apa yang dipulihkan, beserta berapa banyak judul dan daftar yang ditebak alih-alih dibaca.

📄

Mode teks polos

Penafsiran struktur bisa meleset. Satu klik mematikannya sepenuhnya dan memberi Anda teks mengalir yang bersih tanpa judul yang keliru dipromosikan.

Mengapa Konversi PDF ke Word Lebih Sulit dari Kelihatannya

Mengonversi Word ke PDF adalah persoalan rendering: ambil tata letak yang sudah dijelaskan lalu gambarlah. PDF ke Word adalah kebalikannya, dan kebalikan itu tidak simetris. Berjalan ke arah sebaliknya adalah persoalan rekonstruksi, dan rekonstruksi jauh lebih sulit daripada menggambar.

PDF Menyimpan Glyph, Bukan Kalimat

File PDF tidak mencatat paragraf atau judul. Ia mencatat instruksi untuk menggambar karakter satu per satu di koordinat tertentu, itulah sebabnya mengonversi PDF ke Word berarti merekayasa balik struktur dari data posisi.

File Word berkata "ini Heading 1 yang berisi teks Laporan Kuartal". PDF berkata "pasang font F2 di 22 poin, pindah ke x=72 y=782, tampilkan glyph L-a-p-o-r-a-n". Tidak ada apa pun di file yang menandainya sebagai judul. Itu harus disimpulkan dari fakta bahwa ukurannya lebih besar dari semua di sekitarnya.

Mengapa Paragraf Harus Direkayasa Balik

Teks tiba sebagai potongan-potongan di koordinat, sering terputus di tengah kata dan kerap tanpa spasi antar kata sama sekali. Memulihkan prosa yang terbaca berarti mengelompokkan potongan menjadi baris berdasarkan posisi vertikalnya, menyisipkan spasi di tempat yang tersirat dari jarak horizontal, lalu memutuskan mana pemutusan baris yang sekadar lipatan dan mana yang batas paragraf.

Setiap langkah itu adalah heuristik. Milik kami terdokumentasi dan teruji, tetapi tetap saja tebakan, dan halaman ini menandai bagian mana dari hasil yang merupakan tebakan alih-alih menyajikan semuanya sebagai fakta.

Masalah Dokumen Hasil Pindai

PDF hasil pindai berisi gambar teks, bukan teks. Tanpa OCR, parsing seperti apa pun tidak akan memulihkan kata-katanya.

Ini kekecewaan paling umum pada konverter PDF ke Word mana pun, dan alasan begitu banyak orang menyimpulkan alat-alat itu tidak berfungsi sama sekali. Anda melepaskan kontrak yang dipindai kolega, dan mendapat kembali file Word yang tidak berisi apa-apa — biasanya tanpa penjelasan apa pun.

Apa Fungsi OCR dan Mengapa Alat Ini Tidak Memilikinya

Pengenalan karakter optik melihat gambarnya lalu menentukan bentuk mana adalah huruf apa. Ini teknologi yang benar-benar berbeda dari membaca lapisan teks, relatif lambat, dan versi berbasis browser berarti mengirimkan model pengenalan ke setiap pengunjung.

Jadi kami melakukan hal terbaik berikutnya: mendeteksi situasinya dan mengatakannya terang-terangan, di hal pertama yang Anda lihat setelah melepaskan file. Deteksinya memperhitungkan bahwa halaman hasil pindai jarang benar-benar kosong — pemindai membubuhkan nomor halaman, dan OCR parsial meninggalkan sisa — sehingga halaman yang hanya berisi segelintir karakter diperlakukan sebagai hasil pindai, bukan sebagai teks.

Apa yang Sebenarnya Dilakukan Alat PDF ke Word Ini

Ini ekstraktor teks, bukan konverter tata letak. Ia memulihkan kata-kata dari PDF ke dalam file Word yang bisa diedit. Ia tidak mereproduksi desain halaman aslinya.

Ekstraksi Teks versus Konversi Tata Letak

Dua hal yang orang maksud dengan PDF ke Word cukup berbeda. Konversi tata letak mencoba membangun ulang dokumennya: tabel sebagai tabel, kolom sebagai kolom, gambar pada posisinya. Itu membutuhkan mesin komersial atau perangkat sisi server yang besar, dan implementasi yang bagus semuanya berjalan di sisi server.

Ekstraksi teks mengambil kata-katanya, urutan bacanya, dan struktur dasar sebanyak yang bisa disimpulkan dengan yakin. Untuk banyak sekali tugas nyata — mengutip klausul, memakai ulang paragraf, mengambil angka dari laporan — itu sudah seluruh pekerjaannya.

Untuk Siapa Alat Ini — dan untuk Siapa Bukan

Gunakan ini jika Anda ingin mengambil teks dari PDF untuk diedit, dikutip, atau dipakai ulang, dan Anda lebih suka dokumen Anda tidak di-upload ke server orang lain.

Jangan gunakan ini jika Anda butuh file Word yang tampak seperti PDF-nya, jika dokumennya sarat tabel, atau jika itu hasil pindai. Kasus-kasus itu dibahas lebih lanjut di bawah, beserta apa yang sebaiknya dipakai sebagai gantinya.

Cara Mengekstrak Teks dari PDF dalam 3 Langkah

1

Lepaskan PDF Anda

Seret PDF ke kotak di atas, atau klik untuk memilih. File dibaca langsung dari disk ke browser Anda — tidak ada upload, jadi dokumen besar langsung mulai diproses tanpa menunggu koneksi Anda.

2

Periksa pratinjau ekstraksi

Begitu file terbaca, Anda melihat apa yang benar-benar dipulihkan, berapa banyak judul dan butir daftar yang ditebak, dan apakah ada halaman yang tampak hasil pindai atau multi-kolom. Ini sengaja muncul sebelum unduhan, agar Anda bisa mundur tanpa membuang waktu pada file yang memang tidak akan berhasil.

3

Unduh DOCX Anda

Ekspor file Word standar yang terbuka di Word, Google Docs, LibreOffice, atau Pages. Jika judul yang ditebak terlihat salah, nyalakan mode teks polos lalu ekspor lagi — hanya butuh sedetik dan melewati semua penafsiran.

Apa yang Didapat Ekstraksi PDF ke Word — dan Apa yang Tidak

Setiap alat PDF ke Word menarik garis ini di suatu tempat. Kebanyakan hanya tidak pernah menunjukkan letaknya.

Diekstrak dengan Andal

Teks isi. Urutan baca, untuk dokumen satu kolom. Tebal dan miring, disimpulkan dari nama font yang tertanam. Teks yang terlihat dari hyperlink.

Untuk laporan, surat, atau artikel biasa, ini praktis seluruh isinya.

Ditebak — dan Kadang Salah

Tingkat judul, batas paragraf, serta daftar berpoin dan bernomor. Semuanya diturunkan dari geometri, bukan dibaca dari file, dan pratinjaunya menandainya sebagai tebakan persis karena alasan itu.

Bagaimana Tingkat Judul Ditebak dari Ukuran Font

Kami mengambil tinggi glyph yang paling umum di dokumen sebagai ukuran teks isi, lalu mempromosikan apa pun yang jauh lebih besar: 1,6× atau lebih menjadi Heading 1, 1,35× menjadi Heading 2, 1,15× menjadi Heading 3.

Ukuran yang paling umum, bukan rata-rata, dan itu disengaja — rata-rata tertarik naik oleh judul besar, yang kemudian membuat judul itu justru tidak dikenali sebagai judul sama sekali. Garis dasarnya juga dihitung untuk seluruh dokumen, sehingga halaman sampul yang seluruhnya berhuruf besar tidak mendistorsi setiap halaman setelahnya.

Dokumen yang menandai judul dengan ketebalan atau warna alih-alih ukuran tidak akan terdeteksi judulnya. Itu keterbatasan nyata, dan mode teks polos ada justru untuk itu.

Tidak Didukung

Tabel keluar sebagai teks lepas, bukan sebagai tabel. Gambar tidak terbawa. Header, footer, dan nomor halaman diekstrak sebagai teks biasa di mana pun kebetulan letaknya. Tata letak presisi, posisi, font, dan ukuran sama sekali tidak direproduksi.

Tabel, Gambar, dan Halaman Hasil Pindai

Halaman multi-kolom dideteksi dan ditandai, bukan diselang-selingkan diam-diam, karena urutan baca antar kolom memang ambigu — makalah akademis dua kolom bisa dibaca menurun per kolom atau melintang per halaman, dan file-nya tidak menyebutkan yang mana.

Halaman hasil pindai tidak menghasilkan apa-apa, dan dilaporkan begitu sebelum Anda mengekspor.

Kemampuan Ekstraksi Sekilas

FiturStatusCatatan
Teks isiAndalDipulihkan dari lapisan teks
Urutan baca (satu kolom)AndalDikelompokkan berdasarkan posisi baris
Tebal dan miringAndalDisimpulkan dari nama font tertanam
Teks hyperlinkAndalTeks yang terlihat, bukan targetnya
Tingkat judulDitebakDari ukuran font relatif; bisa salah
Batas paragrafDitebakDari jarak vertikal antar baris
Daftar berpoin dan bernomorDitebakDari penanda awal dan indentasi
Urutan baca multi-kolomDitebakDideteksi dan ditandai, tidak disusun ulang
TabelTidak didukungDikeluarkan sebagai teks lepas
GambarTidak didukungTidak terbawa ke file Word
Header dan footerTidak didukungMuncul sebagai teks biasa
Tata letak halaman dan fontTidak didukungTidak direproduksi
Halaman hasil pindaiTidak didukungButuh OCR; dideteksi dan dilaporkan

Apa yang Bisa Anda Lakukan dengan Ekstraksi PDF ke Word

Semua kegunaan realistis ekstraksi PDF ke Word punya pola yang sama: Anda menginginkan kata-katanya, bukan desainnya.

Mengutip dari Kontrak dan Laporan

Mengambil sebuah klausul persis dari PDF dengan mengetik ulang mengundang salah ketik, tepat pada jenis dokumen yang kesalahannya paling berarti. Ekstraksi memberi Anda kata-katanya secara harfiah — dan untuk kontrak, fakta bahwa file tidak pernah keluar dari mesin Anda bukan hal sepele.

Memakai Ulang Teks Makalah Penelitian

PDF akademis adalah kasus klasik untuk alat ini dan juga kasus klasik untuk keterbatasannya: teksnya keluar bersih, tetapi makalah dua kolom akan ditandai, karena urutan bacanya memang ambigu. Ekstrak, lalu susun ulang secara manual.

Mengambil Data dari Faktur

Rincian faktur berada di tabel, yang keluar sebagai teks lepas alih-alih kisi. Tetap lebih cepat daripada mengetik ulang, dan angka-angkanya tiba persis seperti yang tercetak.

Memanfaatkan Kembali Dokumen Lama

Mengubah brosur atau manual PDF lama kembali menjadi naskah yang bisa diedit biasanya soal kata-katanya, bukan desainnya — desainnya biasanya memang sedang diganti.

Mengapa Privasi Penting di Sini

Dokumen yang paling ingin diekstrak orang — kontrak, surat medis, laporan keuangan — adalah dokumen yang paling tidak semestinya di-upload. Memproses secara lokal menghapus pertanyaan itu alih-alih menjawabnya.

Kapan Sebaiknya Memakai Konverter Berbasis Server

Jika Anda butuh…GunakanAlasannya
Tabel tetap sebagai tabelAdobe, Smallpdf, atau Word sendiriMembutuhkan rekonstruksi tata letak
File Word yang tampak seperti PDF-nyaKonverter komersialKami tidak mereproduksi tata letak
Teks dari dokumen hasil pindaiAlat OCRTidak ada lapisan teks yang bisa dibaca
Gambar ikut terbawaKonverter komersialTidak diekstrak di sini
Hanya kata-katanya, secara privatAlat iniTidak ada yang di-upload
Mengedit dan mengutip ulang teksAlat iniTeks dan struktur dasar sudah cukup

Setelah PDF ke Word: Edit, Konversi Kembali, dan Bagikan

PDF ke Word jarang menjadi langkah terakhir. Begitu teksnya ada di Word dan sudah Anda edit, mengonversinya kembali adalah langkah lanjutan yang wajar — konverter Word ke PDF kami juga berjalan sepenuhnya di browser Anda, sehingga perjalanan bolak-baliknya tidak pernah menyentuh server.

Jika bahan sumber Anda terpecah di beberapa PDF, gabungkan dulu lalu ekstrak sekali, daripada mengekstrak berkali-kali dan menyambung hasilnya di Word.

Semua di sini mengikuti aturan yang sama: file Anda tetap di mesin Anda. Sisanya ada di halaman alat PDF gratis kami, dan alat gambarnya di semua alat browser gratis kami.

Why PDF to Word conversion has to reverse-engineer structureA Word file records that a block of text is a heading followed by a paragraph. A PDF records only that individual characters are drawn at particular coordinates, so paragraphs and headings must be inferred from position and size.What a Word file storesHeading 1"Quarterly Report"Paragraph"Revenue grew across every""segment during the period."List item"North region led growth"Structure is recordedNothing has to be guessedWhat a PDF storesTf /F2 22Td 72 782 · Tj "Quarterly"Td 196 782 · Tj "Report"Tf /F1 11Td 72 742 · Tj "Revenue grew"Td 178 742 · Tj "across every"Td 72 726 · Tj "segment during"Td 86 690 · Tj "•"Td 98 690 · Tj "North region led"Only glyphs and coordinatesParagraphs must be inferred
File Word mencatat bahwa sesuatu adalah judul. PDF hanya mencatat bahwa karakter digambar di koordinat tertentu — itulah sebabnya struktur harus ditebak.

Tiga langkah, tanpa akun, tanpa upload

Step one: drop a PDF onto the page.pdf
1

Lepaskan PDF. File dibaca secara lokal, di browser Anda.

Step two: compare the original page with what was extractedOriginalExtracted
2

Periksa apa yang benar-benar dipulihkan sebelum Anda memutuskan mengunduh.

Step three: download the editable Word documentDOCX
3

Ekspor .docx standar yang bisa Anda edit di mana saja.

Apa yang dipulihkan, ditebak, dan tidak bisa dilakukan ekstraktor ini

Kebanyakan konverter menggambarkan dirinya seolah hasilnya akan sama dengan aslinya. Alat ini tidak akan begitu, dan berpura-pura sebaliknya hanya akan membuang waktu Anda. Berikut rincian yang sesungguhnya.

What this extractor recovers, guesses, and cannot doReliably extracted: body text, reading order in single-column documents, bold and italic, and hyperlink text. Inferred and possibly wrong: heading levels, paragraph boundaries, lists, and multi-column reading order. Not supported: tables as tables, images, headers and footers, and scanned pages, which need OCR.Reliably extractedBody textReading order (single column)Bold and italicHyperlink textInferred — may be wrong?Heading levels?Paragraph boundaries?Bulleted and numbered lists?Multi-column orderNot supportedTables as tablesImagesHeaders and footersScanned pages (no OCR)
A text-layer PDF versus a scanned PDFA text-layer PDF contains selectable characters and can be extracted. A scanned PDF contains only a photograph of text, so without OCR there is nothing to extract.Text-layer PDFCharacters are selectableExtractableText, order,bold and italicScanned PDFJust a picture of textNeeds OCRWe detect thisand tell you
PDF hasil pindai berisi gambar teks, bukan teks. Kami mendeteksinya begitu file dilepaskan dan memberi tahu Anda, alih-alih menyerahkan dokumen kosong.

PDF ke Word — Pertanyaan yang Sering Diajukan

Ya, tanpa batas. Ekstraksi berjalan di perangkat keras Anda sendiri, jadi tidak ada biaya per file yang perlu kami bebankan. Tidak ada kuota harian, tanpa watermark, tanpa paket berbayar.

Tidak. PDF dibaca ke memori browser dan .docx-nya juga ditulis di sana. Buka DevTools dan perhatikan tab Network saat mengekstrak — tidak ada yang dikirim.

Karena hasil pindai berisi gambar teks, bukan teks, dan membacanya membutuhkan OCR, yang tidak dimiliki alat berbasis browser ini. Kami mendeteksi hasil pindai saat Anda melepaskan file dan memberi tahu sebelum Anda mengekspor, jadi Anda tidak dibiarkan bertanya-tanya. Gunakan alat OCR untuk dokumen semacam itu.

Tidak, dan kami lebih suka mengatakannya terang-terangan daripada membiarkan Anda mengetahuinya setelah mengunduh. PDF ke Word di sini berarti teks, bukan desain. Ini ekstraktor teks: Anda mendapat kata-katanya, urutan baca, tebal dan miring, serta judul dan daftar yang ditebak. Tata letak halaman, font, tabel, dan gambar tidak direproduksi.

Tidak. Sel tabel keluar sebagai teks lepas sesuai urutan baca, bukan sebagai tabel Word. Membangun ulang struktur tabel dari koordinat glyph cukup tidak andal sehingga mengeluarkan teks yang bisa Anda susun ulang lebih berguna daripada tabel yang salah secara halus.

Bisa. Ekstraksi berjalan pada seluruh dokumen, dan Anda bisa membatasi ekspor ke rentang halaman tertentu sebelum menyusun file Word-nya.

Adobe menjalankan PDF ke Word di servernya dengan mesin komersial dan mereproduksi tata letak jauh lebih baik daripada kami. Tetapi ia juga mengharuskan meng-upload dokumen Anda. Jika tata letak yang penting, pakai Adobe. Jika kata-katanya yang penting dan privasi yang penting, pakai ini.

Edit di Word, Google Docs, LibreOffice, atau Pages — itu .docx standar. Setelah selesai, konversi kembali ke PDF dengan alat Word ke PDF kami, yang juga berjalan di browser Anda.

T

Tim Teknik TinyImagePro

Kami membangun alat berkas berbasis browser yang tidak pernah meng-upload data Anda. Ekstraktor PDF ke Word ini memakai pdf.js untuk membaca lapisan teks, tahap penafsiran yang kami bangun khusus untuk merekonstruksi paragraf dan judul dari koordinat glyph, dan pustaka docx untuk menulis file Word — semuanya di mesin Anda.

Tentang TinyImagePro