Text being extracted from a PDF into a Word documentDOCX

PDF Word Dönüştürücü — Dosyanızı Yüklemeden Düzenlenebilir Metni Çıkarın

Bir PDF'nin içindeki metni, düzenleyebileceğiniz bir .docx dosyasına çıkarır. Tamamen tarayıcınızda çalışır. Orijinal düzeni yeniden oluşturmaz ve bunu siz indirmeden önce açıkça söyler.

🔒 %100 tarayıcı içinde📝 Metin çıkarma🔍 Taramaları tespit eder Kayıt gerekmez
🔒

PDF'niz hiçbir zaman yüklenmez

Hem çözümleme hem de .docx yazma işlemi tarayıcınızda gerçekleşir. Silinmesi gereken bir sunucu kopyası ve güvenmeniz gereken bir saklama süresi yoktur.

🔍

Taranmış dosyalar en baştan tespit edilir

Bir taramada OCR olmadan çıkarılacak metin yoktur. Dosya bırakıldığı anda kontrol eder ve durumu söyleriz; hiçbir açıklama yapmadan boş bir Word dosyası üretmek yerine.

👁️

İndirmeden önce görün

İncelediğimiz diğer bütün PDF Word araçlarının aksine, önizleme neyin kurtarıldığını tam olarak gösterir; kaç başlığın ve listenin okunmak yerine tahmin edildiğini de birlikte.

📄

Düz metin modu

Yapı tahmini yanılabilir. Tek tıklamayla tamamen kapanır ve yanlışlıkla başlığa terfi etmiş satırlar olmadan, akıp giden temiz bir metin verir.

PDF'yi Word'e Çevirmek Neden Göründüğünden Zor

Word'ü PDF'ye çevirmek bir çizim problemidir: tarif edilmiş bir düzeni alıp çizersiniz. PDF'den Word'e gitmek bunun tersidir ve tersi simetrik değildir. Diğer yöne gitmek bir yeniden kurma problemidir ve yeniden kurmak, çizmekten çok daha zordur.

PDF Cümleleri Değil, Harfleri Saklar

Bir PDF dosyası paragrafları ya da başlıkları kaydetmez. Tek tek karakterleri belirli koordinatlara çizme talimatlarını kaydeder; PDF'yi Word'e çevirmenin, yapıyı konum verisinden tersine mühendislikle çıkarmak anlamına gelmesinin nedeni budur.

Bir Word dosyası "bu, Çeyrek Raporu metnini içeren bir Başlık 1'dir" der. Bir PDF ise "F2 yazı tipini 22 puntoya ayarla, x=72 y=782 konumuna git, Ç-e-y-r-e-k harflerini göster" der. Dosyada bunun bir başlık olduğunu belirten hiçbir şey yoktur. Bu, yalnızca çevresindeki her şeyden daha büyük olmasından çıkarsanmak zorundadır.

Paragrafları Neden Tersine Mühendislikle Çıkarmak Gerekiyor

Metin, koordinatlara yerleşmiş parçalar hâlinde gelir; çoğu zaman kelime ortasından bölünmüş ve sıklıkla kelimeler arasındaki boşluklar tamamen eksik olarak. Okunabilir bir düzyazıyı geri kazanmak, parçaları dikey konumlarına göre satırlar hâlinde kümelemeyi, yatay boşlukların ima ettiği yerlere boşluk eklemeyi ve ardından hangi satır sonlarının kaydırma, hangilerinin paragraf sınırı olduğuna karar vermeyi gerektirir.

Bu adımların her biri bir sezgisel yöntemdir. Bizimkiler belgelenmiş ve test edilmiştir, ama yine de tahmindir; bu sayfa da çıktının hangi kısımlarının tahmin olduğunu, hepsini olmuş bitmiş bir gerçek gibi sunmak yerine işaretler.

Taranmış Belge Sorunu

Taranmış PDF'ler metin değil, metnin görüntüsünü içerir. OCR olmadan, ne kadar çözümleme yapılırsa yapılsın kelimeler geri kazanılamaz.

Bu, herhangi bir PDF Word dönüştürücüde yaşanan en yaygın hayal kırıklığıdır ve bu kadar çok insanın "bu araçlar zaten çalışmıyor" sonucuna varmasının nedenidir. Meslektaşınızın taradığı bir sözleşmeyi bırakırsınız ve içinde hiçbir şey olmayan bir Word dosyası alırsınız — genellikle hiçbir açıklama da yapılmadan.

OCR Ne Yapar ve Bu Araçta Neden Yok

Optik karakter tanıma, görüntüye bakar ve hangi şekillerin hangi harfler olduğunu çözer. Bu, bir metin katmanını okumaktan gerçekten farklı bir teknolojidir, görece yavaştır ve tarayıcı tabanlı bir sürümü her ziyaretçiye bir tanıma modeli göndermek anlamına gelirdi.

Bu yüzden bir sonraki en iyi şeyi yapıyoruz: durumu tespit edip, dosyayı bıraktıktan sonra gördüğünüz ilk şeyde açıkça söylüyoruz. Tespit yöntemi, taranmış sayfaların nadiren tamamen boş olduğunu da hesaba katar — tarayıcılar sayfa numarası basar, kısmi OCR arkasında kırıntı bırakır — bu nedenle yalnızca birkaç karakter içeren bir sayfa metin değil, tarama olarak değerlendirilir.

Bu PDF Word Aracı Aslında Ne Yapar

Bu bir metin çıkarıcıdır, düzen dönüştürücü değildir. Bir PDF'deki kelimeleri düzenlenebilir bir Word dosyasına geri kazandırır. Orijinal sayfa tasarımını yeniden oluşturmaz.

Metin Çıkarma ile Düzen Dönüştürme

İnsanların "PDF Word" derken kastettiği iki şey birbirinden epey farklıdır. Düzen dönüştürme belgeyi yeniden inşa etmeye çalışır: tabloları tablo, sütunları sütun, görselleri yerli yerinde. Bu ya ticari bir motor ya da hatırı sayılır bir sunucu tarafı altyapı gerektirir; iyi uygulamaların hepsi de sunucu tarafındadır.

Metin çıkarma ise kelimeleri, okuma sırasını ve güvenle çıkarsanabilen kadarıyla temel yapıyı alır. Gerçek hayattaki pek çok iş için — bir maddeyi alıntılamak, bir paragrafı yeniden kullanmak, bir rapordaki rakamları çekip almak — işin tamamı budur.

Bu Kimin İçin — Kimin İçin Değil

Şunu istiyorsanız kullanın: bir PDF'nin metnini düzenlemek, alıntılamak veya yeniden kullanmak için dışarı çıkarmak ve belgenizin bir yabancının sunucusuna yüklenmemesini tercih etmek.

Şu durumlarda kullanmayın: Word dosyasının PDF'ye benzemesi gerekiyorsa, belge tablo ağırlıklıysa veya belge bir taramaysa. Bu durumlar, yerine ne kullanmanız gerektiğiyle birlikte aşağıda ele alınıyor.

Bir PDF'den 3 Adımda Metin Çıkarma

1

PDF'nizi bırakın

Bir PDF'yi yukarıdaki kutuya sürükleyin ya da tıklayıp seçin. Dosya doğrudan diskten tarayıcınıza okunur — yükleme olmadığı için büyük bir belge bağlantınızı beklemeden anında başlar.

2

Çıkarma önizlemesine bakın

Dosya okunur okunmaz gerçekte neyin kurtarıldığını, kaç başlığın ve liste öğesinin tahmin edildiğini ve herhangi bir sayfanın taranmış ya da çok sütunlu görünüp görünmediğini görürsünüz. Bu bilinçli olarak indirmeden önce gelir; böylece en baştan işe yaramayacak bir dosyaya vakit harcamadan çekip gidebilirsiniz.

3

DOCX dosyanızı indirin

Word, Google Docs, LibreOffice veya Pages'te açılan standart bir Word dosyası dışa aktarın. Tahmin edilen başlıklar yanlış görünüyorsa düz metin modunu açıp yeniden dışa aktarın — bir saniye sürer ve tüm yorumlamayı atlar.

PDF Word Çıkarma Neyi Alır — Neyi Alamaz

Her PDF Word aracı bu çizgiyi bir yere çeker. Çoğu size bu çizginin nerede olduğunu hiç göstermez.

Güvenilir Biçimde Çıkarılanlar

Gövde metni. Tek sütunlu belgelerde okuma sırası. Gömülü yazı tipi adlarından çıkarsanan kalın ve italik biçimler. Bağlantıların görünen metni.

Sıradan bir rapor, mektup veya makale için bu, içeriğin fiilen tamamıdır.

Tahmin Edilenler — ve Kimi Zaman Yanlış Olanlar

Başlık düzeyleri, paragraf sınırları ve madde imli ya da numaralı listeler. Bunlar dosyadan okunmaz, geometriden türetilir; önizlemenin bunları tam da bu nedenle "tahmin" diye etiketlemesinin sebebi budur.

Başlık Düzeyleri Yazı Tipi Boyutundan Nasıl Tahmin Ediliyor

Belgedeki en sık görülen harf yüksekliğini gövde boyutu kabul ediyoruz, ardından belirgin biçimde daha büyük olan her şeyi terfi ettiriyoruz: 1,6× ve üzeri Başlık 1, 1,35× Başlık 2, 1,15× Başlık 3 oluyor.

Ortalama değil, en sık görülen boyut — ve bu bilinçli bir tercih. Ortalamayı büyük bir başlık yukarı çeker, bu da o başlığın hiç başlık olarak tanınmamasına yol açardı. Taban değer ayrıca belgenin tamamı üzerinden hesaplanır; böylece baştan sona iri puntoyla dizilmiş bir kapak sayfası kendisinden sonraki her sayfayı bozmaz.

Başlıklarını boyutla değil kalınlıkla veya renkle belirten belgelerde başlıklar tespit edilemez. Bu gerçek bir kısıttır ve düz metin modu tam da bunun için vardır.

Desteklenmeyenler

Tablolar, tablo olarak değil serbest metin olarak çıkar. Görseller aktarılmaz. Üst bilgiler, alt bilgiler ve sayfa numaraları, nerede duruyorlarsa orada sıradan metin olarak çıkarılır. Kesin düzen, konumlandırma, yazı tipleri ve boyutlar hiç yeniden üretilmez.

Tablolar, Görseller ve Taranmış Sayfalar

Çok sütunlu sayfalar sessizce iç içe geçirilmek yerine tespit edilip bildirilir, çünkü sütunlar arası okuma sırası gerçekten de belirsizdir — iki sütunlu bir akademik makale, her sütun aşağı doğru da okunabilir, sayfa boyunca yatay olarak da; ve dosya hangisi olduğunu söylemez.

Taranmış sayfalar hiçbir şey üretmez ve bu durum siz dışa aktarmadan önce bildirilir.

Çıkarma Yeteneklerine Tek Bakışta Genel Bakış

ÖzellikDurumNotlar
Gövde metniGüvenilirMetin katmanından geri kazanılır
Okuma sırası (tek sütun)GüvenilirSatır konumuna göre kümelenir
Kalın ve italikGüvenilirGömülü yazı tipi adlarından çıkarsanır
Bağlantı metniGüvenilirGörünen metin, hedef adresi değil
Başlık düzeyleriTahmin edilirGöreli yazı tipi boyutundan; yanlış olabilir
Paragraf sınırlarıTahmin edilirSatırlar arasındaki dikey boşluklardan
Madde imli ve numaralı listelerTahmin edilirBaştaki işaretlerden ve girintiden
Çok sütunlu okuma sırasıTahmin edilirTespit edilip bildirilir, yeniden sıralanmaz
TablolarDesteklenmiyorSerbest metin olarak çıkar
GörsellerDesteklenmiyorWord dosyasına aktarılmaz
Üst bilgi ve alt bilgilerDesteklenmiyorSıradan metin olarak görünür
Sayfa düzeni ve yazı tipleriDesteklenmiyorYeniden üretilmez
Taranmış sayfalarDesteklenmiyorOCR gerekir; tespit edilip bildirilir

PDF Word Çıkarmayla Neler Yapabilirsiniz

PDF Word çıkarmanın gerçekçi kullanımlarının hepsi aynı biçimi taşır: tasarımı değil, kelimeleri istiyorsunuzdur.

Sözleşmelerden ve Raporlardan Alıntı Yapmak

Bir PDF'deki maddeyi yeniden yazarak almak, tam da hataların önem taşıdığı belge türünde yazım hatalarına davetiye çıkarır. Çıkarma size ifadeyi birebir verir — ve bir sözleşme söz konusu olduğunda dosyanın makinenizden hiç çıkmamış olması tesadüfi bir ayrıntı değildir.

Araştırma Makalesi Metnini Yeniden Kullanmak

Akademik PDF'ler bu aracın hem klasik kullanım alanı hem de klasik sınır örneğidir: metin temiz biçimde çıkar, ama iki sütunlu makaleler bildirim alır, çünkü okuma sırası gerçekten belirsizdir. Önce çıkarın, sonra elle yeniden sıralayın.

Faturalardan Veri Çekmek

Fatura kalemleri tablolarda yaşar; bunlar bir ızgara olarak değil, serbest metin olarak çıkar. Yine de yeniden yazmaktan hızlıdır ve rakamlar basıldığı hâliyle gelir.

Eski Belgeleri Yeniden Değerlendirmek

Eski bir PDF broşürünü veya kılavuzunu yeniden düzenlenebilir metne çevirmek genellikle tasarımla değil kelimelerle ilgilidir — tasarım zaten çoğunlukla değiştirilecektir.

Burada Gizlilik Neden Önemli

İnsanların metnini çıkarmayı en çok istediği belgeler — sözleşmeler, tıbbi yazışmalar, mali tablolar — yüklemeyi en az istemeleri gereken belgelerdir. Yerelde işlemek bu soruyu cevaplamak yerine ortadan kaldırır.

Bunun Yerine Ne Zaman Sunucu Tabanlı Bir Dönüştürücü Kullanmalısınız

İhtiyacınız şuysa…Şunu kullanınNeden
Tabloların tablo olarak korunmasıAdobe, Smallpdf veya doğrudan WordDüzenin yeniden kurulmasını gerektirir
Word dosyasının PDF'ye benzemesiTicari bir dönüştürücüBiz düzeni yeniden üretmiyoruz
Taranmış bir belgeden metinBir OCR aracıOkunacak bir metin katmanı yok
Görsellerin de aktarılmasıTicari bir dönüştürücüBurada çıkarılmıyor
Yalnızca kelimeler, gizlilik içindeBu araçHiçbir dosya yüklenmez
Metni düzenleyip yeniden alıntılamakBu araçMetin ve temel yapı yeterli

PDF Word'den Sonra: Düzenleyin, Geri Çevirin, Paylaşın

PDF'den Word'e geçmek nadiren son adımdır. Metin Word'e girdikten ve siz düzenlemenizi yaptıktan sonra onu geri çevirmek doğal bir sonraki adımdır — Word PDF dönüştürücümüz de tamamen tarayıcınızda çalışır, dolayısıyla bu gidiş dönüş hiçbir sunucuya uğramaz.

Kaynak malzemeniz birkaç PDF'ye dağılmışsa, önce birleştirin ve tek seferde çıkarın; birkaç kez çıkarıp sonuçları Word'de dikmek yerine.

Buradaki her şey aynı kurala uyar: dosyalarınız kendi makinenizde kalır. Setin geri kalanı ücretsiz PDF araçları sayfamızda, görsel araçları ise tüm ücretsiz tarayıcı araçlarımız sayfasında.

Why PDF to Word conversion has to reverse-engineer structureA Word file records that a block of text is a heading followed by a paragraph. A PDF records only that individual characters are drawn at particular coordinates, so paragraphs and headings must be inferred from position and size.What a Word file storesHeading 1"Quarterly Report"Paragraph"Revenue grew across every""segment during the period."List item"North region led growth"Structure is recordedNothing has to be guessedWhat a PDF storesTf /F2 22Td 72 782 · Tj "Quarterly"Td 196 782 · Tj "Report"Tf /F1 11Td 72 742 · Tj "Revenue grew"Td 178 742 · Tj "across every"Td 72 726 · Tj "segment during"Td 86 690 · Tj "•"Td 98 690 · Tj "North region led"Only glyphs and coordinatesParagraphs must be inferred
Bir Word dosyası, bir şeyin başlık olduğunu kaydeder. Bir PDF ise yalnızca karakterlerin hangi koordinatlara çizildiğini kaydeder — yapının tahmin edilmek zorunda olmasının nedeni budur.

Üç adım, hesap yok, yükleme yok

Step one: drop a PDF onto the page.pdf
1

Bir PDF bırakın. Dosya yerel olarak, tarayıcınızın içinde okunur.

Step two: compare the original page with what was extractedOriginalExtracted
2

İndirmeye karar vermeden önce gerçekte neyin kurtarıldığına bakın.

Step three: download the editable Word documentDOCX
3

Her yerde düzenleyebileceğiniz standart bir .docx dışa aktarın.

Bu çıkarıcı neyi kurtarır, neyi tahmin eder, neyi yapamaz

Çoğu dönüştürücü, sanki çıktı orijinaliyle örtüşecekmiş gibi anlatır kendini. Bu araç örtüştürmeyecek ve aksini iddia etmek yalnızca vaktinizi çalar. İşte gerçek döküm.

What this extractor recovers, guesses, and cannot doReliably extracted: body text, reading order in single-column documents, bold and italic, and hyperlink text. Inferred and possibly wrong: heading levels, paragraph boundaries, lists, and multi-column reading order. Not supported: tables as tables, images, headers and footers, and scanned pages, which need OCR.Reliably extractedBody textReading order (single column)Bold and italicHyperlink textInferred — may be wrong?Heading levels?Paragraph boundaries?Bulleted and numbered lists?Multi-column orderNot supportedTables as tablesImagesHeaders and footersScanned pages (no OCR)
A text-layer PDF versus a scanned PDFA text-layer PDF contains selectable characters and can be extracted. A scanned PDF contains only a photograph of text, so without OCR there is nothing to extract.Text-layer PDFCharacters are selectableExtractableText, order,bold and italicScanned PDFJust a picture of textNeeds OCRWe detect thisand tell you
Taranmış PDF'ler metin değil, metnin görüntüsünü içerir. Bunu dosya bırakıldığı anda tespit eder ve size boş bir belge vermek yerine durumu söyleriz.

PDF Word Dönüştürücü — Sıkça Sorulan Sorular

Evet, hiçbir sınır olmadan. Çıkarma kendi donanımınızda çalışır, dolayısıyla size yansıtılacak bir dosya başına maliyet yoktur. Günlük kota yok, filigran yok, ücretli paket yok.

Hayır. PDF tarayıcı belleğine okunur ve .docx de orada yazılır. Geliştirici araçlarını açıp çıkarma sırasında Network sekmesini izleyin — hiçbir şey gönderilmiyor.

Çünkü bir tarama metin değil, metnin resmini içerir ve bunu okumak OCR gerektirir; bu tarayıcı tabanlı araçta ise OCR yoktur. Taramaları siz dosyayı bıraktığınızda tespit eder ve dışa aktarmadan önce size söyleriz; böylece merakta kalmazsınız. O belgeler için bir OCR aracı kullanın.

Hayır ve bunu, siz indirdikten sonra fark edin diye susmaktansa açıkça söylemeyi tercih ederiz. Buradaki PDF Word dönüşümü tasarım değil, metin demektir. Bu bir metin çıkarıcıdır: kelimeleri, okuma sırasını, kalın ve italik biçimleri, bir de tahmin edilmiş başlık ve listeleri alırsınız. Sayfa düzeni, yazı tipleri, tablolar ve görseller yeniden üretilmez.

Hayır. Tablo hücreleri Word tablosu olarak değil, okuma sırasına göre serbest metin olarak çıkar. Tablo yapısını harf koordinatlarından yeniden kurmak öylesine güvenilmezdir ki, size yeniden düzenleyebileceğiniz bir metin vermek, ustaca yanlış olan bir tablo vermekten daha faydalıdır.

Evet. Çıkarma işlemi belgenin tamamı üzerinde çalışır ve Word dosyasını oluşturmadan önce dışa aktarımı bir sayfa aralığıyla sınırlayabilirsiniz.

Adobe, PDF'den Word'e dönüşümü kendi sunucularında ticari bir motorla çalıştırır ve düzeni bizim yapabileceğimizden çok daha iyi yeniden üretir. Bunun için belgenizi yüklemenizi de gerektirir. Düzen önemliyse Adobe'yi kullanın. Kelimeler ve gizlilik önemliyse bunu kullanın.

Word, Google Docs, LibreOffice veya Pages'te düzenleyin — elinizdeki standart bir .docx dosyası. İşiniz bittiğinde, yine tarayıcınızda çalışan Word PDF aracımızla onu tekrar PDF'ye çevirin.

T

TinyImagePro Mühendislik

Verilerinizi hiçbir zaman yüklemeyen, tarayıcı tabanlı dosya araçları geliştiriyoruz. Bu PDF Word çıkarıcı, metin katmanını okumak için pdf.js'i, paragraf ve başlıkları harf koordinatlarından yeniden kurmak için bu iş için özel geliştirilmiş bir tahmin katmanını ve Word dosyasını yazmak için docx kitaplığını kullanır — hepsi sizin makinenizde.

TinyImagePro Hakkında
PDF Word — Tarayıcınızda Metin Çıkarma | TinyImagePro