PDF to Word कन्वर्ज़न जितना दिखता है उससे कठिन क्यों है
Word को PDF बनाना रेंडरिंग की समस्या है: बताया हुआ लेआउट लो और बना दो। PDF to Word इसका उलटा है, और उलटा रास्ता बराबर का नहीं होता। उधर से लौटना पुनर्निर्माण की समस्या है, और पुनर्निर्माण बनाने से कहीं कठिन है।
PDF में वाक्य नहीं, ग्लिफ़ रखे होते हैं
PDF फ़ाइल में पैराग्राफ़ या हेडिंग दर्ज नहीं होते। उसमें अलग-अलग अक्षरों को तय निर्देशांकों पर बनाने के निर्देश दर्ज होते हैं — इसीलिए PDF को Word बनाने का मतलब है स्थिति के डेटा से बनावट को रिवर्स-इंजीनियर करना।
Word फ़ाइल कहती है — "यह Heading 1 है जिसमें Quarterly Report लिखा है"। PDF कहती है — "फ़ॉन्ट F2 को 22 पॉइंट पर सेट करो, x=72 y=782 पर जाओ, Q-u-a-r-t-e-r-l-y ग्लिफ़ दिखाओ"। फ़ाइल में कहीं नहीं लिखा कि यह हेडिंग है। यह इसी बात से निकालना पड़ता है कि वह अपने आसपास की हर चीज़ से बड़ी है।
पैराग्राफ़ को रिवर्स-इंजीनियर क्यों करना पड़ता है
टेक्स्ट निर्देशांकों पर बिखरे टुकड़ों के रूप में मिलता है — अक्सर शब्द के बीच में टूटा हुआ, और कई बार शब्दों के बीच की स्पेस पूरी तरह ग़ायब। पढ़ने लायक़ गद्य वापस पाने का मतलब है टुकड़ों को उनकी ऊँचाई के हिसाब से लाइनों में जोड़ना, जहाँ आड़ा फ़ासला इशारा करे वहाँ स्पेस डालना, और फिर तय करना कि कौन-सी लाइन ब्रेक सिर्फ़ रैप है और कौन-सी पैराग्राफ़ की सीमा।
इनमें से हर क़दम एक ह्यूरिस्टिक है। हमारे तरीक़े दस्तावेज़ीकृत और टेस्ट किए हुए हैं, फिर भी हैं अनुमान ही — और यह पेज बताता है कि नतीजे के कौन-से हिस्से अनुमान हैं, सबको तथ्य बनाकर पेश नहीं करता।
स्कैन किए डॉक्युमेंट की समस्या
स्कैन की हुई PDF में टेक्स्ट नहीं, टेक्स्ट की तस्वीरें होती हैं। OCR के बिना कोई भी पार्सिंग शब्द वापस नहीं ला सकती।
किसी भी PDF to Word कन्वर्टर से जुड़ी यही सबसे आम निराशा है, और यही वजह है कि इतने लोग मान बैठते हैं कि ये टूल चलते ही नहीं। आप सहकर्मी का स्कैन किया कॉन्ट्रैक्ट डालते हैं, और बदले में ख़ाली Word फ़ाइल मिलती है — आमतौर पर बिना किसी सफ़ाई के।
OCR क्या करता है और यह टूल उसके बिना क्यों है
ऑप्टिकल कैरेक्टर रिकग्निशन तस्वीर देखकर पता लगाता है कि कौन-सी आकृति कौन-सा अक्षर है। यह टेक्स्ट लेयर पढ़ने से बिलकुल अलग तकनीक है, तुलना में धीमी है, और ब्राउज़र-आधारित संस्करण का मतलब होता हर विज़िटर को एक रिकग्निशन मॉडल भेजना।
इसलिए हम उससे अगली सबसे अच्छी चीज़ करते हैं: स्थिति को पहचानकर साफ़-साफ़ कह देते हैं — फ़ाइल छोड़ने के बाद जो पहली चीज़ आप देखते हैं, उसी में। पहचान इस बात का भी ध्यान रखती है कि स्कैन किए पेज पूरी तरह ख़ाली कम ही होते हैं — स्कैनर पेज नंबर छाप देते हैं और अधूरा OCR मलबा छोड़ जाता है — इसलिए मुट्ठी भर अक्षरों वाला पेज टेक्स्ट नहीं, स्कैन माना जाता है।
यह PDF to Word टूल असल में क्या करता है
यह टेक्स्ट एक्सट्रैक्टर है, लेआउट कन्वर्टर नहीं। यह PDF से शब्द निकालकर संपादन योग्य Word फ़ाइल बनाता है। मूल पेज का डिज़ाइन दोबारा नहीं बनाता।
टेक्स्ट निकालना बनाम लेआउट बदलना
PDF to Word से लोगों के दो बिलकुल अलग मतलब होते हैं। लेआउट कन्वर्ज़न डॉक्युमेंट को दोबारा खड़ा करने की कोशिश करता है: टेबल को टेबल, कॉलम को कॉलम, तस्वीरें अपनी जगह पर। इसके लिए या तो कमर्शियल इंजन चाहिए या भारी सर्वर-साइड मशीनरी — और अच्छे कार्यान्वयन सब सर्वर-साइड ही हैं।
टेक्स्ट निकालना शब्द, पढ़ने का क्रम, और जितनी बुनियादी बनावट भरोसे से अनुमानित हो सके — उतना लेता है। बहुत सारे असली कामों के लिए — कोई धारा उद्धृत करनी हो, कोई पैराग्राफ़ दोबारा इस्तेमाल करना हो, रिपोर्ट से आँकड़े निकालने हों — यही पूरा काम है।
यह किसके लिए है — और किसके लिए नहीं
इसे इस्तेमाल करें अगर आपको PDF से टेक्स्ट चाहिए — एडिट करने, उद्धृत करने या दोबारा इस्तेमाल करने के लिए — और आप नहीं चाहते कि आपका डॉक्युमेंट किसी अनजान के सर्वर पर अपलोड हो।
इसे इस्तेमाल न करें अगर आपको Word फ़ाइल का PDF जैसा दिखना ज़रूरी है, डॉक्युमेंट टेबल से भरा है, या वह स्कैन है। ये स्थितियाँ आगे बताई गई हैं — साथ में यह भी कि उनकी जगह क्या इस्तेमाल करें।
तीन कदम में PDF से टेक्स्ट कैसे निकालें
अपनी PDF छोड़ें
ऊपर बने बॉक्स में PDF खींचकर छोड़ें, या क्लिक करके चुनें। वह डिस्क से सीधे आपके ब्राउज़र में पढ़ी जाती है — कोई अपलोड नहीं है, इसलिए बड़ा डॉक्युमेंट भी कनेक्शन का इंतज़ार किए बिना तुरंत शुरू हो जाता है।
एक्सट्रैक्शन प्रीव्यू जाँचें
फ़ाइल पढ़ते ही आप देख लेते हैं कि असल में क्या मिला, कितनी हेडिंग और लिस्ट आइटम अनुमान से बने, और कोई पेज स्कैन या मल्टी-कॉलम तो नहीं लगता। यह जान-बूझकर डाउनलोड से पहले है — ताकि जो फ़ाइल कभी काम की थी ही नहीं, उस पर समय गँवाए बिना आप लौट सकें।
अपनी DOCX डाउनलोड करें
सामान्य Word फ़ाइल एक्सपोर्ट करें जो Word, Google Docs, LibreOffice या Pages में खुलती है। अगर अनुमानित हेडिंग ग़लत लगें, तो प्लेन-टेक्स्ट मोड चालू करके दोबारा एक्सपोर्ट करें — एक सेकंड लगता है और हर तरह की व्याख्या छोड़ देता है।
PDF to Word एक्सट्रैक्शन क्या पाता है — और क्या नहीं
हर PDF to Word टूल यह रेखा कहीं न कहीं खींचता है। ज़्यादातर बस कभी नहीं दिखाते कि कहाँ।
भरोसे से निकल आता है
बॉडी टेक्स्ट। पढ़ने का क्रम — एक-कॉलम वाले डॉक्युमेंट के लिए। बोल्ड और इटैलिक, जो एम्बेडेड फ़ॉन्ट के नामों से निकाले जाते हैं। हाइपरलिंक का दिखने वाला टेक्स्ट।
सामान्य रिपोर्ट, पत्र या लेख के लिए यही व्यावहारिक रूप से पूरी सामग्री है।
अनुमानित — और कभी-कभी ग़लत
हेडिंग के स्तर, पैराग्राफ़ की सीमाएँ, और बुलेट या नंबर वाली लिस्ट। ये फ़ाइल से पढ़े नहीं जाते, ज्यामिति से निकाले जाते हैं — और प्रीव्यू ठीक इसी वजह से इन्हें "अनुमानित" के रूप में चिह्नित करता है।
फ़ॉन्ट साइज़ से हेडिंग के स्तर का अनुमान कैसे लगता है
हम डॉक्युमेंट में सबसे आम ग्लिफ़ ऊँचाई को बॉडी साइज़ मानते हैं, फिर उससे साफ़ तौर पर बड़ी हर चीज़ को ऊपर उठाते हैं: 1.6× या ज़्यादा Heading 1 बनता है, 1.35× Heading 2, 1.15× Heading 3।
औसत नहीं, सबसे आम साइज़ — जान-बूझकर। औसत को बड़ा टाइटल ऊपर खींच लेता है, और फिर वही टाइटल हेडिंग के रूप में पहचाना ही नहीं जाता। आधार रेखा भी पूरे डॉक्युमेंट पर निकाली जाती है, ताकि पूरा बड़े अक्षरों में सेट टाइटल पेज अपने बाद के हर पेज को न बिगाड़े।
जो डॉक्युमेंट हेडिंग को साइज़ के बजाय मोटाई या रंग से दिखाते हैं, उनकी हेडिंग नहीं पहचानी जाएगी। यह असली सीमा है — और प्लेन-टेक्स्ट मोड इसी के लिए है।
समर्थित नहीं
टेबल टेबल के रूप में नहीं, बिखरे टेक्स्ट के रूप में निकलती हैं। तस्वीरें आगे नहीं जातीं। हेडर, फ़ुटर और पेज नंबर जहाँ थे वहीं सामान्य टेक्स्ट बनकर निकल आते हैं। सटीक लेआउट, स्थिति, फ़ॉन्ट और साइज़ बिलकुल भी दोबारा नहीं बनते।
टेबल, तस्वीरें और स्कैन किए पेज
मल्टी-कॉलम पेज चुपचाप गड्डमड्ड करने के बजाय पहचानकर चिह्नित किए जाते हैं, क्योंकि कॉलम के बीच पढ़ने का क्रम सचमुच अस्पष्ट है — दो-कॉलम का शोध पत्र हर कॉलम में नीचे तक या पूरे पेज पर आर-पार, दोनों तरह पढ़ा जा सकता है, और फ़ाइल यह बताती नहीं कि कौन-सा सही है।
स्कैन किए पेज से कुछ नहीं निकलता, और एक्सपोर्ट से पहले ही यह बता दिया जाता है।
एक नज़र में एक्सट्रैक्शन क्षमता
| विशेषता | स्थिति | टिप्पणी |
|---|---|---|
| बॉडी टेक्स्ट | भरोसेमंद | टेक्स्ट लेयर से निकाला जाता है |
| पढ़ने का क्रम (एक कॉलम) | भरोसेमंद | लाइन की स्थिति से समूहित |
| बोल्ड और इटैलिक | भरोसेमंद | एम्बेडेड फ़ॉन्ट के नामों से निकाला जाता है |
| हाइपरलिंक का टेक्स्ट | भरोसेमंद | दिखने वाला टेक्स्ट, निशाना नहीं |
| हेडिंग के स्तर | अनुमानित | सापेक्ष फ़ॉन्ट साइज़ से; ग़लत हो सकते हैं |
| पैराग्राफ़ की सीमाएँ | अनुमानित | लाइनों के बीच के खड़े फ़ासले से |
| बुलेट और नंबर वाली लिस्ट | अनुमानित | शुरुआती चिह्नों और इंडेंट से |
| मल्टी-कॉलम पढ़ने का क्रम | अनुमानित | पहचानकर चिह्नित, दोबारा क्रमबद्ध नहीं |
| टेबल | समर्थित नहीं | बिखरे टेक्स्ट के रूप में निकलती हैं |
| तस्वीरें | समर्थित नहीं | Word फ़ाइल में नहीं ले जाई जातीं |
| हेडर और फ़ुटर | समर्थित नहीं | सामान्य टेक्स्ट के रूप में दिखते हैं |
| पेज लेआउट और फ़ॉन्ट | समर्थित नहीं | दोबारा नहीं बनाए जाते |
| स्कैन किए पेज | समर्थित नहीं | OCR चाहिए; पहचानकर बता दिया जाता है |
PDF to Word एक्सट्रैक्शन से आप क्या कर सकते हैं
PDF to Word एक्सट्रैक्शन के यथार्थवादी उपयोगों का ढाँचा एक ही है: आपको शब्द चाहिए, डिज़ाइन नहीं।
कॉन्ट्रैक्ट और रिपोर्ट से उद्धरण
PDF से कोई सटीक धारा दोबारा टाइप करके निकालना ठीक उसी तरह के डॉक्युमेंट में टाइपिंग की ग़लतियाँ बुलाता है जहाँ ग़लतियाँ सबसे ज़्यादा मायने रखती हैं। एक्सट्रैक्शन आपको शब्दशः वही पाठ देता है — और कॉन्ट्रैक्ट के लिए यह बात कि वह आपकी मशीन से कभी बाहर नहीं गया, कोई छोटी बात नहीं।
शोध पत्र का टेक्स्ट दोबारा इस्तेमाल करना
अकादमिक PDF इस टूल का क्लासिक मामला हैं — और इसकी सीमाओं का भी: टेक्स्ट साफ़ निकल आता है, लेकिन दो-कॉलम के पेपर चिह्नित किए जाएँगे, क्योंकि पढ़ने का क्रम सचमुच अस्पष्ट है। निकालें, फिर हाथ से क्रम ठीक करें।
इनवॉइस से डेटा निकालना
इनवॉइस की लाइन आइटम टेबल में रहती हैं, जो ग्रिड के बजाय बिखरे टेक्स्ट के रूप में निकलती हैं। फिर भी दोबारा टाइप करने से तेज़ — और अंक ठीक वैसे ही आते हैं जैसे छपे थे।
पुराने डॉक्युमेंट का पुनर्प्रयोग
पुराने PDF ब्रोशर या मैनुअल को वापस संपादन योग्य कॉपी बनाना आमतौर पर शब्दों की बात है, डिज़ाइन की नहीं — डिज़ाइन तो वैसे भी बदला जा रहा होता है।
यहाँ प्राइवेसी क्यों मायने रखती है
जिन डॉक्युमेंट से लोग सबसे ज़्यादा टेक्स्ट निकालना चाहते हैं — कॉन्ट्रैक्ट, मेडिकल पत्र, वित्तीय विवरण — वही डॉक्युमेंट हैं जिन्हें उन्हें सबसे कम अपलोड करना चाहिए। लोकल प्रोसेसिंग इस सवाल का जवाब नहीं देती, सवाल को ही हटा देती है।
सर्वर-आधारित कन्वर्टर कब इस्तेमाल करना चाहिए
| अगर आपको चाहिए… | इस्तेमाल करें | क्यों |
|---|---|---|
| टेबल, टेबल के रूप में सुरक्षित | Adobe, Smallpdf, या ख़ुद Word | लेआउट का पुनर्निर्माण चाहिए |
| Word फ़ाइल का PDF जैसा दिखना | कोई कमर्शियल कन्वर्टर | हम लेआउट दोबारा नहीं बनाते |
| स्कैन किए डॉक्युमेंट से टेक्स्ट | कोई OCR टूल | पढ़ने के लिए टेक्स्ट लेयर है ही नहीं |
| तस्वीरें साथ ले जाना | कोई कमर्शियल कन्वर्टर | यहाँ नहीं निकाली जातीं |
| सिर्फ़ शब्द, निजी तौर पर | यह टूल | कुछ भी अपलोड नहीं होता |
| टेक्स्ट एडिट और दोबारा उद्धृत करना | यह टूल | टेक्स्ट और बुनियादी बनावट काफ़ी है |
PDF to Word के बाद: एडिट करें, वापस बदलें, शेयर करें
PDF to Word शायद ही कभी आख़िरी क़दम होता है। टेक्स्ट Word में आ जाए और आप उसे एडिट कर लें, तो उसे वापस बदलना ही स्वाभाविक अगला क़दम है — हमारा Word to PDF कन्वर्टर भी पूरी तरह आपके ब्राउज़र में चलता है, इसलिए यह पूरा चक्कर किसी सर्वर को छुए बिना पूरा होता है।
अगर आपकी सामग्री कई PDF में बँटी है, तो पहले उन्हें मर्ज करें और एक ही बार निकालें — कई बार निकालकर नतीजों को Word में जोड़ने के बजाय।
यहाँ हर चीज़ एक ही सिद्धांत पर चलती है: आपकी फ़ाइलें आपकी ही मशीन पर रहती हैं। बाक़ी सेट हमारे मुफ़्त PDF टूल पेज पर है, और इमेज टूल हमारे सभी मुफ़्त ब्राउज़र टूल पर।