Text being extracted from a PDF into a Word documentDOCX

PDF เป็น Word — ดึงข้อความที่แก้ไขได้ โดยไม่ต้องอัปโหลดไฟล์

ดึงข้อความจาก PDF ออกมาเป็นไฟล์ .docx ที่คุณแก้ไขได้ ทำงานทั้งหมดในเบราว์เซอร์ของคุณ เครื่องมือนี้ไม่จำลองเลย์เอาต์ต้นฉบับ และบอกไว้ชัดเจนก่อนคุณดาวน์โหลด

🔒 ทำงานในเบราว์เซอร์ 100%📝 ดึงเฉพาะข้อความ🔍 ตรวจจับไฟล์สแกน ไม่ต้องสมัคร
🔒

PDF ของคุณไม่เคยถูกอัปโหลด

ทั้งการแยกวิเคราะห์และการเขียนไฟล์ .docx เกิดขึ้นในเบราว์เซอร์ของคุณ ไม่มีสำเนาบนเซิร์ฟเวอร์ที่ต้องรอให้ลบ และไม่มีระยะเวลาเก็บข้อมูลที่คุณต้องเชื่อใจ

🔍

ตรวจจับไฟล์สแกนตั้งแต่ต้น

ไฟล์สแกนไม่มีข้อความให้ดึงหากไม่ใช้ OCR เราตรวจตั้งแต่ตอนวางไฟล์และบอกทันที แทนที่จะสร้างไฟล์ Word เปล่าโดยไม่มีคำอธิบาย

👁️

เห็นก่อนดาวน์โหลด

ต่างจากเครื่องมือ PDF เป็น Word ทุกตัวที่เราสำรวจ ตัวอย่างจะแสดงสิ่งที่กู้คืนได้จริง พร้อมระบุว่ามีหัวข้อและรายการกี่รายการที่ได้จากการอนุมาน ไม่ใช่อ่านจากไฟล์

📄

โหมดข้อความล้วน

การอนุมานโครงสร้างอาจพลาดได้ คลิกเดียวก็ปิดทั้งหมด แล้วได้ข้อความไหลต่อเนื่องสะอาด ๆ โดยไม่มีหัวข้อที่ถูกยกระดับผิด ๆ

ทำไมการแปลง PDF เป็น Word จึงยากกว่าที่คิด

การแปลง Word เป็น PDF เป็นโจทย์การเรนเดอร์: นำเลย์เอาต์ที่ถูกอธิบายไว้มาวาด แต่ PDF เป็น Word คือทางกลับ และทางกลับไม่ได้สมมาตร การเดินย้อนกลับเป็นโจทย์การสร้างขึ้นใหม่ ซึ่งยากกว่าการวาดมาก

PDF เก็บตัวอักษร ไม่ใช่ประโยค

ไฟล์ PDF ไม่บันทึกย่อหน้าหรือหัวข้อ มันบันทึกคำสั่งวาดตัวอักษรแต่ละตัวที่พิกัดเฉพาะ นี่คือเหตุผลที่การแปลง PDF เป็น Word หมายถึงการวิศวกรรมย้อนกลับโครงสร้างจากข้อมูลตำแหน่ง

ไฟล์ Word บอกว่า “นี่คือ Heading 1 ที่มีข้อความว่า Quarterly Report” ส่วน PDF บอกว่า “ตั้งฟอนต์ F2 ขนาด 22 พอยต์ ย้ายไปที่ x=72 y=782 แสดงตัวอักษร Q-u-a-r-t-e-r-l-y” ไม่มีอะไรในไฟล์ระบุว่านี่คือหัวข้อ ต้องอนุมานเอาจากข้อเท็จจริงที่ว่ามันใหญ่กว่าทุกอย่างรอบตัว

ทำไมย่อหน้าต้องถูกวิศวกรรมย้อนกลับ

ข้อความมาถึงเป็นชิ้นส่วนที่พิกัดต่าง ๆ มักถูกตัดกลางคำ และบ่อยครั้งไม่มีช่องว่างระหว่างคำเลย การกู้คืนให้เป็นร้อยแก้วที่อ่านได้จึงต้องจับกลุ่มชิ้นส่วนเป็นบรรทัดตามตำแหน่งแนวตั้ง แทรกช่องว่างตรงจุดที่ช่องไฟแนวนอนบ่งบอก แล้วตัดสินว่าการขึ้นบรรทัดใดเป็นการตัดคำ และอันใดเป็นขอบเขตย่อหน้า

ทุกขั้นตอนเหล่านี้คือฮิวริสติก ของเรามีเอกสารกำกับและผ่านการทดสอบ แต่ก็ยังเป็นการเดาอยู่ดี และหน้านี้จะระบุว่าส่วนไหนของผลลัพธ์เป็นการเดา แทนที่จะนำเสนอทั้งหมดราวกับเป็นข้อเท็จจริง

ปัญหาเอกสารสแกน

PDF ที่สแกนมาบรรจุภาพของข้อความ ไม่ใช่ข้อความ หากไม่มี OCR การแยกวิเคราะห์มากแค่ไหนก็กู้คืนคำไม่ได้

นี่คือความผิดหวังที่พบบ่อยที่สุดกับเครื่องมือแปลง PDF เป็น Word ทุกตัว และเป็นเหตุผลที่หลายคนสรุปว่าเครื่องมือพวกนี้ใช้ไม่ได้เลย คุณวางสัญญาที่เพื่อนร่วมงานสแกนมา แล้วได้ไฟล์ Word เปล่ากลับไป — และมักไม่มีคำอธิบายใด ๆ ด้วยซ้ำ

OCR ทำอะไร และทำไมเครื่องมือนี้ไม่มี

การรู้จำตัวอักษร (OCR) มองที่ภาพแล้วคำนวณว่ารูปร่างไหนคือตัวอักษรอะไร มันเป็นเทคโนโลยีคนละอย่างกับการอ่านชั้นข้อความจริง ๆ ทำงานช้ากว่าเมื่อเทียบกัน และเวอร์ชันในเบราว์เซอร์จะหมายถึงการส่งโมเดลรู้จำให้ผู้เยี่ยมชมทุกคน

เราจึงทำสิ่งที่ดีที่สุดรองลงมา: ตรวจจับสถานการณ์นี้และบอกอย่างตรงไปตรงมา ตั้งแต่สิ่งแรกที่คุณเห็นหลังวางไฟล์ การตรวจจับคำนึงถึงข้อเท็จจริงที่ว่าหน้าสแกนแทบไม่เคยว่างสนิท — เครื่องสแกนประทับเลขหน้า และ OCR บางส่วนทิ้งเศษข้อความไว้ — หน้าที่มีตัวอักษรเพียงหยิบมือจึงถูกจัดเป็นภาพสแกน ไม่ใช่ข้อความ

เครื่องมือ PDF เป็น Word นี้ทำอะไรกันแน่

นี่คือตัวดึงข้อความ ไม่ใช่ตัวแปลงเลย์เอาต์ มันกู้คืนคำจาก PDF ลงในไฟล์ Word ที่แก้ไขได้ แต่ไม่จำลองการออกแบบหน้ากระดาษต้นฉบับ

การดึงข้อความ กับ การแปลงเลย์เอาต์

สองสิ่งที่คนหมายถึงเมื่อพูดว่า PDF เป็น Word นั้นต่างกันมาก การแปลงเลย์เอาต์พยายามสร้างเอกสารขึ้นใหม่ ตารางเป็นตาราง คอลัมน์เป็นคอลัมน์ รูปภาพอยู่ตำแหน่งเดิม ซึ่งต้องใช้เอนจินเชิงพาณิชย์หรือระบบฝั่งเซิร์ฟเวอร์ขนาดใหญ่ และตัวที่ทำได้ดีล้วนเป็นฝั่งเซิร์ฟเวอร์ทั้งสิ้น

การดึงข้อความนำคำ ลำดับการอ่าน และโครงสร้างพื้นฐานเท่าที่อนุมานได้อย่างมั่นใจออกมา สำหรับงานจริงจำนวนมาก — อ้างอิงข้อสัญญา นำย่อหน้าไปใช้ต่อ ดึงตัวเลขออกจากรายงาน — แค่นี้ก็คืองานทั้งหมดแล้ว

เหมาะกับใคร — และไม่เหมาะกับใคร

ใช้เครื่องมือนี้หากคุณต้องการข้อความจาก PDF ไปแก้ไข อ้างอิง หรือนำไปใช้ต่อ และไม่อยากให้เอกสารถูกอัปโหลดไปเซิร์ฟเวอร์ของคนแปลกหน้า

อย่าใช้เครื่องมือนี้หากคุณต้องการให้ไฟล์ Word หน้าตาเหมือน PDF หากเอกสารเต็มไปด้วยตาราง หรือหากเป็นไฟล์สแกน กรณีเหล่านี้มีอธิบายไว้ด้านล่าง พร้อมทางเลือกที่ควรใช้แทน

วิธีดึงข้อความจาก PDF ใน 3 ขั้นตอน

1

วางไฟล์ PDF ของคุณ

ลาก PDF มาวางในกรอบด้านบน หรือคลิกเพื่อเลือกไฟล์ ระบบอ่านไฟล์จากดิสก์เข้าเบราว์เซอร์โดยตรง — ไม่มีการอัปโหลด เอกสารขนาดใหญ่จึงเริ่มทำงานทันทีโดยไม่ต้องรอความเร็วอินเทอร์เน็ต

2

ตรวจดูตัวอย่างผลการดึงข้อความ

ทันทีที่ไฟล์ถูกอ่าน คุณจะเห็นว่ากู้คืนอะไรได้จริง มีหัวข้อและรายการกี่รายการที่ได้จากการอนุมาน และมีหน้าไหนดูเป็นภาพสแกนหรือหลายคอลัมน์บ้าง ทั้งหมดนี้ตั้งใจให้อยู่ก่อนการดาวน์โหลด คุณจึงเดินจากไปได้เลยโดยไม่เสียเวลากับไฟล์ที่ยังไงก็ใช้ไม่ได้

3

ดาวน์โหลดไฟล์ DOCX ของคุณ

ส่งออกเป็นไฟล์ Word มาตรฐานที่เปิดได้ใน Word, Google Docs, LibreOffice หรือ Pages หากหัวข้อที่อนุมานมาดูผิด ให้เปิดโหมดข้อความล้วนแล้วส่งออกใหม่ — ใช้เวลาแค่วินาทีเดียวและข้ามการตีความทั้งหมด

การดึงข้อความ PDF เป็น Word ได้อะไร — และไม่ได้อะไร

เครื่องมือ PDF เป็น Word ทุกตัวขีดเส้นนี้ไว้ที่ไหนสักแห่ง แต่ส่วนใหญ่ไม่เคยแสดงให้คุณเห็นว่าขีดตรงไหน

ดึงได้อย่างน่าเชื่อถือ

เนื้อความ ลำดับการอ่านสำหรับเอกสารคอลัมน์เดียว ตัวหนาและตัวเอียงซึ่งอนุมานจากชื่อฟอนต์ที่ฝังอยู่ และข้อความที่มองเห็นของไฮเปอร์ลิงก์

สำหรับรายงาน จดหมาย หรือบทความทั่วไป นี่คือเนื้อหาแทบทั้งหมดแล้ว

อนุมานเอา — และบางครั้งผิด

ระดับหัวข้อ ขอบเขตย่อหน้า และรายการแบบสัญลักษณ์หรือตัวเลข สิ่งเหล่านี้ได้จากเรขาคณิต ไม่ใช่อ่านจากไฟล์ และตัวอย่างจะติดป้ายว่าเป็นการอนุมานด้วยเหตุผลนี้เอง

ระดับหัวข้อถูกเดาจากขนาดฟอนต์อย่างไร

เราใช้ความสูงตัวอักษรที่พบบ่อยที่สุดในเอกสารเป็นขนาดเนื้อความ แล้วยกระดับสิ่งที่ใหญ่กว่าอย่างมีนัยสำคัญ: 1.6 เท่าขึ้นไปเป็น Heading 1, 1.35 เท่าเป็น Heading 2, 1.15 เท่าเป็น Heading 3

ที่ใช้ขนาดที่พบบ่อยที่สุดแทนค่าเฉลี่ยนั้นตั้งใจ — ค่าเฉลี่ยจะถูกชื่อเรื่องตัวใหญ่ดึงขึ้น ซึ่งจะทำให้ชื่อเรื่องนั้นไม่ถูกรู้จำเป็นหัวข้อเลย เส้นฐานยังคำนวณจากทั้งเอกสาร หน้าปกที่ใช้ตัวอักษรใหญ่ทั้งหน้าจึงไม่บิดเบือนทุกหน้าที่ตามมา

เอกสารที่บ่งบอกหัวข้อด้วยน้ำหนักหรือสีแทนขนาด จะตรวจหัวข้อไม่พบ นี่คือข้อจำกัดจริง และโหมดข้อความล้วนมีไว้เพื่อกรณีนี้

ไม่รองรับ

ตารางออกมาเป็นข้อความกระจัดกระจาย ไม่ใช่ตาราง รูปภาพไม่ถูกนำไปด้วย หัวกระดาษ ท้ายกระดาษ และเลขหน้าถูกดึงออกมาเป็นข้อความธรรมดาตรงตำแหน่งที่มันอยู่ ส่วนเลย์เอาต์ ตำแหน่ง ฟอนต์ และขนาดที่แม่นยำจะไม่ถูกจำลองเลย

ตาราง รูปภาพ และหน้าสแกน

หน้าหลายคอลัมน์จะถูกตรวจพบและแจ้งเตือน แทนที่จะสลับบรรทัดกันแบบเงียบ ๆ เพราะลำดับการอ่านข้ามคอลัมน์นั้นกำกวมจริง ๆ — บทความวิชาการสองคอลัมน์อ่านไล่ลงทีละคอลัมน์หรืออ่านขวางทั้งหน้าก็ได้ และไฟล์ไม่ได้บอกว่าแบบไหน

หน้าสแกนจะไม่ได้อะไรออกมาเลย และถูกรายงานไว้เช่นนั้นก่อนคุณส่งออก

สรุปความสามารถในการดึงข้อความ

รายการสถานะหมายเหตุ
เนื้อความน่าเชื่อถือกู้คืนจากชั้นข้อความ
ลำดับการอ่าน (คอลัมน์เดียว)น่าเชื่อถือจับกลุ่มตามตำแหน่งบรรทัด
ตัวหนาและตัวเอียงน่าเชื่อถืออนุมานจากชื่อฟอนต์ที่ฝังอยู่
ข้อความไฮเปอร์ลิงก์น่าเชื่อถือข้อความที่มองเห็น ไม่ใช่ปลายทาง
ระดับหัวข้ออนุมานจากขนาดฟอนต์สัมพัทธ์ อาจผิดได้
ขอบเขตย่อหน้าอนุมานจากช่องว่างแนวตั้งระหว่างบรรทัด
รายการสัญลักษณ์และตัวเลขอนุมานจากเครื่องหมายนำและการเยื้อง
ลำดับการอ่านแบบหลายคอลัมน์อนุมานตรวจพบและแจ้งเตือน ไม่จัดเรียงใหม่
ตารางไม่รองรับออกมาเป็นข้อความกระจัดกระจาย
รูปภาพไม่รองรับไม่ถูกนำไปในไฟล์ Word
หัวกระดาษและท้ายกระดาษไม่รองรับปรากฏเป็นข้อความธรรมดา
เลย์เอาต์หน้าและฟอนต์ไม่รองรับไม่ถูกจำลอง
หน้าสแกนไม่รองรับต้องใช้ OCR; ตรวจพบและรายงาน

การดึงข้อความ PDF เป็น Word ใช้ทำอะไรได้บ้าง

การใช้งานจริงของการดึงข้อความ PDF เป็น Word ล้วนมีรูปร่างเดียวกัน: คุณต้องการคำ ไม่ใช่การออกแบบ

อ้างอิงจากสัญญาและรายงาน

การพิมพ์ข้อสัญญาจาก PDF ด้วยมือชวนให้เกิดข้อผิดพลาดจากการคัดลอก ในเอกสารประเภทที่ความผิดพลาดมีราคาแพงที่สุดพอดี การดึงข้อความให้ถ้อยคำตรงตามต้นฉบับทุกตัวอักษร — และสำหรับสัญญา การที่ไฟล์ไม่เคยออกจากเครื่องของคุณก็ไม่ใช่เรื่องบังเอิญ

นำข้อความจากงานวิจัยไปใช้ต่อ

PDF งานวิชาการคือกรณีคลาสสิกของเครื่องมือนี้ และก็เป็นกรณีคลาสสิกของข้อจำกัดด้วย: ข้อความออกมาสะอาด แต่บทความสองคอลัมน์จะถูกแจ้งเตือน เพราะลำดับการอ่านกำกวมจริง ๆ ให้ดึงออกมาก่อน แล้วจัดเรียงใหม่ด้วยตัวเอง

ดึงข้อมูลออกจากใบแจ้งหนี้

รายการในใบแจ้งหนี้อยู่ในตาราง ซึ่งจะออกมาเป็นข้อความกระจัดกระจาย ไม่ใช่ตาราง แต่ก็ยังเร็วกว่าพิมพ์ใหม่ และตัวเลขมาถึงตรงตามที่พิมพ์ไว้ทุกประการ

นำเอกสารเก่ากลับมาใช้ใหม่

การเปลี่ยนโบรชัวร์หรือคู่มือ PDF เก่าให้กลับเป็นข้อความที่แก้ไขได้ มักเป็นเรื่องของคำ ไม่ใช่การออกแบบ — เพราะการออกแบบมักถูกแทนที่อยู่แล้ว

ทำไมความเป็นส่วนตัวจึงสำคัญตรงนี้

เอกสารที่คนอยากดึงข้อความมากที่สุด — สัญญา จดหมายแพทย์ รายการเดินบัญชี — คือเอกสารที่ควรอยากอัปโหลดน้อยที่สุด การประมวลผลบนเครื่องทำให้คำถามนี้หายไปเลย แทนที่จะต้องตอบมัน

เมื่อไรควรใช้เครื่องมือแปลงฝั่งเซิร์ฟเวอร์แทน

หากคุณต้องการ…ใช้เหตุผล
ตารางที่ยังคงเป็นตารางAdobe, Smallpdf หรือ Word เองต้องสร้างเลย์เอาต์ขึ้นใหม่
ไฟล์ Word ที่หน้าตาเหมือน PDFเครื่องมือแปลงเชิงพาณิชย์เราไม่จำลองเลย์เอาต์
ข้อความจากเอกสารสแกนเครื่องมือ OCRไม่มีชั้นข้อความให้อ่าน
รูปภาพติดไปด้วยเครื่องมือแปลงเชิงพาณิชย์ที่นี่ไม่ดึงรูปภาพ
แค่คำ อย่างเป็นส่วนตัวเครื่องมือนี้ไม่มีการอัปโหลดใด ๆ
แก้ไขและอ้างอิงข้อความใหม่เครื่องมือนี้ข้อความกับโครงสร้างพื้นฐานก็เพียงพอ

หลัง PDF เป็น Word: แก้ไข แปลงกลับ และแชร์

PDF เป็น Word แทบไม่เคยเป็นขั้นตอนสุดท้าย เมื่อข้อความอยู่ใน Word และคุณแก้ไขเสร็จแล้ว การแปลงกลับคือขั้นถัดไปโดยธรรมชาติ — เครื่องมือแปลง Word เป็น PDF ของเราก็ทำงานในเบราว์เซอร์ทั้งหมดเช่นกัน การเดินทางไปกลับจึงไม่แตะเซิร์ฟเวอร์เลย

หากต้นฉบับของคุณกระจายอยู่ในหลาย PDF ให้รวมไฟล์ก่อนแล้วดึงครั้งเดียว ดีกว่าดึงหลายครั้งแล้วมาต่อผลลัพธ์กันเองใน Word

ทุกอย่างที่นี่ทำงานบนหลักการเดียวกัน คือไฟล์ของคุณอยู่บนเครื่องของคุณ เครื่องมือที่เหลืออยู่ที่หน้าเครื่องมือ PDF ฟรี ส่วนเครื่องมือรูปภาพอยู่ที่เครื่องมือบนเบราว์เซอร์ทั้งหมดของเรา

Why PDF to Word conversion has to reverse-engineer structureA Word file records that a block of text is a heading followed by a paragraph. A PDF records only that individual characters are drawn at particular coordinates, so paragraphs and headings must be inferred from position and size.What a Word file storesHeading 1"Quarterly Report"Paragraph"Revenue grew across every""segment during the period."List item"North region led growth"Structure is recordedNothing has to be guessedWhat a PDF storesTf /F2 22Td 72 782 · Tj "Quarterly"Td 196 782 · Tj "Report"Tf /F1 11Td 72 742 · Tj "Revenue grew"Td 178 742 · Tj "across every"Td 72 726 · Tj "segment during"Td 86 690 · Tj "•"Td 98 690 · Tj "North region led"Only glyphs and coordinatesParagraphs must be inferred
ไฟล์ Word บันทึกว่าสิ่งใดเป็นหัวข้อ ส่วน PDF บันทึกเพียงว่าตัวอักษรถูกวาดที่พิกัดใด — นี่คือเหตุผลที่ต้องเดาโครงสร้างเอา

สามขั้นตอน ไม่ต้องมีบัญชี ไม่ต้องอัปโหลด

Step one: drop a PDF onto the page.pdf
1

วางไฟล์ PDF ระบบจะอ่านบนเครื่อง ในเบราว์เซอร์ของคุณ

Step two: compare the original page with what was extractedOriginalExtracted
2

ตรวจดูว่ากู้คืนอะไรได้จริงบ้าง ก่อนตัดสินใจดาวน์โหลด

Step three: download the editable Word documentDOCX
3

ส่งออกเป็น .docx มาตรฐานที่แก้ไขได้ทุกที่

เครื่องมือนี้กู้คืนอะไรได้ เดาอะไร และทำอะไรไม่ได้

เครื่องมือแปลงส่วนใหญ่บรรยายตัวเองราวกับผลลัพธ์จะเหมือนต้นฉบับ ตัวนี้ไม่เหมือน และการแสร้งว่าเหมือนมีแต่จะเสียเวลาคุณเปล่า ๆ นี่คือรายละเอียดจริง

What this extractor recovers, guesses, and cannot doReliably extracted: body text, reading order in single-column documents, bold and italic, and hyperlink text. Inferred and possibly wrong: heading levels, paragraph boundaries, lists, and multi-column reading order. Not supported: tables as tables, images, headers and footers, and scanned pages, which need OCR.Reliably extractedBody textReading order (single column)Bold and italicHyperlink textInferred — may be wrong?Heading levels?Paragraph boundaries?Bulleted and numbered lists?Multi-column orderNot supportedTables as tablesImagesHeaders and footersScanned pages (no OCR)
A text-layer PDF versus a scanned PDFA text-layer PDF contains selectable characters and can be extracted. A scanned PDF contains only a photograph of text, so without OCR there is nothing to extract.Text-layer PDFCharacters are selectableExtractableText, order,bold and italicScanned PDFJust a picture of textNeeds OCRWe detect thisand tell you
PDF ที่สแกนมาบรรจุภาพของข้อความ ไม่ใช่ข้อความ เราตรวจพบตั้งแต่ตอนวางไฟล์และบอกคุณ แทนที่จะยื่นเอกสารเปล่าให้

PDF เป็น Word — คำถามที่พบบ่อย

ฟรี และไม่จำกัด การดึงข้อความรันบนฮาร์ดแวร์ของคุณเอง เราจึงไม่มีต้นทุนต่อไฟล์ที่ต้องผลักมาให้คุณ ไม่มีโควตารายวัน ไม่มีลายน้ำ ไม่มีแพ็กเกจเสียเงิน

ไม่ PDF ถูกอ่านเข้าหน่วยความจำของเบราว์เซอร์ และไฟล์ .docx ก็ถูกเขียนที่นั่นเช่นกัน เปิด DevTools แล้วดูแท็บ Network ระหว่างดึงข้อความดูได้ — ไม่มีอะไรถูกส่งออกไป

เพราะไฟล์สแกนบรรจุภาพของข้อความ ไม่ใช่ข้อความ และการอ่านมันต้องใช้ OCR ซึ่งเครื่องมือในเบราว์เซอร์ตัวนี้ไม่มี เราตรวจจับไฟล์สแกนตั้งแต่ตอนวางไฟล์และบอกคุณก่อนส่งออก คุณจึงไม่ต้องนั่งสงสัย ใช้เครื่องมือ OCR สำหรับเอกสารเหล่านั้น

ไม่เหมือน และเราขอบอกตรง ๆ ดีกว่าปล่อยให้คุณมารู้หลังดาวน์โหลด PDF เป็น Word ที่นี่หมายถึงข้อความ ไม่ใช่การออกแบบ นี่คือตัวดึงข้อความ: คุณได้คำ ลำดับการอ่าน ตัวหนาตัวเอียง และหัวข้อกับรายการที่ได้จากการอนุมาน ส่วนเลย์เอาต์หน้า ฟอนต์ ตาราง และรูปภาพจะไม่ถูกจำลอง

ไม่ เซลล์ของตารางจะออกมาเป็นข้อความกระจัดกระจายตามลำดับการอ่าน ไม่ใช่ตาราง Word การสร้างโครงสร้างตารางขึ้นใหม่จากพิกัดตัวอักษรนั้นไม่น่าเชื่อถือพอ การให้ข้อความที่คุณจัดเรียงเองได้จึงมีประโยชน์กว่าตารางที่ผิดแบบแนบเนียน

ได้ การดึงข้อความทำงานทั้งเอกสาร และคุณจำกัดการส่งออกให้เหลือช่วงหน้าที่ต้องการได้ก่อนสร้างไฟล์ Word

Adobe รัน PDF เป็น Word บนเซิร์ฟเวอร์ของตนด้วยเอนจินเชิงพาณิชย์ และจำลองเลย์เอาต์ได้ดีกว่าเรามาก แต่ก็ต้องอัปโหลดเอกสารของคุณ หากเลย์เอาต์สำคัญ ใช้ Adobe หากคำสำคัญและความเป็นส่วนตัวสำคัญ ใช้ตัวนี้

แก้ไขได้ใน Word, Google Docs, LibreOffice หรือ Pages — เป็นไฟล์ .docx มาตรฐาน เมื่อเสร็จแล้ว แปลงกลับเป็น PDF ด้วยเครื่องมือ Word เป็น PDF ของเรา ซึ่งทำงานในเบราว์เซอร์เช่นกัน

T

ทีมวิศวกรรม TinyImagePro

เราสร้างเครื่องมือจัดการไฟล์ที่ทำงานในเบราว์เซอร์และไม่เคยอัปโหลดข้อมูลของคุณ ตัวดึงข้อความ PDF เป็น Word นี้ใช้ pdf.js อ่านชั้นข้อความ ใช้ขั้นตอนอนุมานที่พัฒนาขึ้นเฉพาะเพื่อสร้างย่อหน้าและหัวข้อขึ้นใหม่จากพิกัดตัวอักษร และใช้ไลบรารี docx เขียนไฟล์ Word — ทั้งหมดบนเครื่องของคุณ

เกี่ยวกับ TinyImagePro