Text being extracted from a PDF into a Word documentDOCX

PDF 워드 변환 — 파일 업로드 없이 편집 가능한 텍스트 추출

PDF의 텍스트를 꺼내 편집할 수 있는 .docx로 만듭니다. 전부 브라우저에서 실행됩니다. 원본 레이아웃은 재현하지 않으며, 그 사실을 내려받기 전에 미리 말씀드립니다.

🔒 100% 브라우저 내 처리📝 텍스트 추출🔍 스캔본 감지 가입 없음
🔒

PDF가 절대 업로드되지 않습니다

파일 해석과 .docx 작성이 모두 브라우저 안에서 이루어집니다. 지워야 할 서버 사본도, 믿어야 할 보관 기간도 존재하지 않습니다.

🔍

스캔 파일을 미리 감지

스캔본에는 OCR 없이 추출할 텍스트가 없습니다. 아무 설명 없이 빈 Word 파일을 내놓는 대신, 파일을 놓는 즉시 검사해 알려 드립니다.

👁️

내려받기 전에 확인

저희가 살펴본 다른 어떤 PDF 워드 변환 도구와도 달리, 미리보기에서 정확히 무엇이 복원되었는지, 제목과 목록 중 몇 개가 읽힌 것이 아니라 추론된 것인지 보여 드립니다.

📄

일반 텍스트 모드

구조 추론은 빗나갈 수 있습니다. 클릭 한 번으로 추론을 완전히 끄고, 잘못 승격된 제목 없이 깔끔하게 이어지는 텍스트를 얻을 수 있습니다.

PDF 워드 변환이 보기보다 어려운 이유

워드를 PDF로 바꾸는 것은 렌더링 문제입니다. 기술된 레이아웃을 받아 그리면 됩니다. PDF를 워드로 바꾸는 것은 그 반대인데, 이 반대는 대칭이 아닙니다. 거꾸로 가는 길은 재구성 문제이고, 재구성은 그리기보다 훨씬 어렵습니다.

PDF는 문장이 아니라 글리프를 저장합니다

PDF 파일은 문단이나 제목을 기록하지 않습니다. 특정 좌표에 개별 글자를 그리라는 명령을 기록할 뿐입니다. PDF를 워드로 바꾼다는 것은 위치 데이터에서 구조를 역설계한다는 뜻인 이유가 여기에 있습니다.

Word 파일은 “이것은 ‘분기 보고서’라는 텍스트를 담은 제목 1이다”라고 말합니다. PDF는 “글꼴 F2를 22포인트로 설정하고 x=72, y=782로 이동해 분-기-보-고-서 글리프를 표시하라”고 말합니다. 파일 어디에도 그것이 제목이라는 표시가 없습니다. 주변보다 크다는 사실에서 유추해야 합니다.

문단을 역설계해야 하는 이유

텍스트는 좌표에 놓인 조각들로 도착하며, 단어 중간에서 잘리기 일쑤이고 단어 사이의 공백이 통째로 빠져 있는 경우도 흔합니다. 읽을 수 있는 글로 복원하려면 조각을 세로 위치로 묶어 줄을 만들고, 가로 간격이 암시하는 곳에 공백을 넣고, 어떤 줄바꿈이 자동 줄바꿈이고 어떤 것이 문단 경계인지 판단해야 합니다.

이 단계 하나하나가 전부 휴리스틱입니다. 저희 휴리스틱은 문서화되고 테스트되었지만, 여전히 추측입니다. 그래서 이 페이지는 결과물의 어느 부분이 추측인지 표시하며, 전부를 사실처럼 내놓지 않습니다.

스캔 문서 문제

스캔된 PDF에는 텍스트가 아니라 텍스트의 이미지가 들어 있습니다. OCR 없이는 아무리 해석해도 글자를 복원할 수 없습니다.

이것이 모든 PDF 워드 변환 도구에서 가장 흔한 실망의 원인이고, 많은 사람이 도구가 그냥 작동하지 않는다고 결론짓는 이유입니다. 동료가 스캔한 계약서를 넣으면 아무것도 담기지 않은 Word 파일이 돌아오는데, 대개 아무 설명도 없습니다.

OCR이 하는 일, 그리고 이 도구에 OCR이 없는 이유

광학 문자 인식은 그림을 보고 어떤 모양이 어떤 글자인지 알아냅니다. 텍스트 레이어를 읽는 것과는 전혀 다른 기술이고 비교적 느리며, 브라우저 기반으로 만들려면 방문자 모두에게 인식 모델을 내려보내야 합니다.

그래서 차선을 택했습니다. 상황을 감지해서, 파일을 놓은 뒤 가장 먼저 보이는 자리에서 분명하게 알려 드리는 것입니다. 감지 로직은 스캔한 쪽이 완전히 비어 있는 경우가 드물다는 점도 감안합니다. 스캐너는 쪽 번호를 찍고 부분적인 OCR은 찌꺼기를 남기므로, 글자가 몇 개뿐인 쪽은 텍스트가 아니라 스캔본으로 처리합니다.

이 PDF 워드 변환 도구가 실제로 하는 일

이 도구는 텍스트 추출기이지 레이아웃 변환기가 아닙니다. PDF의 글자를 편집 가능한 Word 파일로 복원합니다. 원본의 페이지 디자인은 재현하지 않습니다.

텍스트 추출과 레이아웃 변환

사람들이 ‘PDF 워드 변환’이라 부르는 것은 사실 두 가지로 나뉩니다. 레이아웃 변환은 문서를 다시 지으려 합니다. 표는 표로, 단은 단으로, 이미지는 제자리에. 이를 위해서는 상용 엔진이나 대규모 서버 측 장치가 필요하며, 잘 만든 구현은 전부 서버 측입니다.

텍스트 추출은 글자, 읽기 순서, 그리고 확신을 갖고 추론할 수 있는 기본 구조를 가져옵니다. 조항 인용하기, 문단 재사용하기, 보고서에서 수치 꺼내기 같은 수많은 실제 작업에서는 그것이 일의 전부입니다.

누구를 위한 도구인가 — 그리고 누구를 위한 도구가 아닌가

이럴 때 쓰세요. PDF의 텍스트를 꺼내 편집하거나 인용하거나 재활용하고 싶고, 문서를 낯선 서버에 업로드하고 싶지 않을 때입니다.

이럴 때는 쓰지 마세요. Word 파일이 PDF와 똑같이 보여야 하거나, 문서가 표 위주이거나, 스캔본일 때입니다. 이런 경우와 대신 쓸 도구는 아래에서 다룹니다.

PDF에서 텍스트를 추출하는 3단계

1

PDF 놓기

위 상자에 PDF를 끌어다 놓거나 클릭해 선택하세요. 파일은 디스크에서 브라우저로 곧바로 읽힙니다. 업로드가 없으므로 큰 문서도 회선을 기다리지 않고 즉시 처리가 시작됩니다.

2

추출 미리보기 확인하기

파일을 읽는 즉시 실제로 무엇이 복원되었는지, 제목과 목록 항목 중 몇 개가 추론된 것인지, 스캔본이나 다단으로 보이는 쪽이 있는지 확인할 수 있습니다. 일부러 내려받기 전에 보여 드립니다. 애초에 될 리 없던 파일에 시간을 쓰지 않고 그냥 돌아설 수 있도록 말입니다.

3

DOCX 내려받기

Word, Google Docs, LibreOffice, Pages에서 열리는 표준 Word 파일로 내보냅니다. 추론된 제목이 이상해 보이면 일반 텍스트 모드를 켜고 다시 내보내세요. 1초면 되고 모든 해석을 건너뜁니다.

PDF 워드 추출이 해내는 것과 해내지 못하는 것

모든 PDF 워드 변환 도구는 어딘가에 이 선을 긋습니다. 다만 대부분은 그 선이 어디인지 절대 보여 주지 않을 뿐입니다.

안정적으로 추출되는 것

본문 텍스트. 한 단 문서의 읽기 순서. 내장 글꼴 이름에서 유추한 굵게와 기울임. 하이퍼링크의 표시 텍스트.

보통의 보고서, 편지, 기사라면 사실상 내용 전부입니다.

추론되는 것 — 때로는 틀립니다

제목 수준, 문단 경계, 글머리 기호·번호 목록. 이들은 파일에서 읽는 것이 아니라 기하 정보에서 도출하며, 바로 그 이유로 미리보기에서 ‘추론됨’이라고 표시합니다.

글자 크기로 제목 수준을 추측하는 방법

문서에서 가장 흔한 글리프 높이를 본문 크기로 잡고, 그보다 의미 있게 큰 것을 승격시킵니다. 1.6배 이상이면 제목 1, 1.35배면 제목 2, 1.15배면 제목 3입니다.

평균이 아니라 최빈값을 쓰는 데에는 이유가 있습니다. 평균은 큰 표제 하나에 끌려 올라가고, 그러면 정작 그 표제가 제목으로 인식되지 못하게 됩니다. 기준선도 문서 전체에 걸쳐 계산하므로, 전부 큰 글자로 짜인 표지 한 장이 이후 모든 쪽을 왜곡하지 않습니다.

크기가 아니라 굵기나 색으로 제목을 표시한 문서에서는 제목이 감지되지 않습니다. 이는 실제 한계이며, 일반 텍스트 모드는 바로 이를 위해 존재합니다.

지원하지 않는 것

표는 표가 아니라 흩어진 텍스트로 나옵니다. 이미지는 옮겨지지 않습니다. 머리글, 바닥글, 쪽 번호는 있던 자리에서 보통 텍스트로 추출됩니다. 정밀한 레이아웃, 위치, 글꼴, 크기는 전혀 재현되지 않습니다.

표, 이미지, 스캔된 쪽

다단 쪽은 조용히 뒤섞지 않고 감지해서 표시합니다. 단 사이의 읽기 순서는 정말로 모호하기 때문입니다. 2단 학술 논문은 단마다 아래로 읽을 수도, 쪽을 가로질러 읽을 수도 있는데, 파일은 어느 쪽인지 말해 주지 않습니다.

스캔된 쪽에서는 아무것도 나오지 않으며, 내보내기 전에 그 사실을 알려 드립니다.

추출 범위 한눈에 보기

항목상태설명
본문 텍스트안정적텍스트 레이어에서 복원
읽기 순서(한 단)안정적줄 위치로 묶어 정렬
굵게·기울임안정적내장 글꼴 이름에서 유추
하이퍼링크 텍스트안정적표시 텍스트만, 링크 대상은 아님
제목 수준추론상대적 글자 크기 기반, 틀릴 수 있음
문단 경계추론줄 사이의 세로 간격 기반
글머리 기호·번호 목록추론선행 기호와 들여쓰기 기반
다단 읽기 순서추론감지해서 표시할 뿐 재배열하지 않음
지원 안 함흩어진 텍스트로 출력
이미지지원 안 함Word 파일로 옮겨지지 않음
머리글과 바닥글지원 안 함보통 텍스트로 나타남
페이지 레이아웃과 글꼴지원 안 함재현되지 않음
스캔된 쪽지원 안 함OCR 필요, 감지해서 알려 드림

PDF 워드 추출로 할 수 있는 일

PDF 워드 추출의 현실적인 쓰임새에는 공통점이 있습니다. 디자인이 아니라 글자가 필요하다는 것입니다.

계약서와 보고서에서 인용하기

PDF의 조항을 손으로 다시 치는 것은 하필 오타가 가장 치명적인 문서에서 오타를 부르는 일입니다. 추출하면 문구를 글자 그대로 얻을 수 있고, 계약서라면 파일이 기기를 벗어나지 않았다는 사실이 결코 사소하지 않습니다.

연구 논문 텍스트 재사용하기

학술 PDF는 이 도구의 대표적인 쓰임새인 동시에 한계의 대표 사례이기도 합니다. 텍스트는 깔끔하게 나오지만 2단 논문은 표시가 붙습니다. 읽기 순서가 정말로 모호하기 때문입니다. 추출한 뒤 순서를 직접 손보세요.

청구서에서 데이터 꺼내기

청구서의 항목들은 표 안에 있어서, 격자가 아니라 흩어진 텍스트로 나옵니다. 그래도 다시 치는 것보다는 빠르고, 숫자는 인쇄된 그대로 도착합니다.

옛 문서 다시 활용하기

오래된 PDF 브로슈어나 매뉴얼을 편집 가능한 원고로 되돌리는 일에서는 보통 디자인이 아니라 글자가 중요합니다. 어차피 디자인은 새로 바꾸는 경우가 대부분이니까요.

여기서 프라이버시가 중요한 이유

사람들이 가장 추출하고 싶어 하는 문서 — 계약서, 진료 소견서, 재무제표 — 는 가장 업로드하고 싶지 않아야 할 문서이기도 합니다. 로컬에서 처리하면 그 질문에 답하는 것이 아니라 질문 자체를 없앱니다.

서버 기반 변환 도구를 대신 써야 할 때

필요한 것쓸 도구이유
표를 표 그대로 유지Adobe, Smallpdf, 또는 Word 자체레이아웃 재구성이 필요함
Word 파일이 PDF와 똑같아야 함상용 변환 도구저희는 레이아웃을 재현하지 않음
스캔 문서의 텍스트OCR 도구읽을 텍스트 레이어가 없음
이미지까지 옮기기상용 변환 도구여기서는 추출하지 않음
글자만, 비공개로이 도구아무것도 업로드되지 않음
텍스트를 편집하고 다시 인용이 도구텍스트와 기본 구조면 충분함

PDF 워드 변환 뒤에: 편집하고 되돌리고 공유하기

PDF 워드 변환이 마지막 단계인 경우는 드뭅니다. 텍스트를 Word로 옮겨 편집을 마쳤다면 다시 PDF로 되돌리는 것이 자연스러운 다음 단계입니다. 저희 워드 PDF 변환 도구 역시 전부 브라우저에서 실행되므로, 왕복 과정 어디에서도 서버를 거치지 않습니다.

원본이 여러 PDF로 나뉘어 있다면, 여러 번 추출해 Word에서 이어 붙이는 대신 먼저 합친 뒤 한 번에 추출하세요.

여기의 모든 도구는 같은 원칙을 따릅니다. 파일은 사용자의 컴퓨터에 머뭅니다. 같은 계열의 도구는 무료 PDF 도구 페이지에, 이미지 도구는 모든 무료 브라우저 도구에 모여 있습니다.

Why PDF to Word conversion has to reverse-engineer structureA Word file records that a block of text is a heading followed by a paragraph. A PDF records only that individual characters are drawn at particular coordinates, so paragraphs and headings must be inferred from position and size.What a Word file storesHeading 1"Quarterly Report"Paragraph"Revenue grew across every""segment during the period."List item"North region led growth"Structure is recordedNothing has to be guessedWhat a PDF storesTf /F2 22Td 72 782 · Tj "Quarterly"Td 196 782 · Tj "Report"Tf /F1 11Td 72 742 · Tj "Revenue grew"Td 178 742 · Tj "across every"Td 72 726 · Tj "segment during"Td 86 690 · Tj "•"Td 98 690 · Tj "North region led"Only glyphs and coordinatesParagraphs must be inferred
Word 파일은 무언가가 제목이라는 사실을 기록합니다. PDF는 글자가 어느 좌표에 그려졌다는 것만 기록합니다. 구조를 추측해야 하는 이유가 바로 여기에 있습니다.

세 단계, 계정도 업로드도 없이

Step one: drop a PDF onto the page.pdf
1

PDF를 놓으세요. 브라우저 안에서 로컬로 읽습니다.

Step two: compare the original page with what was extractedOriginalExtracted
2

내려받기 전에 실제로 무엇이 복원되었는지 확인하세요.

Step three: download the editable Word documentDOCX
3

어디서든 편집할 수 있는 표준 .docx로 내보냅니다.

이 추출기가 복원하는 것, 추측하는 것, 할 수 없는 것

대부분의 변환 도구는 결과물이 원본과 똑같을 것처럼 자신을 소개합니다. 이 도구는 그렇지 않으며, 아닌 척해 봐야 사용자의 시간만 낭비할 뿐입니다. 실제 내역은 이렇습니다.

What this extractor recovers, guesses, and cannot doReliably extracted: body text, reading order in single-column documents, bold and italic, and hyperlink text. Inferred and possibly wrong: heading levels, paragraph boundaries, lists, and multi-column reading order. Not supported: tables as tables, images, headers and footers, and scanned pages, which need OCR.Reliably extractedBody textReading order (single column)Bold and italicHyperlink textInferred — may be wrong?Heading levels?Paragraph boundaries?Bulleted and numbered lists?Multi-column orderNot supportedTables as tablesImagesHeaders and footersScanned pages (no OCR)
A text-layer PDF versus a scanned PDFA text-layer PDF contains selectable characters and can be extracted. A scanned PDF contains only a photograph of text, so without OCR there is nothing to extract.Text-layer PDFCharacters are selectableExtractableText, order,bold and italicScanned PDFJust a picture of textNeeds OCRWe detect thisand tell you
스캔된 PDF에는 텍스트가 아니라 텍스트의 이미지가 들어 있습니다. 빈 문서를 건네는 대신, 파일을 놓는 즉시 감지해 알려 드립니다.

PDF 워드 변환 — 자주 묻는 질문

네, 사용 횟수 제한도 없습니다. 추출이 사용자의 하드웨어에서 실행되므로 파일당 비용이 발생하지 않고, 따라서 전가할 비용도 없습니다. 하루 한도도, 워터마크도, 유료 요금제도 없습니다.

아닙니다. PDF는 브라우저 메모리로 읽히고 .docx도 그곳에서 만들어집니다. 추출하는 동안 개발자 도구를 열어 네트워크 탭을 보세요. 아무것도 전송되지 않습니다.

스캔본에는 텍스트가 아니라 텍스트의 그림이 들어 있고, 이를 읽으려면 OCR이 필요한데 이 브라우저 기반 도구에는 OCR이 없기 때문입니다. 파일을 놓는 순간 스캔본을 감지해 내보내기 전에 알려 드리므로, 영문도 모른 채 남겨지는 일은 없습니다. 그런 문서에는 OCR 도구를 사용하세요.

아니며, 내려받은 뒤에 알게 하느니 분명하게 미리 말씀드리는 편을 택했습니다. 여기서 PDF 워드 변환은 디자인이 아니라 텍스트를 뜻합니다. 이 도구는 텍스트 추출기입니다. 글자, 읽기 순서, 굵게와 기울임, 추론된 제목과 목록을 얻습니다. 페이지 레이아웃, 글꼴, 표, 이미지는 재현되지 않습니다.

아닙니다. 표의 칸들은 Word 표가 아니라 읽기 순서대로 흩어진 텍스트로 나옵니다. 글리프 좌표에서 표 구조를 다시 짓는 일은 신뢰하기 어려울 만큼 불안정해서, 미묘하게 틀린 표보다 직접 재배열할 수 있는 텍스트를 드리는 편이 더 쓸모 있습니다.

가능합니다. 추출은 문서 전체에 걸쳐 실행되며, Word 파일을 만들기 전에 내보낼 쪽 범위를 제한할 수 있습니다.

Adobe는 상용 엔진으로 자사 서버에서 PDF 워드 변환을 실행하며 레이아웃 재현이 저희보다 훨씬 뛰어납니다. 대신 문서를 업로드해야 합니다. 레이아웃이 중요하다면 Adobe를 쓰세요. 글자가 중요하고 프라이버시가 중요하다면 이 도구를 쓰세요.

표준 .docx이므로 Word, Google Docs, LibreOffice, Pages에서 편집할 수 있습니다. 편집을 마치면 역시 브라우저에서 동작하는 워드 PDF 변환 도구로 다시 PDF로 되돌리세요.

T

TinyImagePro 엔지니어링 팀

저희는 데이터를 절대 업로드하지 않는 브라우저 기반 파일 도구를 만듭니다. 이 PDF 워드 추출기는 pdf.js로 텍스트 레이어를 읽고, 직접 만든 추론 단계로 글리프 좌표에서 문단과 제목을 재구성하며, docx 라이브러리로 Word 파일을 작성합니다. 전부 사용자의 컴퓨터에서 실행됩니다.

TinyImagePro 소개