Text being extracted from a PDF into a Word documentDOCX

PDF в Word — извлеките редактируемый текст, не загружая файл на сервер

Достаёт текст из PDF в файл .docx, который можно редактировать. Работает целиком в вашем браузере. Исходную вёрстку он не воспроизводит — и говорит об этом до скачивания.

🔒 100 % в браузере📝 Извлечение текста🔍 Распознаёт сканы Без регистрации
🔒

Ваш PDF никогда не загружается на сервер

И разбор PDF, и запись .docx происходят в вашем браузере. На сервере нет копии, которую нужно было бы удалять, и нет срока хранения, которому пришлось бы доверять.

🔍

Сканы распознаются заранее

Из скана без OCR нечего извлекать. Мы проверяем это при добавлении файла и сообщаем сразу — вместо пустого файла Word без всяких объяснений.

👁️

Предпросмотр до скачивания

В отличие от всех остальных инструментов PDF в Word, которые мы изучили, предпросмотр показывает ровно то, что удалось восстановить, а также сколько заголовков и списков было выведено эвристикой, а не прочитано из файла.

📄

Режим простого текста

Распознавание структуры может ошибаться. Один клик полностью его отключает и выдаёт чистый сплошной текст без ошибочно назначенных заголовков.

Почему конвертация PDF в Word сложнее, чем кажется

Конвертация Word в PDF — задача отрисовки: взять описанную вёрстку и нарисовать её. PDF в Word — обратный путь, и он не симметричен. Обратное направление — задача реконструкции, а реконструировать гораздо труднее, чем рисовать.

PDF хранит глифы, а не предложения

PDF-файл не записывает абзацы и заголовки. Он записывает команды нарисовать отдельные символы в конкретных координатах — вот почему конвертация PDF в Word означает восстановление структуры из данных о позициях.

Файл Word говорит: «это Заголовок 1 с текстом Квартальный отчёт». PDF говорит: «установи шрифт F2 в 22 пункта, перейди в x=72 y=782, покажи глифы К-в-а-р-т-а-л-ь-н-ы-й». Ничто в файле не помечает это как заголовок. Это приходится выводить из того, что текст крупнее всего вокруг.

Почему абзацы приходится восстанавливать

Текст приходит фрагментами в координатах, нередко разорванными посреди слова, а зачастую и вовсе без пробелов между словами. Чтобы восстановить читаемую прозу, нужно сгруппировать фрагменты в строки по вертикальной позиции, вставить пробелы там, где на них указывают горизонтальные промежутки, и затем решить, какие разрывы строк — переносы, а какие — границы абзацев.

Каждый из этих шагов — эвристика. Наши задокументированы и протестированы, но это всё равно догадки, и эта страница помечает, какие части результата — догадки, вместо того чтобы выдавать всё за факт.

Проблема отсканированных документов

Отсканированные PDF содержат изображения текста, а не текст. Без OCR никакой разбор не восстановит слова.

Это самое частое разочарование от любого конвертера PDF в Word — и причина, по которой многие решают, что такие инструменты попросту не работают. Вы перетаскиваете договор, отсканированный коллегой, и получаете обратно файл Word, в котором ничего нет, — как правило, вообще без объяснений.

Что делает OCR и почему его здесь нет

Оптическое распознавание символов смотрит на картинку и определяет, какие формы каким буквам соответствуют. Это принципиально другая технология, нежели чтение текстового слоя, она сравнительно медленная, а браузерная версия означала бы доставку модели распознавания каждому посетителю.

Поэтому мы делаем лучшее из возможного: обнаруживаем ситуацию и говорим о ней прямо — в первом же сообщении после добавления файла. Проверка учитывает, что отсканированные страницы редко бывают совсем пустыми: сканеры штампуют номера страниц, а частичный OCR оставляет мусор, — поэтому страница с горсткой символов считается сканом, а не текстом.

Что этот инструмент PDF в Word делает на самом деле

Это экстрактор текста, а не конвертер вёрстки. Он восстанавливает слова из PDF в редактируемый файл Word. Исходный дизайн страниц он не воспроизводит.

Извлечение текста против переноса вёрстки

Под «PDF в Word» люди понимают две совершенно разные вещи. Перенос вёрстки пытается пересобрать документ: таблицы как таблицы, колонки как колонки, изображения на местах. Это требует либо коммерческого движка, либо большого серверного хозяйства — и все хорошие реализации серверные.

Извлечение текста берёт слова, порядок чтения и столько базовой структуры, сколько можно уверенно вывести. Для множества реальных задач — процитировать пункт договора, переиспользовать абзац, вытащить цифры из отчёта — этого достаточно.

Кому это подойдёт, а кому нет

Используйте этот инструмент, если вам нужен текст из PDF для редактирования, цитирования или переиспользования — и вы предпочитаете, чтобы документ не оказался на чужом сервере.

Не используйте его, если файл Word должен выглядеть как PDF, если документ насыщен таблицами или если это скан. Эти случаи разобраны ниже — вместе с тем, что использовать вместо него.

Как извлечь текст из PDF за 3 шага

1

Перетащите PDF

Перетащите PDF в поле выше или нажмите, чтобы выбрать файл. Он читается прямо с диска в браузер — этапа загрузки на сервер нет, поэтому большой документ обрабатывается сразу, не дожидаясь соединения.

2

Проверьте предпросмотр извлечения

Как только файл прочитан, вы видите, что реально удалось восстановить, сколько заголовков и пунктов списков выведено эвристикой и не выглядят ли какие-то страницы сканами или многоколоночными. Это намеренно показано <em>до</em> скачивания, чтобы вы могли уйти, не потратив время на файл, из которого всё равно ничего бы не вышло.

3

Скачайте свой DOCX

Экспортируйте стандартный файл Word, который открывается в Word, Google Документах, LibreOffice и Pages. Если выведенные заголовки выглядят неверно, включите режим простого текста и экспортируйте снова — это занимает секунду и отключает всякую интерпретацию.

Что извлечение PDF в Word восстанавливает, а что нет

Каждый инструмент PDF в Word где-то проводит эту границу. Большинство просто никогда её не показывают.

Извлекается надёжно

Основной текст. Порядок чтения — для одноколоночных документов. Полужирный и курсив, выведенные из названий встроенных шрифтов. Видимый текст гиперссылок.

Для обычного отчёта, письма или статьи это фактически всё содержимое.

Выводится эвристикой — и иногда ошибочно

Уровни заголовков, границы абзацев, маркированные и нумерованные списки. Они выводятся из геометрии, а не читаются из файла, и именно поэтому предпросмотр помечает их как выведенные.

Как уровни заголовков угадываются по размеру шрифта

Самую распространённую высоту глифов в документе мы принимаем за размер основного текста, а всё заметно более крупное повышаем: от 1,6× — Заголовок 1, от 1,35× — Заголовок 2, от 1,15× — Заголовок 3.

Именно самый распространённый размер, а не средний — намеренно: среднее тянет вверх крупный заголовок титульной страницы, из-за чего сам этот заголовок перестал бы распознаваться. Базовый размер к тому же считается по всему документу, поэтому титульная страница, набранная целиком крупным кеглем, не искажает все последующие.

В документах, где заголовки выделены насыщенностью или цветом, а не размером, они распознаны не будут. Это реальное ограничение — и именно для него существует режим простого текста.

Не поддерживается

Таблицы выходят сплошным текстом, а не таблицами. Изображения не переносятся. Колонтитулы и номера страниц извлекаются как обычный текст там, где они оказались. Точная вёрстка, позиционирование, шрифты и размеры не воспроизводятся вовсе.

Таблицы, изображения и отсканированные страницы

Многоколоночные страницы обнаруживаются и помечаются, а не молча перемешиваются, потому что порядок чтения между колонками действительно неоднозначен: двухколоночную научную статью можно читать по колонкам или поперёк страницы, и файл не говорит, как именно.

Отсканированные страницы не дают ничего — и об этом сообщается до экспорта.

Возможности извлечения кратко

ЭлементСтатусПримечания
Основной текстНадёжноВосстанавливается из текстового слоя
Порядок чтения (одна колонка)НадёжноГруппировка по положению строк
Полужирный и курсивНадёжноВыводится из названий встроенных шрифтов
Текст гиперссылокНадёжноВидимый текст, а не адрес
Уровни заголовковЭвристикаПо относительному размеру шрифта; возможны ошибки
Границы абзацевЭвристикаПо вертикальным промежуткам между строками
Маркированные и нумерованные спискиЭвристикаПо маркерам в начале строк и отступам
Порядок чтения в колонкахЭвристикаОбнаруживается и помечается, не переупорядочивается
ТаблицыНе поддерживаетсяВыводятся сплошным текстом
ИзображенияНе поддерживаетсяВ файл Word не переносятся
КолонтитулыНе поддерживаетсяВыходят как обычный текст
Вёрстка страниц и шрифтыНе поддерживаетсяНе воспроизводятся
Отсканированные страницыНе поддерживаетсяНужен OCR; обнаруживается и сообщается

Для чего пригодится извлечение PDF в Word

Все реалистичные применения извлечения PDF в Word похожи по форме: вам нужны слова, а не дизайн.

Цитирование договоров и отчётов

Перепечатывать точный пункт из PDF вручную — значит приглашать опечатки именно в тех документах, где ошибки дороже всего. Извлечение даёт формулировку дословно, а для договора то, что он не покидал вашу машину, — не мелочь.

Переиспользование текста научных статей

Научные PDF — классический случай для этого инструмента и одновременно классический случай его ограничений: текст выходит чисто, но двухколоночные статьи будут помечены, потому что порядок чтения там действительно неоднозначен. Извлеките, затем переставьте вручную.

Извлечение данных из счетов

Позиции счетов живут в таблицах, которые выходят сплошным текстом, а не сеткой. Это всё равно быстрее, чем перепечатывать, а цифры приходят ровно такими, какими напечатаны.

Возвращение к жизни старых документов

Превратить старую PDF-брошюру или инструкцию обратно в редактируемый текст обычно нужно ради слов, а не дизайна — дизайн, как правило, всё равно меняют.

Почему приватность здесь важна

Документы, из которых чаще всего хотят извлечь текст, — договоры, медицинские письма, финансовые отчёты — это именно те документы, которые меньше всего стоит загружать на сервер. Локальная обработка снимает вопрос, а не отвечает на него.

Когда лучше взять серверный конвертер

Если вам нужно…ИспользуйтеПочему
Таблицы, сохранённые как таблицыAdobe, Smallpdf или сам WordТребуется реконструкция вёрстки
Чтобы файл Word выглядел как PDFКоммерческий конвертерМы не воспроизводим вёрстку
Текст из отсканированного документаИнструмент с OCRТекстового слоя для чтения нет
Перенос изображенийКоммерческий конвертерЗдесь они не извлекаются
Только слова — и приватноЭтот инструментНичего не загружается на сервер
Редактировать и цитировать текстЭтот инструментТекста и базовой структуры достаточно

После PDF в Word: править, конвертировать обратно, отправлять

PDF в Word редко бывает последним шагом. Когда текст оказался в Word и вы его отредактировали, естественный следующий шаг — конвертация обратно: наш конвертер Word в PDF тоже работает целиком в браузере, поэтому весь круговорот не касается сервера.

Если исходный материал разбросан по нескольким PDF, сначала объедините их и извлеките текст один раз, вместо того чтобы извлекать несколько раз и сшивать результаты в Word.

Всё здесь следует одному правилу: ваши файлы остаются на вашей машине. Остальной набор — на странице бесплатных инструментов PDF, а инструменты для изображений — во всех наших бесплатных браузерных инструментах.

Why PDF to Word conversion has to reverse-engineer structureA Word file records that a block of text is a heading followed by a paragraph. A PDF records only that individual characters are drawn at particular coordinates, so paragraphs and headings must be inferred from position and size.What a Word file storesHeading 1"Quarterly Report"Paragraph"Revenue grew across every""segment during the period."List item"North region led growth"Structure is recordedNothing has to be guessedWhat a PDF storesTf /F2 22Td 72 782 · Tj "Quarterly"Td 196 782 · Tj "Report"Tf /F1 11Td 72 742 · Tj "Revenue grew"Td 178 742 · Tj "across every"Td 72 726 · Tj "segment during"Td 86 690 · Tj "•"Td 98 690 · Tj "North region led"Only glyphs and coordinatesParagraphs must be inferred
Файл Word записывает, что нечто является заголовком. PDF записывает лишь то, что символы нарисованы в определённых координатах, — поэтому структуру приходится угадывать.

Три шага — без аккаунта и без загрузки на сервер

Step one: drop a PDF onto the page.pdf
1

Перетащите PDF. Он читается локально, в вашем браузере.

Step two: compare the original page with what was extractedOriginalExtracted
2

Посмотрите, что реально удалось восстановить, прежде чем скачивать.

Step three: download the editable Word documentDOCX
3

Экспортируйте стандартный .docx, который можно редактировать где угодно.

Что этот экстрактор восстанавливает, угадывает и чего не умеет

Большинство конвертеров описывают себя так, будто результат совпадёт с оригиналом. Здесь он не совпадёт, и делать вид иначе значило бы лишь тратить ваше время. Вот честный расклад.

What this extractor recovers, guesses, and cannot doReliably extracted: body text, reading order in single-column documents, bold and italic, and hyperlink text. Inferred and possibly wrong: heading levels, paragraph boundaries, lists, and multi-column reading order. Not supported: tables as tables, images, headers and footers, and scanned pages, which need OCR.Reliably extractedBody textReading order (single column)Bold and italicHyperlink textInferred — may be wrong?Heading levels?Paragraph boundaries?Bulleted and numbered lists?Multi-column orderNot supportedTables as tablesImagesHeaders and footersScanned pages (no OCR)
A text-layer PDF versus a scanned PDFA text-layer PDF contains selectable characters and can be extracted. A scanned PDF contains only a photograph of text, so without OCR there is nothing to extract.Text-layer PDFCharacters are selectableExtractableText, order,bold and italicScanned PDFJust a picture of textNeeds OCRWe detect thisand tell you
Отсканированные PDF содержат изображения текста, а не текст. Мы обнаруживаем это при добавлении файла и сообщаем — вместо того чтобы вручить вам пустой документ.

PDF в Word — частые вопросы

Да, и без ограничений. Извлечение выполняется на вашем оборудовании, поэтому у нас нет затрат за каждый файл, которые пришлось бы перекладывать на вас. Ни дневной квоты, ни водяных знаков, ни платного тарифа.

Нет. PDF читается в память браузера, и .docx создаётся там же. Откройте инструменты разработчика и следите за вкладкой «Сеть» во время извлечения — наружу ничего не отправляется.

Потому что скан содержит картинку текста, а не текст, и чтобы его прочитать, нужен OCR, которого в этом браузерном инструменте нет. Мы распознаём сканы в момент добавления файла и сообщаем об этом до экспорта, чтобы вы не гадали. Для таких документов используйте инструмент с OCR.

Нет, и мы предпочитаем сказать это прямо, а не дать вам обнаружить это после скачивания. PDF в Word здесь означает текст, а не дизайн. Это экстрактор текста: вы получаете слова, порядок чтения, полужирный и курсив, а также выведенные эвристикой заголовки и списки. Вёрстка страниц, шрифты, таблицы и изображения не воспроизводятся.

Нет. Ячейки таблиц выходят сплошным текстом в порядке чтения, а не таблицей Word. Восстанавливать структуру таблицы по координатам глифов настолько ненадёжно, что текст, который можно переставить, полезнее таблицы, которая незаметно неверна.

Да. Извлечение проходит по всему документу, а перед сборкой файла Word экспорт можно ограничить диапазоном страниц.

Adobe выполняет PDF в Word на своих серверах коммерческим движком и воспроизводит вёрстку гораздо лучше, чем можем мы. Но для этого документ нужно загрузить. Если важна вёрстка — используйте Adobe. Если важны слова и важна приватность — используйте этот инструмент.

Редактировать в Word, Google Документах, LibreOffice или Pages — это стандартный .docx. Когда закончите, конвертируйте его обратно в PDF нашим инструментом Word в PDF, который тоже работает в браузере.

T

Инженерная команда TinyImagePro

Мы делаем браузерные инструменты для файлов, которые никогда не загружают ваши данные. Этот экстрактор PDF в Word использует pdf.js для чтения текстового слоя, собственный этап анализа для восстановления абзацев и заголовков из координат глифов и библиотеку docx для записи файла Word — всё на вашей машине.

О TinyImagePro