Почему конвертация PDF в Word сложнее, чем кажется
Конвертация Word в PDF — задача отрисовки: взять описанную вёрстку и нарисовать её. PDF в Word — обратный путь, и он не симметричен. Обратное направление — задача реконструкции, а реконструировать гораздо труднее, чем рисовать.
PDF хранит глифы, а не предложения
PDF-файл не записывает абзацы и заголовки. Он записывает команды нарисовать отдельные символы в конкретных координатах — вот почему конвертация PDF в Word означает восстановление структуры из данных о позициях.
Файл Word говорит: «это Заголовок 1 с текстом Квартальный отчёт». PDF говорит: «установи шрифт F2 в 22 пункта, перейди в x=72 y=782, покажи глифы К-в-а-р-т-а-л-ь-н-ы-й». Ничто в файле не помечает это как заголовок. Это приходится выводить из того, что текст крупнее всего вокруг.
Почему абзацы приходится восстанавливать
Текст приходит фрагментами в координатах, нередко разорванными посреди слова, а зачастую и вовсе без пробелов между словами. Чтобы восстановить читаемую прозу, нужно сгруппировать фрагменты в строки по вертикальной позиции, вставить пробелы там, где на них указывают горизонтальные промежутки, и затем решить, какие разрывы строк — переносы, а какие — границы абзацев.
Каждый из этих шагов — эвристика. Наши задокументированы и протестированы, но это всё равно догадки, и эта страница помечает, какие части результата — догадки, вместо того чтобы выдавать всё за факт.
Проблема отсканированных документов
Отсканированные PDF содержат изображения текста, а не текст. Без OCR никакой разбор не восстановит слова.
Это самое частое разочарование от любого конвертера PDF в Word — и причина, по которой многие решают, что такие инструменты попросту не работают. Вы перетаскиваете договор, отсканированный коллегой, и получаете обратно файл Word, в котором ничего нет, — как правило, вообще без объяснений.
Что делает OCR и почему его здесь нет
Оптическое распознавание символов смотрит на картинку и определяет, какие формы каким буквам соответствуют. Это принципиально другая технология, нежели чтение текстового слоя, она сравнительно медленная, а браузерная версия означала бы доставку модели распознавания каждому посетителю.
Поэтому мы делаем лучшее из возможного: обнаруживаем ситуацию и говорим о ней прямо — в первом же сообщении после добавления файла. Проверка учитывает, что отсканированные страницы редко бывают совсем пустыми: сканеры штампуют номера страниц, а частичный OCR оставляет мусор, — поэтому страница с горсткой символов считается сканом, а не текстом.
Что этот инструмент PDF в Word делает на самом деле
Это экстрактор текста, а не конвертер вёрстки. Он восстанавливает слова из PDF в редактируемый файл Word. Исходный дизайн страниц он не воспроизводит.
Извлечение текста против переноса вёрстки
Под «PDF в Word» люди понимают две совершенно разные вещи. Перенос вёрстки пытается пересобрать документ: таблицы как таблицы, колонки как колонки, изображения на местах. Это требует либо коммерческого движка, либо большого серверного хозяйства — и все хорошие реализации серверные.
Извлечение текста берёт слова, порядок чтения и столько базовой структуры, сколько можно уверенно вывести. Для множества реальных задач — процитировать пункт договора, переиспользовать абзац, вытащить цифры из отчёта — этого достаточно.
Кому это подойдёт, а кому нет
Используйте этот инструмент, если вам нужен текст из PDF для редактирования, цитирования или переиспользования — и вы предпочитаете, чтобы документ не оказался на чужом сервере.
Не используйте его, если файл Word должен выглядеть как PDF, если документ насыщен таблицами или если это скан. Эти случаи разобраны ниже — вместе с тем, что использовать вместо него.
Как извлечь текст из PDF за 3 шага
Перетащите PDF
Перетащите PDF в поле выше или нажмите, чтобы выбрать файл. Он читается прямо с диска в браузер — этапа загрузки на сервер нет, поэтому большой документ обрабатывается сразу, не дожидаясь соединения.
Проверьте предпросмотр извлечения
Как только файл прочитан, вы видите, что реально удалось восстановить, сколько заголовков и пунктов списков выведено эвристикой и не выглядят ли какие-то страницы сканами или многоколоночными. Это намеренно показано <em>до</em> скачивания, чтобы вы могли уйти, не потратив время на файл, из которого всё равно ничего бы не вышло.
Скачайте свой DOCX
Экспортируйте стандартный файл Word, который открывается в Word, Google Документах, LibreOffice и Pages. Если выведенные заголовки выглядят неверно, включите режим простого текста и экспортируйте снова — это занимает секунду и отключает всякую интерпретацию.
Что извлечение PDF в Word восстанавливает, а что нет
Каждый инструмент PDF в Word где-то проводит эту границу. Большинство просто никогда её не показывают.
Извлекается надёжно
Основной текст. Порядок чтения — для одноколоночных документов. Полужирный и курсив, выведенные из названий встроенных шрифтов. Видимый текст гиперссылок.
Для обычного отчёта, письма или статьи это фактически всё содержимое.
Выводится эвристикой — и иногда ошибочно
Уровни заголовков, границы абзацев, маркированные и нумерованные списки. Они выводятся из геометрии, а не читаются из файла, и именно поэтому предпросмотр помечает их как выведенные.
Как уровни заголовков угадываются по размеру шрифта
Самую распространённую высоту глифов в документе мы принимаем за размер основного текста, а всё заметно более крупное повышаем: от 1,6× — Заголовок 1, от 1,35× — Заголовок 2, от 1,15× — Заголовок 3.
Именно самый распространённый размер, а не средний — намеренно: среднее тянет вверх крупный заголовок титульной страницы, из-за чего сам этот заголовок перестал бы распознаваться. Базовый размер к тому же считается по всему документу, поэтому титульная страница, набранная целиком крупным кеглем, не искажает все последующие.
В документах, где заголовки выделены насыщенностью или цветом, а не размером, они распознаны не будут. Это реальное ограничение — и именно для него существует режим простого текста.
Не поддерживается
Таблицы выходят сплошным текстом, а не таблицами. Изображения не переносятся. Колонтитулы и номера страниц извлекаются как обычный текст там, где они оказались. Точная вёрстка, позиционирование, шрифты и размеры не воспроизводятся вовсе.
Таблицы, изображения и отсканированные страницы
Многоколоночные страницы обнаруживаются и помечаются, а не молча перемешиваются, потому что порядок чтения между колонками действительно неоднозначен: двухколоночную научную статью можно читать по колонкам или поперёк страницы, и файл не говорит, как именно.
Отсканированные страницы не дают ничего — и об этом сообщается до экспорта.
Возможности извлечения кратко
| Элемент | Статус | Примечания |
|---|---|---|
| Основной текст | Надёжно | Восстанавливается из текстового слоя |
| Порядок чтения (одна колонка) | Надёжно | Группировка по положению строк |
| Полужирный и курсив | Надёжно | Выводится из названий встроенных шрифтов |
| Текст гиперссылок | Надёжно | Видимый текст, а не адрес |
| Уровни заголовков | Эвристика | По относительному размеру шрифта; возможны ошибки |
| Границы абзацев | Эвристика | По вертикальным промежуткам между строками |
| Маркированные и нумерованные списки | Эвристика | По маркерам в начале строк и отступам |
| Порядок чтения в колонках | Эвристика | Обнаруживается и помечается, не переупорядочивается |
| Таблицы | Не поддерживается | Выводятся сплошным текстом |
| Изображения | Не поддерживается | В файл Word не переносятся |
| Колонтитулы | Не поддерживается | Выходят как обычный текст |
| Вёрстка страниц и шрифты | Не поддерживается | Не воспроизводятся |
| Отсканированные страницы | Не поддерживается | Нужен OCR; обнаруживается и сообщается |
Для чего пригодится извлечение PDF в Word
Все реалистичные применения извлечения PDF в Word похожи по форме: вам нужны слова, а не дизайн.
Цитирование договоров и отчётов
Перепечатывать точный пункт из PDF вручную — значит приглашать опечатки именно в тех документах, где ошибки дороже всего. Извлечение даёт формулировку дословно, а для договора то, что он не покидал вашу машину, — не мелочь.
Переиспользование текста научных статей
Научные PDF — классический случай для этого инструмента и одновременно классический случай его ограничений: текст выходит чисто, но двухколоночные статьи будут помечены, потому что порядок чтения там действительно неоднозначен. Извлеките, затем переставьте вручную.
Извлечение данных из счетов
Позиции счетов живут в таблицах, которые выходят сплошным текстом, а не сеткой. Это всё равно быстрее, чем перепечатывать, а цифры приходят ровно такими, какими напечатаны.
Возвращение к жизни старых документов
Превратить старую PDF-брошюру или инструкцию обратно в редактируемый текст обычно нужно ради слов, а не дизайна — дизайн, как правило, всё равно меняют.
Почему приватность здесь важна
Документы, из которых чаще всего хотят извлечь текст, — договоры, медицинские письма, финансовые отчёты — это именно те документы, которые меньше всего стоит загружать на сервер. Локальная обработка снимает вопрос, а не отвечает на него.
Когда лучше взять серверный конвертер
| Если вам нужно… | Используйте | Почему |
|---|---|---|
| Таблицы, сохранённые как таблицы | Adobe, Smallpdf или сам Word | Требуется реконструкция вёрстки |
| Чтобы файл Word выглядел как PDF | Коммерческий конвертер | Мы не воспроизводим вёрстку |
| Текст из отсканированного документа | Инструмент с OCR | Текстового слоя для чтения нет |
| Перенос изображений | Коммерческий конвертер | Здесь они не извлекаются |
| Только слова — и приватно | Этот инструмент | Ничего не загружается на сервер |
| Редактировать и цитировать текст | Этот инструмент | Текста и базовой структуры достаточно |
После PDF в Word: править, конвертировать обратно, отправлять
PDF в Word редко бывает последним шагом. Когда текст оказался в Word и вы его отредактировали, естественный следующий шаг — конвертация обратно: наш конвертер Word в PDF тоже работает целиком в браузере, поэтому весь круговорот не касается сервера.
Если исходный материал разбросан по нескольким PDF, сначала объедините их и извлеките текст один раз, вместо того чтобы извлекать несколько раз и сшивать результаты в Word.
Всё здесь следует одному правилу: ваши файлы остаются на вашей машине. Остальной набор — на странице бесплатных инструментов PDF, а инструменты для изображений — во всех наших бесплатных браузерных инструментах.