Конвертировать PDF в Word

Назад на главную
Добавьте PDF-файл — или перетащите их сюда
PDF

Об этом конвертере PDF в текст

PDF, созданный программой, хранит текст как текст — каждое слово там есть, со своим положением на странице. Этот инструмент извлекает такой слой через PDF.js и возвращает его в формате, который можно открыть и править, что избавляет от ручной перепечатки уже существующего в цифровом виде документа.

Стоит трезво понимать, что именно восстанавливается. PDF описывает, где нарисован каждый фрагмент текста, а не то, как был устроен документ. Понятий абзаца, стиля заголовка или ячейки таблицы там нет — эта информация была в исходном файле и не пережила экспорт в PDF. Извлекается содержимое, а не форматирование.

Если PDF отсканирован, извлекать нечего — текстового слоя в нём нет. Тогда путь один: OCR.

Извлечение выполняется в браузере. Документ не загружается.

Как конвертировать PDF в редактируемый текст

  1. Добавьте PDF. Документ, созданный программой, а не отсканированный.
  2. Извлеките. Текстовый слой считывается постранично.
  3. Скачайте. Результат открывается в текстовых редакторах для правки.
  4. Переформатируйте. Рассчитывайте заново оформить заголовки, списки и таблицы: этой структуры в PDF не было.

Что переживает конвертацию

ЭлементРезультат
Связный текстИзвлекается надёжно
Порядок страницСохраняется
Стили заголовковТеряются — PDF их не хранит
ТаблицыИзвлекаются как разрозненный текст без структуры ячеек
ИзображенияНе включаются
Многоколоночная вёрсткаМожет выйти не в том порядке
Отсканированный PDFНичего — текстового слоя нет; нужен OCR

Документы в несколько колонок

Научная статья или рассылка в две колонки — тот случай, где извлечение работает хуже всего. Текст читается в порядке расположения фрагментов в файле, который не всегда совпадает с визуальным порядком чтения — результат может прыгать между колонками посреди каждой фразы.

Чистого автоматического решения для этого нет. Если документ важен и свёрстан в колонки, часто выгоднее копировать раздел за разделом прямо из просмотрщика PDF, чем править результат полного извлечения.

Частые вопросы

Сохраняется ли форматирование?

Нет. PDF хранит позиции текста, а не структуру документа: заголовков, стилей и таблиц как таковых в файле нет. Вы получаете содержимое и форматируете заново.

Работает ли с отсканированными PDF?

Нет. Скан является изображением и не имеет текстового слоя. Для таких документов используйте OCR.

Сохраняют ли таблицы структуру?

Нет. Текст ячеек извлекается, но без структуры строк и столбцов — он выходит разрозненным, в порядке расположения в файле.

Включаются ли изображения?

Нет. Извлекается только текст. Для извлечения изображений страниц используйте «PDF в JPG».

Почему текст вышел вперемешку?

Многоколоночные документы обычно дают такой результат, потому что извлечение следует порядку фрагментов в файле, а не визуальному порядку чтения.

Загружается ли документ?

Нет. Извлечение выполняется в браузере.

Похожие инструменты