PDF, созданный программой, хранит текст как текст — каждое слово там есть, со своим положением на странице. Этот инструмент извлекает такой слой через PDF.js и возвращает его в формате, который можно открыть и править, что избавляет от ручной перепечатки уже существующего в цифровом виде документа.
Стоит трезво понимать, что именно восстанавливается. PDF описывает, где нарисован каждый фрагмент текста, а не то, как был устроен документ. Понятий абзаца, стиля заголовка или ячейки таблицы там нет — эта информация была в исходном файле и не пережила экспорт в PDF. Извлекается содержимое, а не форматирование.
Если PDF отсканирован, извлекать нечего — текстового слоя в нём нет. Тогда путь один: OCR.
Извлечение выполняется в браузере. Документ не загружается.
| Элемент | Результат |
|---|---|
| Связный текст | Извлекается надёжно |
| Порядок страниц | Сохраняется |
| Стили заголовков | Теряются — PDF их не хранит |
| Таблицы | Извлекаются как разрозненный текст без структуры ячеек |
| Изображения | Не включаются |
| Многоколоночная вёрстка | Может выйти не в том порядке |
| Отсканированный PDF | Ничего — текстового слоя нет; нужен OCR |
Научная статья или рассылка в две колонки — тот случай, где извлечение работает хуже всего. Текст читается в порядке расположения фрагментов в файле, который не всегда совпадает с визуальным порядком чтения — результат может прыгать между колонками посреди каждой фразы.
Чистого автоматического решения для этого нет. Если документ важен и свёрстан в колонки, часто выгоднее копировать раздел за разделом прямо из просмотрщика PDF, чем править результат полного извлечения.
Нет. PDF хранит позиции текста, а не структуру документа: заголовков, стилей и таблиц как таковых в файле нет. Вы получаете содержимое и форматируете заново.
Нет. Скан является изображением и не имеет текстового слоя. Для таких документов используйте OCR.
Нет. Текст ячеек извлекается, но без структуры строк и столбцов — он выходит разрозненным, в порядке расположения в файле.
Нет. Извлекается только текст. Для извлечения изображений страниц используйте «PDF в JPG».
Многоколоночные документы обычно дают такой результат, потому что извлечение следует порядку фрагментов в файле, а не визуальному порядку чтения.
Нет. Извлечение выполняется в браузере.