Распознавание текста (OCR)

Добавьте файлы PDF или изображения — или перетащите их сюда
PDF JPG PNG WEBP

Об этом инструменте OCR для PDF

Отсканированный PDF выглядит как документ, но ведёт себя как фотография. По нему нельзя искать, из него нельзя копировать, на него нельзя ссылаться — каждая страница является изображением текста, и компьютер не знает, что там написано.

Оптическое распознавание символов это решает. Инструмент использует tesseract.js — сборку движка Tesseract под WebAssembly, самого распространённого распознавателя с открытым кодом. Каждая страница отрисовывается и анализируется, а распознанный текст возвращается для копирования.

Качество результата почти целиком зависит от качества скана. Чёткая, ровная, контрастная страница распознаётся очень хорошо; фотография, снятая под углом с падающей тенью, даёт результат, который придётся вычитывать построчно.

Распознавание полностью выполняется в браузере. Документ не отправляется ни в какой OCR-сервис, что важно, когда речь идёт о переписке или личных записях.

Как применить OCR к PDF

  1. Добавьте отсканированный PDF. Перетащите файл.
  2. Выберите язык. Правильный язык заметно улучшает распознавание, особенно диакритики и специфических символов.
  3. Запустите. Каждая страница отрисовывается и анализируется. Процесс долгий: рассчитывайте на заметное время на страницу.
  4. Вычитайте текст. Скопируйте результат и проверьте его. Собственные имена, числа и таблицы — там, где OCR ошибается чаще всего.

Что определяет качество распознавания

ФакторВлияние
Разрешение скана300 dpi — разумный минимум; ниже точность падает
ВыравниваниеНаклонённые страницы заметно снижают точность
КонтрастЧёрное на белом идеально; сероватый фон вредит
ШрифтОбычная антиква или гротеск распознаются хорошо; рукописный — нет
Структура страницыОдна колонка связного текста — лучший случай; таблицы и колонки сбивают

Рассчитывайте на время и вычитку

OCR вычислительно тяжёл, и здесь он работает на вашей машине, а не на сервере. Документ на двадцать страниц займёт заметное время, и браузер будет занят. Дайте ему отработать.

Затем вычитайте. Даже хорошее распознавание ошибается в собственных именах, в последовательностях цифр и во всём, что размещено таблицей. Если текст пойдёт на что-то важное, вычитка не опциональна.

Частые вопросы

Какие языки поддерживаются?

tesseract.js поддерживает широкий набор языков. Выберите язык документа перед запуском: правильная модель заметно улучшает распознавание диакритики и специфических символов.

Насколько точно распознавание?

Зависит от скана. Чёткая, ровная, контрастная страница даёт очень хороший результат. Наклонённые фотографии с тенями или низким разрешением требуют внимательной вычитки.

Распознаёт ли рукописный текст?

Надёжно — нет. Tesseract обучен на печатном тексте; рукописный даёт очень слабый результат.

Почему это так долго?

Потому что распознавание работает на вашей машине через WebAssembly, а не на сервере. Такова цена того, что документ не покидает браузер.

Станет ли PDF доступным для поиска?

Инструмент извлекает распознанный текст, чтобы его можно было скопировать. Он не пересобирает PDF с невидимым текстовым слоем под изображением.

Отправляется ли документ в какой-либо сервис?

Нет. Всё распознавание происходит в этой вкладке.

Похожие инструменты