Отсканированный PDF выглядит как документ, но ведёт себя как фотография. По нему нельзя искать, из него нельзя копировать, на него нельзя ссылаться — каждая страница является изображением текста, и компьютер не знает, что там написано.
Оптическое распознавание символов это решает. Инструмент использует tesseract.js — сборку движка Tesseract под WebAssembly, самого распространённого распознавателя с открытым кодом. Каждая страница отрисовывается и анализируется, а распознанный текст возвращается для копирования.
Качество результата почти целиком зависит от качества скана. Чёткая, ровная, контрастная страница распознаётся очень хорошо; фотография, снятая под углом с падающей тенью, даёт результат, который придётся вычитывать построчно.
Распознавание полностью выполняется в браузере. Документ не отправляется ни в какой OCR-сервис, что важно, когда речь идёт о переписке или личных записях.
| Фактор | Влияние |
|---|---|
| Разрешение скана | 300 dpi — разумный минимум; ниже точность падает |
| Выравнивание | Наклонённые страницы заметно снижают точность |
| Контраст | Чёрное на белом идеально; сероватый фон вредит |
| Шрифт | Обычная антиква или гротеск распознаются хорошо; рукописный — нет |
| Структура страницы | Одна колонка связного текста — лучший случай; таблицы и колонки сбивают |
OCR вычислительно тяжёл, и здесь он работает на вашей машине, а не на сервере. Документ на двадцать страниц займёт заметное время, и браузер будет занят. Дайте ему отработать.
Затем вычитайте. Даже хорошее распознавание ошибается в собственных именах, в последовательностях цифр и во всём, что размещено таблицей. Если текст пойдёт на что-то важное, вычитка не опциональна.
tesseract.js поддерживает широкий набор языков. Выберите язык документа перед запуском: правильная модель заметно улучшает распознавание диакритики и специфических символов.
Зависит от скана. Чёткая, ровная, контрастная страница даёт очень хороший результат. Наклонённые фотографии с тенями или низким разрешением требуют внимательной вычитки.
Надёжно — нет. Tesseract обучен на печатном тексте; рукописный даёт очень слабый результат.
Потому что распознавание работает на вашей машине через WebAssembly, а не на сервере. Такова цена того, что документ не покидает браузер.
Инструмент извлекает распознанный текст, чтобы его можно было скопировать. Он не пересобирает PDF с невидимым текстовым слоем под изображением.
Нет. Всё распознавание происходит в этой вкладке.