OCR PDF — извлечение текста из отсканированных страниц

Превращайте отсканированные PDF и PDF, содержащие только изображения, в доступный для поиска и выделения текст. Распознавайте 10 языков, извлекайте текст в файл .txt или создавайте PDF с возможностью поиска с невидимым текстовым слоем. Всё выполняется в вашем браузере.

Ключевые возможности

10+ языков

Распознавайте английский, китайский (упрощённый и традиционный), японский, корейский, испанский, французский, немецкий, португальский и арабский — или комбинируйте несколько сразу.

PDF с возможностью поиска

Создавайте PDF с невидимым текстовым слоем, чтобы отсканированные страницы стали доступны для поиска и выделения в любом просмотрщике.

Извлечение текста

Извлекайте распознанный текст в обычный файл .txt с разделителями страниц, готовый к редактированию или копированию.

Полный контроль

Выбирайте формат вывода, качество OCR и конкретный диапазон страниц — не нужно обрабатывать весь документ.

100% конфиденциально

Вся обработка выполняется локально в вашем браузере. Ваши файлы никогда не загружаются на серверы.

Без установки, бесплатно

Работает на любом устройстве с браузером. Без регистрации, без водяных знаков и полностью бесплатно.

Что такое OCR PDF?

OCR (оптическое распознавание символов) преобразует изображения текста в машиночитаемый текст. Отсканированные PDF — это фактически картинки страниц: слова нельзя найти, скопировать или выделить. Этот инструмент отображает каждую страницу и распознаёт текст с помощью механизма OCR на нейросети, а затем позволяет либо экспортировать распознанный текст, либо записать его обратно в PDF в виде невидимого текстового слоя. Результат — документ, в котором можно искать слова, выделять и копировать предложения и автоматически индексировать содержимое. Вся обработка выполняется локально в вашем браузере, поэтому ваши документы никогда не покидают ваше устройство.

Как выполнить OCR для PDF

Выполнение OCR занимает всего несколько шагов. Всё происходит в вашем браузере.

1

Загрузите отсканированный PDF

Перетащите отсканированный PDF или PDF, содержащий только изображения, или нажмите на область загрузки, чтобы выбрать его.

2

Выберите параметры

Выберите язык(и), формат вывода (текст или PDF с возможностью поиска), качество и при необходимости диапазон страниц. Значения по умолчанию работают для большинства документов.

3

Начните OCR

Нажмите «Начать OCR». Каждая выбранная страница отображается и распознаётся автоматически.

4

Скачайте результат

Скачайте извлечённый файл .txt или PDF с возможностью поиска. Для текстового вывода предпросмотр показывает распознанное содержимое.

Полезно знать

Для лучших результатов используйте чёткие сканы высокого разрешения и выбирайте правильный(е) язык(и). Очень мелкий, размытый или сильно стилизованный текст может распознаваться с меньшей точностью. Защищённые паролем PDF должны быть разблокированы перед OCR. Первый запуск OCR загружает механизм распознавания и языковые данные, что может занять несколько секунд; последующие запуски быстрее. Более высокие настройки качества повышают точность, но замедляют обработку. Арабский и некоторые письменности лучше всего распознаются, когда их язык выбран отдельно.

Часто задаваемые вопросы