Распознать текст в PDF: сканированный PDF в текст
Распознайте текст на страницах сканированного PDF локально в браузере; документ не загружается на сервер.
Ваши файлы остаются в этом браузере. Без загрузки на сервер, аккаунтов и сохранения данных документа.
До 50 позиций в очереди, включая до 50 страниц PDF. Изображения больше 40 мегапикселей уменьшаются перед OCR. GIF: только первый кадр.
Лучше всего распознаётся печатный текст. Рукописный текст, размытый или очень мелкий текст, таблицы и сложная вёрстка могут быть распознаны плохо или в другом порядке. Языковые модели загружаются при первом использовании (от одного до нескольких МБ каждая); браузер может сохранить их в кэше.
Большинство выбранных страниц в одном из PDF уже содержат текст. Можно продолжить с OCR или извлечь существующий текст напрямую: Открыть PDF в текст
Проверьте и сохраните
Уверенность распознавания — это оценка самого движка, а не показатель правильности. Сравните важные детали с оригиналом.
Кнопки «Копировать всё» и «Скачать TXT» используют текст из этого поля. Редактирование позиции, добавление или удаление позиций, а также повторное распознавание заново собирают это поле из текстов отдельных позиций.
Ручные правки текста попадают только в TXT. PDF с поиском сохраняет исходный текстовый слой движка OCR; сравните его с изображениями страниц.
Как выполнить OCR для PDF
- Чтобы распознать текст в сканированном PDF, добавьте документ и введите пароль, если файл защищён.
- Укажите номера страниц, например 1–3, 5, или оставьте диапазон пустым, чтобы выбрать все страницы.
- Проверьте уведомление о текстовом слое. Если большинство выбранных страниц уже содержат текст, перейдите по ссылке «PDF в текст» для извлечения без OCR.
- Выберите язык документа, необязательный второй язык и подходящую вёрстку. При необходимости настройте предпросмотр страницы.
- Распознайте выбранные страницы, исправьте редактируемый текст и скачайте TXT. Оставьте PDF с поиском включённым, если он тоже нужен.
Когда помогает OCR PDF
- Сделайте слова на сканированном договоре, письме или архивной странице доступными для копирования.
- Запускайте распознавание только для нужных страниц, а не для всего документа.
- Проверьте каждую страницу рядом с результатом и исправьте имена или числа перед сохранением.
- Используйте PDF с поиском, когда нужно находить слова, сохраняя изображения страниц.
- Измените обрезку или вёрстку чтения и распознайте сложную страницу снова.
Вопросы о PDF OCR
Нужен ли OCR для PDF с выделяемым текстом?
Обычно нет. Инструмент проверяет выбранные страницы на наличие текстового слоя и предлагает перейти к «PDF в текст», когда он есть на большинстве страниц. Вы всё равно можете продолжить с OCR.
Что влияет на распознавание сканированных страниц?
Чёткие печатные страницы обычно распознаются лучше, чем рукописный текст, размытые сканы или сложные таблицы. Скан около 300 DPI — полезный ориентир; увеличение плохого скана не восстановит отсутствующие детали. Уверенность — это лишь оценка движка.
Сколько страниц можно выбрать?
За один запуск можно обработать до 50 страниц PDF, при этом общее число позиций в очереди — не более 50. Большие документы также могут быть ограничены памятью устройства.
Может ли PDF содержать больше одного языка?
Доступно 20 языковых моделей. Один язык документа обязателен, второй — необязателен. Выбирайте языки, которые используются на страницах, так как определение не выполняется автоматически.
Загружается ли PDF на сервер для распознавания?
PDF обрабатывается локально в вашем браузере и не загружается на сервер. Языковые файлы скачиваются при первом использовании и могут оставаться в кэше. Этот сайт показывает рекламу.
Что содержит PDF с поиском?
Он объединяет распознанный текст с исходными изображениями страниц, поэтому скачиваемый файл может быть большим. Вы также можете скопировать исправленный текст или сохранить его как TXT.