PDF в текст
Извлеките выделяемый текст, проверьте его и сохраните файл TXT: PDF остаётся в вашем браузере.
Расположение текста
Для таблиц и колонок попробуйте приблизительный макет. Выравнивание может потребовать правки.
PDF обрабатывается локально в браузере; файл не загружается на сервер. Режим «Текст для чтения» следует порядку, сохранённому в PDF, поэтому колонки и таблицы могут отображаться в неожиданном порядке.
Как извлечь текст из PDF
- Начните с PDF в текст: выберите PDF или перетащите его в область файла. Если появится запрос, введите пароль документа.
- Оставьте поле «Страницы» пустым, чтобы обработать весь документ, или введите выборку. Например, 1-3, 5 извлекает четыре страницы в этом порядке.
- Выберите «Текст для чтения» для обычных абзацев. Попробуйте «Приблизительный макет», когда важны пробелы между колонками или элементами таблицы.
- Оставьте разделители страниц включёнными, чтобы определять исходные страницы, затем выберите «Извлечь текст». Просмотрите уведомление о страницах без пригодного текста.
- Исправьте редактируемый результат, затем скопируйте его или скачайте файл .txt в UTF-8. Оба действия используют текущий показанный текст.
Практические способы использовать извлечённый текст
- Копировать текст из отчётов PDF в рабочие заметки, не перепечатывая целые абзацы.
- Сохранить формулировки цифрового документа как простой текст для дальнейшего редактирования.
- Собрать выбранные страницы руководства, сохранив метки страниц для ссылок.
- Проверить текст из таблицы с приблизительными отступами перед исправлением выравнивания.
- Проверить количество слов и символов, удаляя ненужные заголовки из результата.
Вопросы об извлечении текста из PDF
Почему страница не даёт текста?
Скан может содержать изображения букв без текстового слоя. Этот инструмент не выполняет OCR. Страницы с менее чем тремя непробельными символами отмечаются как не содержащие пригодного текста; пустые страницы также вызывают это уведомление.
Какой режим расположения текста выбрать?
«Текст для чтения» следует сохранённому в PDF порядку элементов и использует позиции для добавления пробелов и разрывов строк. «Приблизительный макет» упорядочивает элементы сверху вниз и слева направо, добавляя между ними пробелы. Ни один режим не гарантирует исходный порядок чтения для сложных колонок.
Почему пропадают пробелы или появляются неверные символы?
PDF хранит позиционированные фрагменты текста, а у некоторых шрифтов неполные таблицы символов. Попробуйте другой режим расположения и сравните вывод с оригиналом. Извлечённый текст можно исправить перед экспортом.
Можно ли извлечь текст из PDF с паролем?
Введите пароль, когда появится поле, затем выберите «Открыть». Нужен правильный пароль; инструмент его не обходит. Пароль хранится в памяти только на время этой загрузки.
Сохраняет ли PDF в TXT форматирование Word?
TXT содержит простой текст с разрывами строк и пробелами. Он не сохраняет шрифты, изображения, интерактивные формы и цифровые подписи, и этот инструмент не экспортирует документы Word. Созданные метки страниц исключаются из подсчётов; количество символов также не включает разрывы строк.
Загружается ли мой PDF и можно ли обработать большой файл?
Файл обрабатывается локально в браузере и не загружается на сервер. Большие документы могут обрабатываться дольше или превысить доступную память устройства. Выбор меньшего числа страниц уменьшает работу по извлечению, хотя браузеру всё равно нужно открыть PDF.