Назад к AllToolio

PDF в текст

Извлеките выделяемый текст, проверьте его и сохраните файл TXT: PDF остаётся в вашем браузере.

или перетащите сюда PDF
Оставьте пустым для всех страниц. Пример: 1-3, 5. Запись 8- означает страницы с 8-й до конца.

Расположение текста

Для таблиц и колонок попробуйте приблизительный макет. Выравнивание может потребовать правки.

Choose a PDF to start.

PDF обрабатывается локально в браузере; файл не загружается на сервер. Режим «Текст для чтения» следует порядку, сохранённому в PDF, поэтому колонки и таблицы могут отображаться в неожиданном порядке.

Как извлечь текст из PDF

  1. Начните с PDF в текст: выберите PDF или перетащите его в область файла. Если появится запрос, введите пароль документа.
  2. Оставьте поле «Страницы» пустым, чтобы обработать весь документ, или введите выборку. Например, 1-3, 5 извлекает четыре страницы в этом порядке.
  3. Выберите «Текст для чтения» для обычных абзацев. Попробуйте «Приблизительный макет», когда важны пробелы между колонками или элементами таблицы.
  4. Оставьте разделители страниц включёнными, чтобы определять исходные страницы, затем выберите «Извлечь текст». Просмотрите уведомление о страницах без пригодного текста.
  5. Исправьте редактируемый результат, затем скопируйте его или скачайте файл .txt в UTF-8. Оба действия используют текущий показанный текст.

Практические способы использовать извлечённый текст

  • Копировать текст из отчётов PDF в рабочие заметки, не перепечатывая целые абзацы.
  • Сохранить формулировки цифрового документа как простой текст для дальнейшего редактирования.
  • Собрать выбранные страницы руководства, сохранив метки страниц для ссылок.
  • Проверить текст из таблицы с приблизительными отступами перед исправлением выравнивания.
  • Проверить количество слов и символов, удаляя ненужные заголовки из результата.

Вопросы об извлечении текста из PDF

Почему страница не даёт текста?

Скан может содержать изображения букв без текстового слоя. Этот инструмент не выполняет OCR. Страницы с менее чем тремя непробельными символами отмечаются как не содержащие пригодного текста; пустые страницы также вызывают это уведомление.

Какой режим расположения текста выбрать?

«Текст для чтения» следует сохранённому в PDF порядку элементов и использует позиции для добавления пробелов и разрывов строк. «Приблизительный макет» упорядочивает элементы сверху вниз и слева направо, добавляя между ними пробелы. Ни один режим не гарантирует исходный порядок чтения для сложных колонок.

Почему пропадают пробелы или появляются неверные символы?

PDF хранит позиционированные фрагменты текста, а у некоторых шрифтов неполные таблицы символов. Попробуйте другой режим расположения и сравните вывод с оригиналом. Извлечённый текст можно исправить перед экспортом.

Можно ли извлечь текст из PDF с паролем?

Введите пароль, когда появится поле, затем выберите «Открыть». Нужен правильный пароль; инструмент его не обходит. Пароль хранится в памяти только на время этой загрузки.

Сохраняет ли PDF в TXT форматирование Word?

TXT содержит простой текст с разрывами строк и пробелами. Он не сохраняет шрифты, изображения, интерактивные формы и цифровые подписи, и этот инструмент не экспортирует документы Word. Созданные метки страниц исключаются из подсчётов; количество символов также не включает разрывы строк.

Загружается ли мой PDF и можно ли обработать большой файл?

Файл обрабатывается локально в браузере и не загружается на сервер. Большие документы могут обрабатываться дольше или превысить доступную память устройства. Выбор меньшего числа страниц уменьшает работу по извлечению, хотя браузеру всё равно нужно открыть PDF.

Продолжите работу с текстом или PDF