PDF у текст
Видобудьте текст, доступний для виділення, перегляньте його та збережіть файл TXT; PDF залишається у вашому браузері.
Розташування тексту
Спробуйте приблизний макет для таблиць і колонок. Вирівнювання може потребувати виправлення.
PDF обробляється локально у браузері; файл нікуди не надсилається. Текст для читання дотримується порядку, збереженого в PDF, тому колонки й таблиці можуть з’явитися в неочікуваному порядку.
Як видобути текст із PDF
- Почніть із «PDF у текст»: виберіть PDF або перетягніть його в область файлу. Якщо з’явиться запит, введіть пароль документа.
- Залиште поле «Сторінки» порожнім, щоб обробити весь документ, або введіть вибір. Наприклад, 1-3, 5 видобуває чотири сторінки в цьому порядку.
- Виберіть «Текст для читання» для звичайних абзаців. Спробуйте «Приблизний макет», коли важливі проміжки між колонками чи елементами таблиці.
- Залиште роздільники сторінок увімкненими, щоб визначати вихідні сторінки, а потім виберіть «Видобути текст». Перегляньте будь-яке повідомлення про сторінки без придатного тексту.
- Виправте редагований результат, а потім скопіюйте його або завантажте файл .txt у кодуванні UTF-8. Обидві дії використовують текст, показаний наразі.
Практичне використання видобутого тексту
- Копіювати текст зі звітів PDF у робочі нотатки, не передруковуючи цілі абзаци.
- Зберегти формулювання цифрового документа як простий текст для подальшого редагування.
- Зібрати вибрані сторінки посібника, зберігши позначки сторінок для довідки.
- Переглянути текст із таблиці з приблизними проміжками перед виправленням вирівнювання.
- Перевірити підсумки слів і символів, прибираючи непотрібні заголовки з результату.
Питання про видобування тексту з PDF
Чому сторінка не дає тексту?
Скан може містити зображення літер без текстового шару. Цей інструмент не виконує OCR. Сторінки з менш ніж трьома символами, крім пробілів, позначаються як такі, що не мають придатного тексту; порожні сторінки також викликають це повідомлення.
Яке розташування тексту вибрати?
«Текст для читання» дотримується збереженого в PDF порядку елементів і використовує позиції для додавання проміжків і розривів рядків. «Приблизний макет» упорядковує елементи згори донизу та зліва направо, додаючи між ними пробіли. Жоден режим не гарантує початкового порядку читання для складних колонок.
Чому пропущено пробіли або символи неправильні?
PDF зберігає позиціоновані фрагменти тексту, а деякі шрифти мають неповні відображення символів. Спробуйте інший режим розташування та порівняйте результат з оригіналом. Ви можете виправити видобутий текст перед експортом.
Чи можна видобути текст із PDF, захищеного паролем?
Введіть пароль, коли з’явиться поле, а потім виберіть «Відкрити». Потрібен правильний пароль; інструмент його не обходить. Пароль утримується в пам’яті лише для цього завантаження.
Чи зберігає PDF у TXT форматування Word?
TXT містить простий текст із розривами рядків і пробілами. Він не зберігає шрифти, зображення, інтерактивні форми чи цифрові підписи, і цей інструмент не експортує документи Word. Згенеровані позначки сторінок не враховуються в підрахунках; підсумок символів також не включає розриви рядків.
Чи надсилається мій PDF і чи можна обробити великий файл?
Файл обробляється локально у вашому браузері й нікуди не надсилається. Великі документи можуть тривати довше або перевищити доступну пам’ять пристрою. Вибір меншої кількості сторінок зменшує роботу з видобування, хоча браузер усе одно має відкрити PDF.