PDF na tekst
Wyodrębnij tekst z PDF, popraw go i zapisz w pliku TXT — dokument pozostaje w Twojej przeglądarce.
Układ tekstu
Przy tabelach i kolumnach wypróbuj przybliżony układ. Wyrównanie może wymagać poprawek.
Przetwarzanie odbywa się lokalnie w przeglądarce; plik PDF nie jest przesyłany na serwer. Tryb „Tekst do czytania” zachowuje kolejność zapisaną w PDF, więc treść kolumn i tabel może pojawić się w nieoczekiwanej kolejności.
Jak wyodrębnić tekst z pliku PDF
- Aby zamienić PDF na tekst, wybierz plik lub przeciągnij go do wskazanego pola. Jeśli pojawi się prośba o hasło, wpisz hasło do dokumentu.
- Pozostaw pole Strony puste, aby przetworzyć cały dokument, albo podaj zakres. Zapis 1-3, 5 wybiera cztery strony w podanej kolejności.
- Do zwykłych akapitów wybierz „Tekst do czytania”. Jeśli ważne są odstępy między kolumnami lub komórkami tabeli, wypróbuj „Przybliżony układ”.
- Zostaw włączone separatory stron, jeśli chcesz zachować ich oznaczenia, i kliknij „Wyodrębnij tekst”. Sprawdź komunikaty o stronach bez tekstu.
- Popraw wynik w polu tekstowym, a następnie skopiuj go lub pobierz plik .txt w kodowaniu UTF-8. Obie opcje uwzględniają wprowadzone poprawki.
Do czego przyda się wyodrębniony tekst
- Przenoszenie fragmentów raportu do własnych notatek bez ręcznego przepisywania akapitów.
- Zapisywanie treści dokumentu cyfrowego w prostym formacie do dalszej edycji.
- Zbieranie wybranych stron instrukcji z oznaczeniami ułatwiającymi powrót do źródła.
- Odczytywanie zawartości tabeli z przybliżonymi odstępami przed ręcznym poprawieniem układu.
- Sprawdzanie liczby słów i znaków podczas usuwania zbędnych nagłówków z wyniku.
Pytania o wyodrębnianie tekstu z PDF
Dlaczego na stronie nie znaleziono tekstu?
Skan może zawierać obraz liter, ale nie mieć warstwy tekstowej. To narzędzie nie wykonuje OCR. Strona z mniej niż trzema znakami innymi niż białe znaki jest zgłaszana jako pozbawiona tekstu do wyodrębnienia. Komunikat może więc dotyczyć także pustej strony.
Który tryb układu wybrać?
„Tekst do czytania” korzysta z kolejności fragmentów zapisanej w PDF i dodaje odstępy oraz podziały wierszy na podstawie ich położenia. „Przybliżony układ” porządkuje fragmenty od góry do dołu i od lewej do prawej, rozdzielając je spacjami. Przy złożonych kolumnach żaden tryb nie gwarantuje prawidłowej kolejności czytania.
Skąd biorą się brakujące spacje lub błędne znaki?
PDF przechowuje fragmenty tekstu wraz z ich położeniem, a niektóre czcionki mają niepełne mapowanie znaków. Wypróbuj drugi tryb i porównaj wynik z oryginałem. Błędy możesz poprawić bezpośrednio w polu z wyodrębnionym tekstem.
Czy można odczytać PDF zabezpieczony hasłem?
Gdy pojawi się pole hasła, wpisz je i kliknij „Otwórz”. Potrzebujesz poprawnego hasła — narzędzie nie omija zabezpieczenia. Hasło pozostaje w pamięci tylko na czas danego wczytywania dokumentu.
Czy konwersja PDF na TXT zachowuje formatowanie Worda?
TXT zapisuje zwykły tekst, spacje i podziały wierszy. Nie zachowuje czcionek, obrazów, interaktywnych formularzy ani podpisów cyfrowych. Eksport do Worda nie jest dostępny. Liczniki pomijają wygenerowane oznaczenia stron, a liczba znaków nie obejmuje podziałów wierszy.
Czy plik trafia na serwer i co z dużymi dokumentami?
PDF jest przetwarzany lokalnie w przeglądarce i nie jest przesyłany na serwer. Duże dokumenty mogą wymagać więcej czasu lub przekroczyć dostępną pamięć urządzenia. Wybranie mniejszej liczby stron ogranicza pracę przy wyodrębnianiu tekstu, ale przeglądarka nadal musi otworzyć plik.