Späť na AllToolio

PDF na text

Extrahujte text na výber, skontrolujte ho a uložte ako TXT, pričom PDF zostáva vo vašom prehliadači.

alebo sem presuňte PDF
Nechajte prázdne pre všetky stránky. Príklad: 1-3, 5. Zápis 8- znamená od strany 8 po koniec.

Usporiadanie textu

Pri tabuľkách a stĺpcoch vyskúšajte približné rozloženie. Zarovnanie môže vyžadovať opravu.

Choose a PDF to start.

PDF sa spracúva lokálne v prehliadači; súbor sa neodosiela na server. Text na čítanie zachováva poradie uložené v PDF, preto sa stĺpce a tabuľky môžu zobraziť v neočakávanom poradí.

Ako extrahovať text z PDF

  1. Začnite s PDF na text výberom PDF alebo jeho presunutím do oblasti súboru. Ak sa zobrazí výzva, zadajte heslo dokumentu.
  2. Nechajte pole Stránky prázdne na spracovanie celého dokumentu alebo zadajte výber. Napríklad 1-3, 5 extrahuje štyri stránky v tomto poradí.
  3. Pre bežné odseky zvoľte Text na čítanie. Ak záleží na medzerách medzi stĺpcami alebo položkami tabuľky, skúste Približné rozloženie.
  4. Ponechajte zapnuté oddeľovače stránok na identifikáciu zdrojových stránok a potom zvoľte Extrahovať text. Skontrolujte upozornenia na stránky bez použiteľného textu.
  5. Opravte upraviteľný výsledok a potom ho skopírujte alebo stiahnite ako .txt v kódovaní UTF-8. Obe akcie použijú aktuálne zobrazený text.

Praktické spôsoby použitia extrahovaného textu

  • Skopírujte text zo správ PDF do pracovných poznámok bez prepisovania celých odsekov.
  • Uložte znenie digitálneho dokumentu ako čistý text na neskoršiu úpravu.
  • Zhromaždite vybrané stránky manuálu so zachovaním označení stránok na referenciu.
  • Skontrolujte text z tabuľky s približnými medzerami pred opravou zarovnania.
  • Skontrolujte počty slov a znakov pri odstraňovaní nechcených nadpisov z výsledku.

Otázky o extrakcii textu z PDF

Prečo stránka neposkytuje žiadny text?

Sken môže obsahovať obrázky písmen bez textovej vrstvy. Tento nástroj nevykonáva OCR. Stránky s menej ako tromi znakmi inými ako medzera sa hlásia ako stránky bez použiteľného textu; toto upozornenie spúšťajú aj prázdne stránky.

Ktoré usporiadanie textu si mám vybrať?

Text na čítanie sleduje poradie položiek uložené v PDF a používa pozície na pridanie medzier a zalomení riadkov. Približné rozloženie usporiada položky zhora nadol a zľava doprava a pridá medzi ne medzery. Ani jeden režim nezaručuje pôvodné poradie čítania pri zložitých stĺpcoch.

Prečo chýbajú medzery alebo sú znaky nesprávne?

PDF ukladá umiestnené fragmenty textu a niektoré písma majú neúplné mapovanie znakov. Skúste druhý režim usporiadania a porovnajte výstup s pôvodným dokumentom. Extrahovaný text môžete pred exportom opraviť.

Môžem extrahovať text z PDF chráneného heslom?

Keď sa zobrazí pole, zadajte heslo a zvoľte Otvoriť. Potrebujete správne heslo; nástroj ho neobchádza. Heslo sa uchováva v pamäti len počas daného načítania.

Zachová PDF na TXT formátovanie z Wordu?

TXT obsahuje čistý text so zalomeniami riadkov a medzerami. Nezachováva písma, obrázky, interaktívne formuláre ani digitálne podpisy a tento nástroj neexportuje dokumenty Wordu. Vygenerované označenia stránok sa do počtov nezahŕňajú; počty znakov nezahŕňajú ani zalomenia riadkov.

Odosiela sa môj PDF na server a môžem spracovať veľký súbor?

Súbor sa spracúva lokálne v prehliadači a neodosiela sa na server. Veľké dokumenty môžu trvať dlhšie alebo prekročiť dostupnú pamäť zariadenia. Výber menšieho počtu stránok zníži prácu pri extrakcii, hoci prehliadač stále musí otvoriť PDF.

Pokračujte v práci s textom alebo PDF