PDF na text
Extrahujte text na výber, skontrolujte ho a uložte ako TXT, pričom PDF zostáva vo vašom prehliadači.
Usporiadanie textu
Pri tabuľkách a stĺpcoch vyskúšajte približné rozloženie. Zarovnanie môže vyžadovať opravu.
PDF sa spracúva lokálne v prehliadači; súbor sa neodosiela na server. Text na čítanie zachováva poradie uložené v PDF, preto sa stĺpce a tabuľky môžu zobraziť v neočakávanom poradí.
Ako extrahovať text z PDF
- Začnite s PDF na text výberom PDF alebo jeho presunutím do oblasti súboru. Ak sa zobrazí výzva, zadajte heslo dokumentu.
- Nechajte pole Stránky prázdne na spracovanie celého dokumentu alebo zadajte výber. Napríklad 1-3, 5 extrahuje štyri stránky v tomto poradí.
- Pre bežné odseky zvoľte Text na čítanie. Ak záleží na medzerách medzi stĺpcami alebo položkami tabuľky, skúste Približné rozloženie.
- Ponechajte zapnuté oddeľovače stránok na identifikáciu zdrojových stránok a potom zvoľte Extrahovať text. Skontrolujte upozornenia na stránky bez použiteľného textu.
- Opravte upraviteľný výsledok a potom ho skopírujte alebo stiahnite ako .txt v kódovaní UTF-8. Obe akcie použijú aktuálne zobrazený text.
Praktické spôsoby použitia extrahovaného textu
- Skopírujte text zo správ PDF do pracovných poznámok bez prepisovania celých odsekov.
- Uložte znenie digitálneho dokumentu ako čistý text na neskoršiu úpravu.
- Zhromaždite vybrané stránky manuálu so zachovaním označení stránok na referenciu.
- Skontrolujte text z tabuľky s približnými medzerami pred opravou zarovnania.
- Skontrolujte počty slov a znakov pri odstraňovaní nechcených nadpisov z výsledku.
Otázky o extrakcii textu z PDF
Prečo stránka neposkytuje žiadny text?
Sken môže obsahovať obrázky písmen bez textovej vrstvy. Tento nástroj nevykonáva OCR. Stránky s menej ako tromi znakmi inými ako medzera sa hlásia ako stránky bez použiteľného textu; toto upozornenie spúšťajú aj prázdne stránky.
Ktoré usporiadanie textu si mám vybrať?
Text na čítanie sleduje poradie položiek uložené v PDF a používa pozície na pridanie medzier a zalomení riadkov. Približné rozloženie usporiada položky zhora nadol a zľava doprava a pridá medzi ne medzery. Ani jeden režim nezaručuje pôvodné poradie čítania pri zložitých stĺpcoch.
Prečo chýbajú medzery alebo sú znaky nesprávne?
PDF ukladá umiestnené fragmenty textu a niektoré písma majú neúplné mapovanie znakov. Skúste druhý režim usporiadania a porovnajte výstup s pôvodným dokumentom. Extrahovaný text môžete pred exportom opraviť.
Môžem extrahovať text z PDF chráneného heslom?
Keď sa zobrazí pole, zadajte heslo a zvoľte Otvoriť. Potrebujete správne heslo; nástroj ho neobchádza. Heslo sa uchováva v pamäti len počas daného načítania.
Zachová PDF na TXT formátovanie z Wordu?
TXT obsahuje čistý text so zalomeniami riadkov a medzerami. Nezachováva písma, obrázky, interaktívne formuláre ani digitálne podpisy a tento nástroj neexportuje dokumenty Wordu. Vygenerované označenia stránok sa do počtov nezahŕňajú; počty znakov nezahŕňajú ani zalomenia riadkov.
Odosiela sa môj PDF na server a môžem spracovať veľký súbor?
Súbor sa spracúva lokálne v prehliadači a neodosiela sa na server. Veľké dokumenty môžu trvať dlhšie alebo prekročiť dostupnú pamäť zariadenia. Výber menšieho počtu stránok zníži prácu pri extrakcii, hoci prehliadač stále musí otvoriť PDF.