PDF na text
Extrahujte vybíratelný text, zkontrolujte ho a uložte soubor TXT, přičemž PDF zůstává ve vašem prohlížeči.
Uspořádání textu
U tabulek a sloupců zkuste přibližné rozvržení. Zarovnání může vyžadovat opravu.
PDF se zpracovává lokálně v prohlížeči; soubor se neodesílá. Čitelný text sleduje pořadí uložené v PDF, takže sloupce a tabulky se mohou zobrazit v neočekávaném pořadí.
Jak extrahovat text z PDF
- Začněte s PDF na text výběrem PDF nebo přetažením do oblasti souboru. Pokud se zobrazí výzva, zadejte heslo dokumentu.
- Ponechte pole Stránky prázdné pro zpracování celého dokumentu, nebo zadejte výběr. Například 1-3, 5 extrahuje čtyři stránky v tomto pořadí.
- Pro běžné odstavce zvolte Čitelný text. Zkuste Přibližné rozvržení, když záleží na mezerách mezi sloupci nebo položkami tabulky.
- Ponechte zapnuté Oddělovače stránek pro identifikaci zdrojových stránek a zvolte Extrahovat text. Zkontrolujte případné upozornění na stránky bez použitelného textu.
- Opravte upravitelný výsledek a zkopírujte ho nebo stáhněte soubor .txt v kódování UTF-8. Obě akce použijí aktuálně zobrazený text.
Praktické využití extrahovaného textu
- Zkopírujte text ze zpráv PDF do pracovních poznámek bez přepisování celých odstavců.
- Uložte znění digitálního dokumentu jako prostý text pro pozdější úpravy.
- Shromážděte vybrané stránky manuálu a zachovejte popisky stránek pro referenci.
- Prohlédněte text z tabulky s přibližnými mezerami před opravou zarovnání.
- Zkontrolujte počty slov a znaků při odstraňování nechtěných nadpisů z výsledku.
Otázky o extrakci textu z PDF
Proč stránka neposkytuje žádný text?
Sken může obsahovat obrázky písmen bez textové vrstvy. Tento nástroj neprovádí OCR. Stránky s méně než třemi znaky jinými než mezery se hlásí jako stránky bez použitelného textu; toto upozornění spouštějí i prázdné stránky.
Které uspořádání textu mám zvolit?
Čitelný text sleduje pořadí položek uložené v PDF a používá pozice k přidání mezer a zlomů řádků. Přibližné rozvržení uspořádává položky shora dolů a zleva doprava a přidává mezi ně mezery. Ani jeden režim nezaručuje původní pořadí čtení u složitých sloupců.
Proč chybí mezery nebo jsou znaky nesprávné?
PDF ukládá umístěné fragmenty textu a některá písma mají neúplné mapování znaků. Zkuste druhý režim uspořádání a porovnejte výstup s originálem. Extrahovaný text můžete před exportem opravit.
Mohu extrahovat text z PDF chráněného heslem?
Zadejte heslo, když se zobrazí pole, a zvolte Otevřít. Potřebujete správné heslo; nástroj ho neobchází. Heslo je v paměti pouze pro toto načtení.
Zachovává PDF na TXT formátování Wordu?
TXT obsahuje prostý text se zlomy řádků a mezerami. Nezachovává písma, obrázky, interaktivní formuláře ani digitální podpisy a tento nástroj neexportuje dokumenty Word. Vygenerované popisky stránek se do počtů nezahrnují; součty znaků také nezahrnují zlomy řádků.
Nahrává se moje PDF a mohu zpracovat velký soubor?
Soubor se zpracovává lokálně v prohlížeči a nenahrává se. Velké dokumenty mohou trvat déle nebo překročit dostupnou paměť zařízení. Výběr menšího počtu stránek snižuje práci při extrakci, i když prohlížeč stále musí PDF otevřít.