Zpět na AllToolio

PDF na text

Extrahujte vybíratelný text, zkontrolujte ho a uložte soubor TXT, přičemž PDF zůstává ve vašem prohlížeči.

nebo sem přetáhněte PDF
Ponechte prázdné pro všechny stránky. Příklad: 1-3, 5. Zápis 8- znamená stránky od 8 do konce.

Uspořádání textu

U tabulek a sloupců zkuste přibližné rozvržení. Zarovnání může vyžadovat opravu.

Choose a PDF to start.

PDF se zpracovává lokálně v prohlížeči; soubor se neodesílá. Čitelný text sleduje pořadí uložené v PDF, takže sloupce a tabulky se mohou zobrazit v neočekávaném pořadí.

Jak extrahovat text z PDF

  1. Začněte s PDF na text výběrem PDF nebo přetažením do oblasti souboru. Pokud se zobrazí výzva, zadejte heslo dokumentu.
  2. Ponechte pole Stránky prázdné pro zpracování celého dokumentu, nebo zadejte výběr. Například 1-3, 5 extrahuje čtyři stránky v tomto pořadí.
  3. Pro běžné odstavce zvolte Čitelný text. Zkuste Přibližné rozvržení, když záleží na mezerách mezi sloupci nebo položkami tabulky.
  4. Ponechte zapnuté Oddělovače stránek pro identifikaci zdrojových stránek a zvolte Extrahovat text. Zkontrolujte případné upozornění na stránky bez použitelného textu.
  5. Opravte upravitelný výsledek a zkopírujte ho nebo stáhněte soubor .txt v kódování UTF-8. Obě akce použijí aktuálně zobrazený text.

Praktické využití extrahovaného textu

  • Zkopírujte text ze zpráv PDF do pracovních poznámek bez přepisování celých odstavců.
  • Uložte znění digitálního dokumentu jako prostý text pro pozdější úpravy.
  • Shromážděte vybrané stránky manuálu a zachovejte popisky stránek pro referenci.
  • Prohlédněte text z tabulky s přibližnými mezerami před opravou zarovnání.
  • Zkontrolujte počty slov a znaků při odstraňování nechtěných nadpisů z výsledku.

Otázky o extrakci textu z PDF

Proč stránka neposkytuje žádný text?

Sken může obsahovat obrázky písmen bez textové vrstvy. Tento nástroj neprovádí OCR. Stránky s méně než třemi znaky jinými než mezery se hlásí jako stránky bez použitelného textu; toto upozornění spouštějí i prázdné stránky.

Které uspořádání textu mám zvolit?

Čitelný text sleduje pořadí položek uložené v PDF a používá pozice k přidání mezer a zlomů řádků. Přibližné rozvržení uspořádává položky shora dolů a zleva doprava a přidává mezi ně mezery. Ani jeden režim nezaručuje původní pořadí čtení u složitých sloupců.

Proč chybí mezery nebo jsou znaky nesprávné?

PDF ukládá umístěné fragmenty textu a některá písma mají neúplné mapování znaků. Zkuste druhý režim uspořádání a porovnejte výstup s originálem. Extrahovaný text můžete před exportem opravit.

Mohu extrahovat text z PDF chráněného heslem?

Zadejte heslo, když se zobrazí pole, a zvolte Otevřít. Potřebujete správné heslo; nástroj ho neobchází. Heslo je v paměti pouze pro toto načtení.

Zachovává PDF na TXT formátování Wordu?

TXT obsahuje prostý text se zlomy řádků a mezerami. Nezachovává písma, obrázky, interaktivní formuláře ani digitální podpisy a tento nástroj neexportuje dokumenty Word. Vygenerované popisky stránek se do počtů nezahrnují; součty znaků také nezahrnují zlomy řádků.

Nahrává se moje PDF a mohu zpracovat velký soubor?

Soubor se zpracovává lokálně v prohlížeči a nenahrává se. Velké dokumenty mohou trvat déle nebo překročit dostupnou paměť zařízení. Výběr menšího počtu stránek snižuje práci při extrakci, i když prohlížeč stále musí PDF otevřít.

Pokračujte v práci s textem nebo PDF