Terug naar AllToolio

PDF naar tekst

Extraheer selecteerbare tekst, controleer deze en sla een TXT-bestand op terwijl je PDF in je browser blijft.

of sleep hier een PDF naartoe
Laat leeg voor alle pagina's. Voorbeeld: 1-3, 5. Gebruik 8- voor pagina 8 tot het einde.

Tekstschikking

Probeer de benaderende lay-out voor tabellen en kolommen. De uitlijning moet mogelijk worden gecorrigeerd.

Choose a PDF to start.

De PDF wordt lokaal in je browser verwerkt; het bestand wordt niet geüpload. Leesbare tekst volgt de volgorde die in de PDF is opgeslagen, dus kolommen en tabellen kunnen in een onverwachte volgorde verschijnen.

Hoe je tekst uit een PDF haalt

  1. Begin met PDF naar tekst door een PDF te kiezen of deze naar het bestandsgebied te slepen. Voer indien gevraagd het wachtwoord van het document in.
  2. Laat Pagina's leeg om het hele document te verwerken, of voer een selectie in. Bijvoorbeeld 1-3, 5 extraheert vier pagina's in die volgorde.
  3. Kies Leesbare tekst voor gewone alinea's. Probeer Benaderende lay-out wanneer spaties tussen kolommen of tabelitems belangrijk zijn.
  4. Laat Paginascheidingen aan staan om de bronpagina's te identificeren en selecteer Tekst extraheren. Controleer eventuele meldingen over pagina's zonder bruikbare tekst.
  5. Corrigeer het bewerkbare resultaat en kopieer het of download een UTF-8 .txt-bestand. Beide acties gebruiken de momenteel weergegeven tekst.

Praktische manieren om de geëxtraheerde tekst te gebruiken

  • Tekst uit PDF-rapporten naar werkaantekeningen kopiëren zonder hele alinea's over te typen.
  • De tekst van een digitaal document opslaan als platte tekst voor latere bewerking.
  • Geselecteerde handleidingspagina's verzamelen met paginalabels voor referentie.
  • Tekst uit een tabel met benaderende spatiëring bekijken voordat je de uitlijning corrigeert.
  • Woord- en tekentotalen controleren terwijl je ongewenste koppen uit het resultaat verwijdert.

Vragen over PDF-tekstextractie

Waarom levert een pagina geen tekst op?

Een scan kan afbeeldingen van letters bevatten zonder tekstlaag. Deze tool voert geen OCR uit. Pagina's met minder dan drie niet-spatietekens worden gemeld als zonder bruikbare tekst; blanco pagina's veroorzaken ook deze melding.

Welke tekstschikking moet ik kiezen?

Leesbare tekst volgt de opgeslagen itemvolgorde van de PDF en gebruikt posities om spaties en regelafbrekingen toe te voegen. Benaderende lay-out rangschikt items van boven naar beneden en van links naar rechts, met spaties ertussen. Geen van beide modi garandeert de oorspronkelijke leesvolgorde bij complexe kolommen.

Waarom ontbreken spaties of zijn tekens onjuist?

PDF's slaan gepositioneerde tekstfragmenten op, en sommige lettertypen hebben onvolledige tekentoewijzingen. Probeer de andere schikkingsmodus en vergelijk de uitvoer met het origineel. Je kunt de geëxtraheerde tekst corrigeren voordat je exporteert.

Kan ik tekst uit een met wachtwoord beveiligde PDF halen?

Voer het wachtwoord in wanneer het veld verschijnt en selecteer Openen. Je hebt het juiste wachtwoord nodig; de tool omzeilt het niet. Het wachtwoord wordt alleen voor die keer laden in het geheugen gehouden.

Behoudt PDF naar TXT de Word-opmaak?

TXT bevat platte tekst, met regelafbrekingen en spaties. Het behoudt geen lettertypen, afbeeldingen, interactieve formulieren of digitale handtekeningen, en deze tool exporteert geen Word-documenten. Gegenereerde paginalabels worden niet meegeteld; tekentotalen sluiten regelafbrekingen ook uit.

Wordt mijn PDF geüpload, en kan ik een groot bestand verwerken?

Het bestand wordt lokaal in je browser verwerkt en niet geüpload. Grote documenten kunnen langer duren of het beschikbare apparaatgeheugen overschrijden. Minder pagina's selecteren vermindert het extractiewerk, hoewel de browser de PDF nog steeds moet openen.

Ga verder met je tekst of PDF