PDF till text
Extrahera markerbar text, granska den och spara en TXT-fil medan din PDF stannar i webbläsaren.
Textarrangemang
Prova ungefärlig layout för tabeller och kolumner. Justeringen kan behöva korrigeras.
PDF-filen bearbetas lokalt i webbläsaren; filen laddas inte upp. Läsbar text följer den ordning som är lagrad i PDF-filen, så kolumner och tabeller kan visas i oväntad ordning.
Så extraherar du text från en PDF
- Börja med PDF till text genom att välja en PDF eller släppa den i filområdet. Ange dokumentets lösenord om du uppmanas.
- Lämna Sidor tomt för att bearbeta hela dokumentet, eller ange ett urval. Till exempel extraherar 1-3, 5 fyra sidor i den ordningen.
- Välj Läsbar text för vanliga stycken. Prova Ungefärlig layout när mellanslag mellan kolumner eller tabellposter spelar roll.
- Behåll Sidavgränsare aktiverat för att identifiera källsidorna och välj sedan Extrahera text. Granska eventuella meddelanden om sidor utan användbar text.
- Korrigera det redigerbara resultatet och kopiera det eller ladda ner en UTF-8 .txt-fil. Båda åtgärderna använder texten som visas just nu.
Praktiska sätt att använda den extraherade texten
- Kopiera text från PDF-rapporter till arbetsanteckningar utan att skriva om hela stycken.
- Spara ordalydelsen i ett digitalt dokument som klartext för senare redigering.
- Samla valda manualsidor medan sideetiketter behålls för referens.
- Granska text från en tabell med ungefärliga mellanslag innan du korrigerar justeringen.
- Kontrollera ord- och teckenantal medan du tar bort oönskade rubriker från resultatet.
Frågor om PDF-textextrahering
Varför ger en sida ingen text?
En skanning kan innehålla bilder av bokstäver utan textlager. Detta verktyg utför inte OCR. Sidor med färre än tre tecken som inte är blanksteg rapporteras sakna användbar text; tomma sidor utlöser också detta meddelande.
Vilket textarrangemang ska jag välja?
Läsbar text följer PDF-filens lagrade objektordning och använder positioner för att lägga till mellanslag och radbrytningar. Ungefärlig layout arrangerar objekt uppifrån och ned och vänster till höger och lägger till mellanslag mellan dem. Inget läge garanterar den ursprungliga läsordningen för komplexa kolumner.
Varför saknas mellanslag eller är tecken felaktiga?
PDF-filer lagrar positionerade textfragment, och vissa typsnitt har ofullständiga teckenmappningar. Prova det andra arrangemangsläget och jämför utdata med originalet. Du kan korrigera den extraherade texten innan du exporterar den.
Kan jag extrahera text från en lösenordsskyddad PDF?
Ange lösenordet när fältet visas och välj sedan Öppna. Du behöver rätt lösenord; verktyget kringgår det inte. Lösenordet hålls i minnet endast för den inläsningen.
Bevarar PDF till TXT Word-formatering?
TXT innehåller klartext, med radbrytningar och mellanslag. Det behåller inte typsnitt, bilder, interaktiva formulär eller digitala signaturer, och detta verktyg exporterar inte Word-dokument. Genererade sideetiketter utesluts från antalen; teckentotaler utesluter också radbrytningar.
Laddas min PDF upp, och kan jag bearbeta en stor fil?
Filen bearbetas lokalt i webbläsaren och laddas inte upp. Stora dokument kan ta längre tid eller överskrida tillgängligt enhetsminne. Att välja färre sidor minskar extraheringsarbetet, även om webbläsaren fortfarande måste öppna PDF-filen.