PDF para texto
Extrai texto selecionável, revê-o e guarda um ficheiro TXT enquanto o teu PDF fica no navegador.
Disposição do texto
Experimenta o esquema aproximado para tabelas e colunas. O alinhamento pode precisar de correção.
O PDF é processado localmente no navegador; o ficheiro não é enviado. O texto de leitura segue a ordem guardada no PDF, por isso as colunas e tabelas podem aparecer numa ordem inesperada.
Como extrair texto de um PDF
- Começa com PDF para texto escolhendo um PDF ou largando-o na área de ficheiros. Se for pedido, introduz a palavra-passe do documento.
- Deixa Páginas vazio para processar o documento inteiro ou introduz uma seleção. Por exemplo, 1-3, 5 extrai quatro páginas nessa ordem.
- Escolhe Texto de leitura para parágrafos comuns. Experimenta Esquema aproximado quando os espaços entre colunas ou entradas de tabela importam.
- Mantém os Separadores de página ativados para identificares as páginas de origem e seleciona Extrair texto. Revê qualquer aviso sobre páginas sem texto utilizável.
- Corrige o resultado editável e copia-o ou descarrega um ficheiro .txt em UTF-8. Ambas as ações usam o texto atualmente apresentado.
Formas práticas de usar o texto extraído
- Copiar texto de relatórios PDF para notas de trabalho sem reescrever parágrafos inteiros.
- Guardar o texto de um documento digital como texto simples para edição posterior.
- Recolher páginas selecionadas de um manual mantendo as etiquetas de página para referência.
- Inspecionar texto de uma tabela com espaçamento aproximado antes de corrigir o alinhamento.
- Verificar totais de palavras e caracteres enquanto removes títulos indesejados do resultado.
Perguntas sobre extração de texto de PDF
Porque é que uma página não produz texto?
Uma digitalização pode conter imagens de letras sem camada de texto. Esta ferramenta não faz OCR. As páginas com menos de três caracteres não brancos são assinaladas como sem texto utilizável; as páginas em branco também acionam este aviso.
Que disposição de texto devo escolher?
Texto de leitura segue a ordem dos itens guardada no PDF e usa as posições para adicionar espaçamento e quebras de linha. Esquema aproximado organiza os itens de cima para baixo e da esquerda para a direita, adicionando espaços entre eles. Nenhum modo garante a ordem de leitura original em colunas complexas.
Porque faltam espaços ou há caracteres incorretos?
Os PDF guardam fragmentos de texto posicionados e algumas fontes têm mapeamentos de caracteres incompletos. Experimenta o outro modo de disposição e compara o resultado com o original. Podes corrigir o texto extraído antes de o exportares.
Posso extrair texto de um PDF protegido por palavra-passe?
Introduz a palavra-passe quando o campo aparecer e seleciona Abrir. Precisas da palavra-passe correta; a ferramenta não a contorna. A palavra-passe fica apenas em memória durante esse carregamento.
O PDF para TXT preserva a formatação do Word?
O TXT contém texto simples, com quebras de linha e espaços. Não mantém tipos de letra, imagens, formulários interativos nem assinaturas digitais, e esta ferramenta não exporta documentos Word. As etiquetas de página geradas são excluídas das contagens; os totais de caracteres também excluem as quebras de linha.
O meu PDF é enviado e posso processar um ficheiro grande?
O ficheiro é processado localmente no teu navegador e não é enviado. Os documentos grandes podem demorar mais ou exceder a memória disponível do dispositivo. Selecionar menos páginas reduz o trabalho de extração, embora o navegador ainda tenha de abrir o PDF.