Como extrair texto de um PDF escaneado
Um PDF escaneado é uma pilha de imagens de páginas, então não há texto para selecionar ou copiar. Para tirar as palavras você precisa de OCR. A ferramenta grátis PDF para texto faz as duas coisas no navegador: lê direto a camada de texto das páginas digitais e aplica OCR só nas páginas que são imagens.
Por que não consigo copiar texto de um PDF?
Geralmente porque a página é um escaneamento ou uma foto salva como PDF. O arquivo mostra letras, mas por baixo só há pixels. Alguns PDFs também têm a cópia bloqueada pelo autor. Se você não consegue destacar uma palavra sozinha, a página precisa de OCR antes de o texto poder ser copiado.
Como saber se um PDF é escaneado?
Abra e tente selecionar uma frase. Se as palavras destacam uma a uma, a página tem camada de texto. Se a página inteira é selecionada como uma imagem, ou nada é selecionado, é um escaneamento. Muitos PDFs misturam os dois: páginas digitadas com alguns anexos escaneados no fim.
Como fazer OCR de um PDF de graça?
- Abra a ferramentaAcesse o PDF para texto.
- Adicione o PDFEscolha um arquivo de até 50 MB.
- Escolha o idioma do OCRSelecione o idioma do documento para as páginas escaneadas serem lidas corretamente.
- ExtraiaPáginas com texto saem na hora; as escaneadas são reconhecidas uma a uma.
- Copie ou baixeCopie o resultado ou salve como arquivo de texto.
Como limpar o texto extraído?
Escaneamentos costumam quebrar as frases no fim de cada linha impressa e dividir palavras com hífen. Se você trabalha o texto com código, algumas linhas de JavaScript juntam os parágrafos de novo. Cole o resultado do OCR na variável text e rode no console do navegador ou no Node.js.
const text = `cole aqui o resultado do OCR`;
const cleaned = text
.replace(/-\n(?=\p{Ll})/gu, '') // junta palavras quebradas
.replace(/(?<!\n)\n(?!\n)/g, ' ') // quebras simples -> espaços
.replace(/[ \t]{2,}/g, ' '); // espaços repetidos -> um
console.log(cleaned);É seguro para documentos sigilosos?
Sim. O PDF é processado pelo seu próprio navegador e nunca é enviado para um servidor, então serve para contratos, notas fiscais e exames médicos. Um escaneamento melhor dá um texto melhor: veja o que realmente afeta a precisão do OCR antes de escanear de novo.
E se eu só tiver fotos das páginas?
Aí pule o PDF e use direto as ferramentas de imagem: copiar texto de imagem para uma página, ou o OCR de várias imagens para até 20 páginas de uma vez.
Extraia o texto do seu PDF
Camada de texto primeiro, OCR para os escaneamentos. Tudo no navegador.