Comment extraire le texte d'un PDF scanné
Un PDF scanné est une pile d'images de pages : il n'y a aucun texte à sélectionner ni à copier. Pour récupérer les mots, il faut un OCR. L'outil gratuit PDF en texte fait les deux dans votre navigateur : il lit directement la couche texte des pages numériques et n'applique l'OCR qu'aux pages qui sont des images.
Pourquoi je ne peux pas copier le texte d'un PDF ?
Le plus souvent parce que la page est un scan ou une photo enregistrée en PDF. Le fichier affiche des lettres, mais dessous il n'y a que des pixels. Certains PDF ont aussi la copie désactivée par leur auteur. Si vous ne pouvez pas surligner un mot isolé, la page a besoin d'un OCR avant de pouvoir copier le texte.
Comment savoir si un PDF est scanné ?
Ouvrez-le et essayez de sélectionner une phrase. Si les mots se surlignent un par un, la page a une couche texte. Si toute la page se sélectionne comme une image, ou si rien ne se sélectionne, c'est un scan. Beaucoup de PDF mélangent les deux : des pages tapées avec quelques annexes scannées à la fin.
Comment faire l'OCR d'un PDF gratuitement ?
- Ouvrez l'outilAllez sur PDF en texte.
- Ajoutez le PDFChoisissez un fichier jusqu'à 50 Mo.
- Choisissez la langue OCRSélectionnez la langue du document pour bien lire les pages scannées.
- ExtrayezLes pages avec texte sortent tout de suite ; les pages scannées sont reconnues une par une.
- Copiez ou téléchargezCopiez le résultat ou enregistrez-le en fichier texte.
Comment nettoyer le texte extrait ?
Les scans coupent souvent les phrases à chaque fin de ligne imprimée et séparent les mots avec des traits d'union. Si vous traitez le texte par code, quelques lignes de JavaScript reconstituent les paragraphes. Collez le résultat de l'OCR dans la variable text et exécutez le code dans la console du navigateur ou dans Node.js.
const text = `collez ici le résultat de l'OCR`;
const cleaned = text
.replace(/-\n(?=\p{Ll})/gu, '') // recolle les mots coupés
.replace(/(?<!\n)\n(?!\n)/g, ' ') // retours simples -> espaces
.replace(/[ \t]{2,}/g, ' '); // espaces multiples -> un seul
console.log(cleaned);Est-ce sûr pour des documents confidentiels ?
Oui. Le PDF est traité par votre propre navigateur et n'est jamais envoyé sur un serveur, ce qui convient aux contrats, factures et courriers médicaux. Un meilleur scan donne un meilleur texte : lisez ce qui influence vraiment la précision de l'OCR avant de rescanner.
Et si je n'ai que des photos des pages ?
Passez alors directement par les outils image : copier le texte d'une image pour une page, ou l'OCR multi-images pour jusqu'à 20 pages d'un coup.
Extrayez le texte de votre PDF
Couche texte d'abord, OCR pour les scans. Le tout dans votre navigateur.