Comment extraire le texte d'un PDF scanné

Un PDF scanné est une pile d'images de pages : il n'y a aucun texte à sélectionner ni à copier. Pour récupérer les mots, il faut un OCR. L'outil gratuit PDF en texte fait les deux dans votre navigateur : il lit directement la couche texte des pages numériques et n'applique l'OCR qu'aux pages qui sont des images.

Pourquoi je ne peux pas copier le texte d'un PDF ?

Le plus souvent parce que la page est un scan ou une photo enregistrée en PDF. Le fichier affiche des lettres, mais dessous il n'y a que des pixels. Certains PDF ont aussi la copie désactivée par leur auteur. Si vous ne pouvez pas surligner un mot isolé, la page a besoin d'un OCR avant de pouvoir copier le texte.

Comment savoir si un PDF est scanné ?

Ouvrez-le et essayez de sélectionner une phrase. Si les mots se surlignent un par un, la page a une couche texte. Si toute la page se sélectionne comme une image, ou si rien ne se sélectionne, c'est un scan. Beaucoup de PDF mélangent les deux : des pages tapées avec quelques annexes scannées à la fin.

Comment faire l'OCR d'un PDF gratuitement ?

  1. Ouvrez l'outilAllez sur PDF en texte.
  2. Ajoutez le PDFChoisissez un fichier jusqu'à 50 Mo.
  3. Choisissez la langue OCRSélectionnez la langue du document pour bien lire les pages scannées.
  4. ExtrayezLes pages avec texte sortent tout de suite ; les pages scannées sont reconnues une par une.
  5. Copiez ou téléchargezCopiez le résultat ou enregistrez-le en fichier texte.

Comment nettoyer le texte extrait ?

Les scans coupent souvent les phrases à chaque fin de ligne imprimée et séparent les mots avec des traits d'union. Si vous traitez le texte par code, quelques lignes de JavaScript reconstituent les paragraphes. Collez le résultat de l'OCR dans la variable text et exécutez le code dans la console du navigateur ou dans Node.js.

join-ocr-lines.js
const text = `collez ici le résultat de l'OCR`;

const cleaned = text
  .replace(/-\n(?=\p{Ll})/gu, '')   // recolle les mots coupés
  .replace(/(?<!\n)\n(?!\n)/g, ' ') // retours simples -> espaces
  .replace(/[ \t]{2,}/g, ' ');      // espaces multiples -> un seul

console.log(cleaned);

Est-ce sûr pour des documents confidentiels ?

Oui. Le PDF est traité par votre propre navigateur et n'est jamais envoyé sur un serveur, ce qui convient aux contrats, factures et courriers médicaux. Un meilleur scan donne un meilleur texte : lisez ce qui influence vraiment la précision de l'OCR avant de rescanner.

Et si je n'ai que des photos des pages ?

Passez alors directement par les outils image : copier le texte d'une image pour une page, ou l'OCR multi-images pour jusqu'à 20 pages d'un coup.

Extrayez le texte de votre PDF

Couche texte d'abord, OCR pour les scans. Le tout dans votre navigateur.

Articles similaires

October 4, 2026
Tutoriel
Arbab Naseer

Comment lire un numéro de téléphone ou un e-mail sur une image

Récupérez numéros de téléphone et adresses e-mail sur une photo, un flyer ou une capture d'écran avec un OCR gratuit dans le navigateur, sans rien retaper.

October 4, 2026
Tutoriel
Arbab Naseer

Comment copier le texte d'une image sur iPhone, Android, Windows et Mac

Copiez le texte d'une image sur iPhone, Android, Windows ou Mac : avec les outils intégrés ou un OCR gratuit dans le navigateur, identique partout.

October 3, 2026
Tutoriel
Arbab Naseer

Comment extraire le texte d'une capture d'écran

Transformez une capture d'écran en texte modifiable : collez-la dans un OCR gratuit dans le navigateur et copiez le résultat. Raccourcis Windows, Mac, mobile.

Retour au blog

We are also available in other languages

Ad Sponsored Check this offer
Ad Sponsored Check this offer