← Blog

Comment faire l'OCR d'un PDF et rendre un scan consultable gratuitement

Vous scannez un vieux contrat ou une pile de reçus, vous l’enregistrez en PDF, et des semaines plus tard vous cherchez une clause précise ou le nom d’un fournisseur — mais Ctrl+F ne trouve rien. C’est parce qu’un scan n’est qu’une photo de texte : votre ordinateur voit des pixels, pas des mots. L’OCR corrige cela en transformant une simple image en un document que vous pouvez réellement rechercher, copier et réutiliser.

Ce que l’OCR fait vraiment à un PDF

OCR signifie reconnaissance optique de caractères (optical character recognition). L’outil examine les formes présentes dans l’image d’une page, détermine quelles lettres et quels mots elles représentent, puis inscrit ce texte dans le fichier sous forme de couche cachée.

L’astuce, c’est que le scan original reste exactement tel quel. Le texte reconnu se place dans une couche invisible derrière l’image de la page, parfaitement aligné avec ce que vous voyez. Le document a donc une apparence identique au scan de départ, mais désormais chaque mot est sélectionnable, consultable et copiable. Rien ne change quant à la qualité visuelle.

Ce seul changement débloque énormément de possibilités. Un PDF consultable vous permet de retrouver n’importe quel terme en quelques secondes, de copier un paragraphe au lieu de le retaper, et d’alimenter le fichier dans d’autres outils qui ont besoin de vrai texte — comme le convertir plus tard en document modifiable.

Comment rendre un PDF scanné consultable

Voici la procédure complète avec l’outil OCR PDF. Cela prend environ une minute, sans inscription, sans filigrane et sans logiciel à installer.

  1. Ouvrez l’outil. Rendez-vous sur OCR PDF sur PDF168.
  2. Ajoutez votre PDF scanné. Glissez le fichier sur la page, ou cliquez pour parcourir et le sélectionner depuis votre ordinateur. L’outil accepte les PDF scannés et composés uniquement d’images.
  3. Définissez la langue du document. Saisissez le code de langue Tesseract correspondant à votre document — eng pour l’anglais, et des codes comme chi_tra pour le chinois traditionnel. Faire correspondre la langue à votre contenu est le facteur le plus déterminant pour la précision.
  4. Choisissez un mode OCR. Sélectionnez Ignorer les pages qui contiennent déjà du texte (l’option par défaut et la plus sûre) si certaines parties de votre fichier sont déjà numériques. Utilisez Forcer l’OCR sur chaque page lorsque même les pages « texte » sont en réalité des scans.
  5. Lancez le traitement. Démarrez l’opération. Votre fichier est téléversé via une connexion chiffrée vers notre serveur sécurisé, où le texte est reconnu page par page en une seule passe.
  6. Téléchargez votre PDF consultable. Enregistrez le fichier renvoyé. Il a la même apparence qu’avant, mais vous pouvez désormais rechercher et sélectionner chaque mot.

C’est tout. Les documents de plusieurs pages sont traités d’un seul coup et reviennent sous la forme d’un fichier unique.

Choisir la bonne langue et le bon mode

Quelques petits choix font toute la différence entre une reconnaissance quasi parfaite et un charabia illisible.

Que faire avec un PDF consultable

Une fois que votre fichier possède une vraie couche de texte, de nombreuses possibilités s’ouvrent. Vous pouvez rechercher et copier directement dans n’importe quel lecteur de PDF. Vous pouvez surligner et annoter de vrais mots au lieu de tracer des cadres sur une image. Et vous pouvez transmettre le fichier à d’autres outils qui dépendent d’un texte sélectionnable.

Si vous n’avez besoin que des mots bruts — sans mise en page, juste du texte prêt à copier — passez le fichier consultable dans PDF to Text pour obtenir un export en texte brut propre. Si vous souhaitez modifier le contenu dans Word, le bon ordre est l’OCR d’abord, puis PDF to Word ; convertir un scan directement en Word sans OCR produit un document vide ou illisible, car il n’y a aucun texte à reporter.

Une note sur la confidentialité

L’OCR est plus lourd qu’il n’y paraît — reconnaître chaque caractère sur chaque page exige une vraie puissance de calcul — c’est pourquoi cet outil fonctionne sur notre serveur plutôt que dans votre navigateur. Votre PDF est envoyé via une connexion chiffrée (HTTPS), traité sur un serveur sécurisé, puis vous est renvoyé. Il n’est ni stocké, ni partagé, ni utilisé ensuite à des fins publicitaires ou d’entraînement, et aucun compte ni e-mail n’est nécessaire. Pour les documents très sensibles, il reste prudent de supprimer vos copies de travail locales une fois que vous disposez de la version consultable dont vous avez besoin.

Numériser un scan exigeait autrefois un logiciel de bureau coûteux ou de retaper les pages à la main. Désormais, vous pouvez déposer un fichier dans OCR PDF, choisir une langue et télécharger un document entièrement consultable en moins d’une minute — gratuitement, et via une connexion sécurisée. Ajoutez-le à vos favoris pour la prochaine pile de scans impossibles à consulter.

Ouvrir OCR PDF →

Questions fréquentes

Qu'est-ce que l'OCR et pourquoi mon PDF scanné en a-t-il besoin ?

L'OCR (reconnaissance optique de caractères) lit le texte présent dans l'image d'une page et le transforme en véritables caractères sélectionnables. Un scan n'est qu'une photo de texte : sans OCR, vous ne pouvez ni rechercher, ni copier, ni surligner le moindre mot.

L'OCR modifie-t-il l'apparence de mes pages scannées ?

Non. L'outil ajoute une couche de texte invisible derrière l'image originale de votre page : le scan reste identique tandis que les mots deviennent consultables et sélectionnables. Des scans nets et en haute résolution donnent les résultats de reconnaissance les plus précis.

Mon fichier est-il téléversé lorsque je lance l'OCR ?

Oui. L'OCR demande une vraie puissance de traitement : votre PDF est donc envoyé via une connexion chiffrée (HTTPS) vers notre serveur sécurisé, reconnu, puis renvoyé. Il n'est ni stocké ni conservé ensuite, et aucun compte ni e-mail n'est requis.