Comment faire l'OCR d'un PDF et rendre un scan consultable gratuitement
Vous scannez un vieux contrat ou une pile de reçus, vous l’enregistrez en PDF, et des semaines plus tard vous cherchez une clause précise ou le nom d’un fournisseur — mais Ctrl+F ne trouve rien. C’est parce qu’un scan n’est qu’une photo de texte : votre ordinateur voit des pixels, pas des mots. L’OCR corrige cela en transformant une simple image en un document que vous pouvez réellement rechercher, copier et réutiliser.
Ce que l’OCR fait vraiment à un PDF
OCR signifie reconnaissance optique de caractères (optical character recognition). L’outil examine les formes présentes dans l’image d’une page, détermine quelles lettres et quels mots elles représentent, puis inscrit ce texte dans le fichier sous forme de couche cachée.
L’astuce, c’est que le scan original reste exactement tel quel. Le texte reconnu se place dans une couche invisible derrière l’image de la page, parfaitement aligné avec ce que vous voyez. Le document a donc une apparence identique au scan de départ, mais désormais chaque mot est sélectionnable, consultable et copiable. Rien ne change quant à la qualité visuelle.
Ce seul changement débloque énormément de possibilités. Un PDF consultable vous permet de retrouver n’importe quel terme en quelques secondes, de copier un paragraphe au lieu de le retaper, et d’alimenter le fichier dans d’autres outils qui ont besoin de vrai texte — comme le convertir plus tard en document modifiable.
Comment rendre un PDF scanné consultable
Voici la procédure complète avec l’outil OCR PDF. Cela prend environ une minute, sans inscription, sans filigrane et sans logiciel à installer.
- Ouvrez l’outil. Rendez-vous sur OCR PDF sur PDF168.
- Ajoutez votre PDF scanné. Glissez le fichier sur la page, ou cliquez pour parcourir et le sélectionner depuis votre ordinateur. L’outil accepte les PDF scannés et composés uniquement d’images.
- Définissez la langue du document. Saisissez le code de langue Tesseract correspondant à votre document —
engpour l’anglais, et des codes commechi_trapour le chinois traditionnel. Faire correspondre la langue à votre contenu est le facteur le plus déterminant pour la précision. - Choisissez un mode OCR. Sélectionnez Ignorer les pages qui contiennent déjà du texte (l’option par défaut et la plus sûre) si certaines parties de votre fichier sont déjà numériques. Utilisez Forcer l’OCR sur chaque page lorsque même les pages « texte » sont en réalité des scans.
- Lancez le traitement. Démarrez l’opération. Votre fichier est téléversé via une connexion chiffrée vers notre serveur sécurisé, où le texte est reconnu page par page en une seule passe.
- Téléchargez votre PDF consultable. Enregistrez le fichier renvoyé. Il a la même apparence qu’avant, mais vous pouvez désormais rechercher et sélectionner chaque mot.
C’est tout. Les documents de plusieurs pages sont traités d’un seul coup et reviennent sous la forme d’un fichier unique.
Choisir la bonne langue et le bon mode
Quelques petits choix font toute la différence entre une reconnaissance quasi parfaite et un charabia illisible.
- Faites correspondre le code de langue. L’OCR s’appuie sur la langue que vous choisissez pour déterminer quels caractères sont probables. Si vous indiquez la mauvaise, les lettres accentuées, le cyrillique ou les écritures asiatiques reviennent erronés. L’outil prend en charge des dizaines de langues, alors choisissez la correspondance la plus proche.
- Documents multilingues. Si une page comporte deux langues, vous pouvez combiner les codes (par exemple l’anglais plus une autre écriture) afin que le moteur reconnaisse les deux.
- Ignorer le texte ou forcer. Ignorer le texte laisse le vrai texte intact et n’applique l’OCR qu’aux pages images — rapide et propre pour les fichiers mixtes. Forcer l’OCR reconnaît tout à nouveau, ce qui est le bon choix lorsqu’un PDF « numérique » est en réalité un scan déguisé.
- Qualité en entrée, qualité en sortie. L’OCR ne peut lire que ce qu’il voit. Un scan net à 300 DPI avec un bon éclairage se reconnaît bien mieux qu’une photo floue prise au téléphone. Si les résultats sont faibles, rescannez à une résolution plus élevée avant de réessayer.
Que faire avec un PDF consultable
Une fois que votre fichier possède une vraie couche de texte, de nombreuses possibilités s’ouvrent. Vous pouvez rechercher et copier directement dans n’importe quel lecteur de PDF. Vous pouvez surligner et annoter de vrais mots au lieu de tracer des cadres sur une image. Et vous pouvez transmettre le fichier à d’autres outils qui dépendent d’un texte sélectionnable.
Si vous n’avez besoin que des mots bruts — sans mise en page, juste du texte prêt à copier — passez le fichier consultable dans PDF to Text pour obtenir un export en texte brut propre. Si vous souhaitez modifier le contenu dans Word, le bon ordre est l’OCR d’abord, puis PDF to Word ; convertir un scan directement en Word sans OCR produit un document vide ou illisible, car il n’y a aucun texte à reporter.
Une note sur la confidentialité
L’OCR est plus lourd qu’il n’y paraît — reconnaître chaque caractère sur chaque page exige une vraie puissance de calcul — c’est pourquoi cet outil fonctionne sur notre serveur plutôt que dans votre navigateur. Votre PDF est envoyé via une connexion chiffrée (HTTPS), traité sur un serveur sécurisé, puis vous est renvoyé. Il n’est ni stocké, ni partagé, ni utilisé ensuite à des fins publicitaires ou d’entraînement, et aucun compte ni e-mail n’est nécessaire. Pour les documents très sensibles, il reste prudent de supprimer vos copies de travail locales une fois que vous disposez de la version consultable dont vous avez besoin.
Numériser un scan exigeait autrefois un logiciel de bureau coûteux ou de retaper les pages à la main. Désormais, vous pouvez déposer un fichier dans OCR PDF, choisir une langue et télécharger un document entièrement consultable en moins d’une minute — gratuitement, et via une connexion sécurisée. Ajoutez-le à vos favoris pour la prochaine pile de scans impossibles à consulter.
Questions fréquentes
Qu'est-ce que l'OCR et pourquoi mon PDF scanné en a-t-il besoin ?
L'OCR (reconnaissance optique de caractères) lit le texte présent dans l'image d'une page et le transforme en véritables caractères sélectionnables. Un scan n'est qu'une photo de texte : sans OCR, vous ne pouvez ni rechercher, ni copier, ni surligner le moindre mot.
L'OCR modifie-t-il l'apparence de mes pages scannées ?
Non. L'outil ajoute une couche de texte invisible derrière l'image originale de votre page : le scan reste identique tandis que les mots deviennent consultables et sélectionnables. Des scans nets et en haute résolution donnent les résultats de reconnaissance les plus précis.
Mon fichier est-il téléversé lorsque je lance l'OCR ?
Oui. L'OCR demande une vraie puissance de traitement : votre PDF est donc envoyé via une connexion chiffrée (HTTPS) vers notre serveur sécurisé, reconnu, puis renvoyé. Il n'est ni stocké ni conservé ensuite, et aucun compte ni e-mail n'est requis.