Comment faire l'OCR d'un PDF (le rendre interrogeable)
Guide pas à pas pour rendre un PDF scanné interrogeable : choisissez les langues du document, la couche de texte est ajoutée localement dans votre navigateur.
Reconnaître le texteUn PDF scanné est une photographie de texte : il paraît lisible, mais pour toute zone de recherche, tout copier-coller et tout extracteur de texte, les pages sont vides. L'OCR (reconnaissance optique de caractères) corrige cela en reconnaissant les lettres et en ajoutant une couche de texte invisible par-dessus le scan. Ce guide vous montre comment procéder avec l'outil OCR PDF d'AmiPDF, qui exécute toute la reconnaissance dans votre navigateur : le fichier ne quitte jamais votre appareil, ce qui compte pour les contrats, les dossiers médicaux et les pièces d'identité. Vous choisissez une ou plusieurs langues de document, l'outil reconnaît chaque page, et le résultat est le même PDF, désormais interrogeable et copiable.
Exécuter l'OCR, étape par étape
Ouvrez l'outil OCR et ajoutez votre scan
Rendez-vous sur l'outil OCR PDF d'AmiPDF et déposez votre PDF scanné dans la zone d'import. Les documents scannés jusqu'à la limite de pages de l'outil sont acceptés ; si votre scan est un livre volumineux, découpez-le d'abord en parties avec diviser un PDF et traitez chaque partie.

Choisissez les langues du document
Sélectionnez toutes les langues présentes dans le document, dans la limite autorisée par exécution. Choisir deux ou trois langues lorsque le texte les mélange réellement améliore la reconnaissance ; ajouter des langues absentes du document ne fait que ralentir le traitement. Le moteur et les packs de langues sont téléchargés une fois à la première utilisation, puis mis en cache.

Lancez la reconnaissance
Cliquez sur démarrer et suivez la progression page par page. La reconnaissance s'effectue sur votre appareil via WebAssembly ; un scan de 10 pages prend généralement quelques minutes selon votre machine. Gardez l'onglet ouvert jusqu'à la fin du traitement ; l'outil assemble le résultat automatiquement.

Téléchargez le PDF interrogeable
Enregistrez le résultat ; c'est le même document visuellement, avec désormais une couche de texte invisible en dessous. La recherche fonctionne dans n'importe quel lecteur PDF, le copier-coller renvoie du vrai texte, et vous pouvez extraire le contenu plus tard avec PDF vers Markdown. Un bouton propose aussi le texte reconnu brut dans un fichier .txt pour une vérification rapide.

Obtenir les meilleurs résultats
Des scans propres sont mieux reconnus
Des pages droites, uniformément éclairées et à 300 DPI constituent le cas idéal. Les photos prises au téléphone de travers perdent en précision sur les bords ; si la source est un appareil photo de téléphone, redressez et recadrez d'abord ; l'outil recadrer un PDF permet de supprimer les bordures sombres qui perturbent la reconnaissance.
Vérifiez l'aperçu du texte
L'OCR est statistique : une exactitude de 100 % n'est pas garantie, en particulier avec des polices inhabituelles ou un faible contraste. Utilisez la vue du texte extrait pour contrôler quelques paragraphes avant de vous fier à la recherche, et relancez avec des langues ajustées si le résultat semble incohérent.
Passez l'OCR pour les PDF textuels
Si l'outil vous indique que le document possède déjà une couche de texte, l'OCR est inutile ; les outils d'extraction comme PDF vers Word fonctionnent directement et se terminent en quelques secondes.
Questions fréquentes
Mon fichier n'est vraiment envoyé nulle part ?
Exact : la reconnaissance s'exécute dans votre navigateur via WebAssembly. Le seul trafic réseau est le téléchargement unique du moteur OCR et des packs de langues, mis en cache pour les exécutions suivantes.
Combien de langues puis-je choisir ?
Jusqu'à la limite par exécution indiquée sur la page. Mélangez librement les langues, par exemple l'anglais et le chinois dans un contrat bilingue, mais évitez les langues absentes du document : elles ne font que ralentir le traitement.
L'OCR modifie-t-il l'apparence de mon scan ?
Non. Les pages gardent leur apparence d'origine ; le texte reconnu est ajouté sous forme de couche invisible positionnée sous le scan. Vous voyez le même document, mais la recherche et la copie fonctionnent désormais.