Guide pratique
Comment extraire le texte d'un PDF scanné
Un PDF scanné n'est qu'une image de texte, ce qui signifie que vous ne pouvez pas le sélectionner, le rechercher, le copier ou le traduire. L'outil OCR PDF de DocTranslating transforme un PDF scanné ou composé d'images en une vraie couche de texte sélectionnable en quelques clics : ouvrez l'outil, importez votre document scanné, définissez éventuellement la langue du document pour obtenir des résultats plus rapides et plus précis, puis cliquez sur Extraire le texte. Il prend en charge plus de 50 langues, les textes manuscrits et les écritures de droite à gauche comme l'arabe et l'hébreu. Une fois votre PDF traité par OCR, vous pouvez le traduire, le rechercher ou en copier le texte exactement comme pour un document ordinaire.
Mis à jour 19 juin 2026 · 8 min de lecture
Si vous avez essayé de sélectionner du texte dans un PDF et que rien ne se surligne, ou si vous avez effectué une recherche avec Ctrl+F sans obtenir de résultat, c'est que votre PDF est scanné — il s'agit d'une image de page et non de texte. C'est également la raison pour laquelle vous ne pouvez pas le traduire, le copier ou le modifier. La solution est la reconnaissance optique de caractères (OCR), qui lit l'image et crée une vraie couche de texte en dessous. Ce guide vous explique comment procéder avec l'outil OCR PDF de DocTranslating et quoi faire du résultat.
Comment savoir si mon PDF est scanné ?
Trois vérifications rapides vous permettent de savoir si un PDF nécessite une OCR :
- Essayez de sélectionner une ligne de texte. Si votre curseur ne parvient pas à surligner des mots individuels — ou sélectionne toute la page comme une seule image —, le document est scanné.
- Cherchez avec Ctrl+F (Cmd+F sur Mac). Si un mot que vous voyez clairement à l'écran ne donne aucun résultat, il n'y a pas de couche de texte recherchable.
- Observez la notification dans l'application. Lorsque vous ouvrez un fichier scanné dans DocTranslating, un bandeau apparaît avec le message « Ce document semble être scanné… » ainsi qu'un bouton Ouvrir l'outil OCR PDF — l'application a détecté l'absence de couche de texte exploitable.
Étape par étape : extraire le texte d'un PDF scanné
- 1
Ouvrez l'outil OCR PDF
Accédez directement à l'outil OCR PDF ou, si vous essayiez déjà de traduire un fichier scanné, cliquez sur le bouton « Ouvrir l'outil OCR PDF » dans la notification. Les deux options mènent au même outil.
- 2
Importez votre PDF scanné
Sélectionnez le fichier PDF scanné ou basé sur des images que vous souhaitez convertir. Il s'agit du fichier dont le texte ne peut actuellement pas être sélectionné ni recherché.
- 3
Définissez la langue du document (optionnel)
Si vous connaissez la langue du document, sélectionnez-la. C'est optionnel — l'outil détecte automatiquement la langue —, mais cela garantit des résultats plus rapides et plus précis, en particulier pour les écritures non latines comme l'arabe, le chinois, le cyrillique ou le devanagari, ainsi que pour les textes manuscrits.
- 4
Cliquez sur Extraire le texte et téléchargez le résultat
L'outil lit les pages et reconstruit une vraie couche de texte sélectionnable tout en conservant l'apparence originale du document. Téléchargez le PDF traité par OCR : vous pouvez désormais sélectionner, rechercher et copier son texte, et il est prêt à être traduit.
Ce que l'outil OCR PDF gère particulièrement bien
Le moteur OCR de DocTranslating est l'un des plus performants disponibles et va bien au-delà du texte imprimé basique en anglais :
- Plus de 50 langues — y compris les langues à écritures non latines.
- Textes manuscrits — l'écriture manuscrite lisible est reconnue, pas seulement les caractères imprimés.
- Écritures de droite à gauche (RTL) — l'arabe, l'hébreu et le persan sont traités avec une grande précision, incluant le sens de lecture correct.
- Pages multilingues — les documents contenant plus d'une langue sur une même page.
- Qualité de numérisation du quotidien — les photos de documents et les numérisations de bureau ordinaires, et pas seulement les scans professionnels parfaits.
Après l'OCR : traduire votre document
Une fois votre PDF traité par OCR obtenu, sa traduction se déroule exactement comme celle d'un PDF classique — importez-le, choisissez vos langues et le moteur de traduction, puis téléchargez la version traduite. Effectuer l'OCR au préalable sous forme d'étape distincte offre un avantage majeur : vous pouvez relire le texte extrait et vérifier son exactitude avant de traduire. Traduire un scan non vérifié risque de cumuler deux types d'erreurs — un mot mal lu devenant un mot mal traduit avec assurance —, la vérification préalable du résultat OCR constitue donc la meilleure méthode pour obtenir une traduction finale précise.
Conseils pour obtenir les meilleurs résultats OCR
La précision de l'OCR dépend fortement de la qualité du document scanné. Quelques détails permettent d'améliorer nettement les résultats :
- Indiquez la langue du document lorsque vous la connaissez — c'est le moyen le plus simple de gagner en précision et en rapidité.
- Utilisez un scan clair et bien aligné. Numérisez à nouveau les pages inclinées ou pivotées afin que le texte repose sur des lignes horizontales.
- Privilégiez une résolution plus élevée. Les numérisations autour de 300 DPI ou plus offrent à l'OCR des caractères bien plus nets que les images de faible résolution.
- Améliorez le contraste des documents effacés afin que le texte se détache clairement du fond.
- Assurez-vous que le fichier n'est pas protégé par un mot de passe — les PDF chiffrés ne peuvent pas être lus tant qu'ils ne sont pas déverrouillés.
Alternative : l'OCR sur PDFEquips
Si vous travaillez déjà sur PDFEquips — par exemple pour convertir, compresser ou fusionner des PDF —, la plateforme propose également un outil OCR pour rendre un PDF scanné recherchable. L'une ou l'autre de ces options vous fournira un fichier traité par OCR que vous pourrez ensuite importer dans DocTranslating pour le traduire. Utilisez la solution qui s'intègre le mieux à votre méthode de travail.
Foire aux questions
Comment extraire le texte d'un PDF scanné ?
Ouvrez l'outil OCR PDF de DocTranslating, importez votre PDF scanné, définissez éventuellement la langue du document pour des résultats plus rapides et précis, puis cliquez sur Extraire le texte. L'outil reconstruit une vraie couche de texte sélectionnable tout en conservant l'apparence originale du document, et vous permet de télécharger un PDF traité par OCR que vous pouvez sélectionner, rechercher, copier et traduire.
Comment savoir si un PDF est scanné ou s'il contient du texte réel ?
Essayez de sélectionner une ligne de texte avec votre curseur ou recherchez dans le document avec Ctrl+F (Cmd+F sur Mac). Si vous ne pouvez pas surligner de mots individuels ou si un mot bien visible ne renvoie aucun résultat, le PDF est scanné et nécessite une OCR. Dans DocTranslating, l'ouverture d'un fichier scanné affiche également le message « Ce document semble être scanné… » avec un bouton pour ouvrir l'outil OCR PDF.
Peut-il extraire du texte manuscrit à partir d'un PDF ?
Oui. L'outil OCR PDF reconnaît le texte manuscrit en plus du texte imprimé. Une écriture manuscrite claire et lisible offre les meilleurs résultats ; une écriture très brouillonne ou stylisée représente un défi plus important pour n'importe quel système OCR, les résultats varient donc selon la lisibilité.
L'OCR fonctionne-t-elle pour l'arabe, l'hébreu et les autres langues s'écrivant de droite à gauche ?
Oui. L'outil OCR PDF prend en charge les écritures de droite à gauche, notamment l'arabe, l'hébreu et le persan, et reconstruit le sens de lecture correct — ce qui constitue la partie la plus complexe pour les documents RTL scannés. Le texte extrait devient ainsi réellement utilisable pour la recherche et la traduction au lieu d'être désordonné.
Combien de langues l'outil OCR PDF prend-il en charge ?
Plus de 50 langues, dont de nombreuses langues à écritures non latines. Vous pouvez laisser l'outil détecter automatiquement la langue ou la définir manuellement pour une extraction plus rapide et précise — indiquer la langue est particulièrement utile pour les documents manuscrits ou non latins.
Dois-je exécuter l'OCR avant de traduire un PDF scanné ?
C'est la méthode recommandée. Exécuter l'OCR comme première étape distincte vous permet de vérifier l'exactitude du texte extrait avant la traduction, évitant ainsi de transmettre des erreurs de reconnaissance dans une autre langue. Une fois votre PDF traité par OCR en main, traduisez-le comme n'importe quel PDF ordinaire.
L'OCR va-t-elle modifier l'apparence de mon document ?
Non — l'outil OCR PDF conserve l'apparence originale du document et lui ajoute une couche de texte sélectionnable. Votre document scanné reste identique visuellement ; la seule différence est que son texte peut désormais être sélectionné, recherché, copié et traduit.
Pourquoi Google Traduction ou d'autres outils ne traduisent-ils pas mon PDF scanné ?
La plupart des outils de traduction ne lisent que la couche de texte existante d'un PDF, or un PDF scanné n'en possède pas — il s'agit d'une simple image. C'est pourquoi ces outils renvoient un fichier vide ou une erreur. Extraire d'abord le texte avec l'OCR fournit au document une vraie couche de texte, qui peut ensuite être traduite normalement.