Guide pratique

Comment extraire le texte d'un PDF scanné

Extraction de texte sélectionnable à partir d'un PDF scanné grâce à l'OCR, puis traduction du résultat

Un PDF scanné n'est qu'une image de texte, ce qui signifie que vous ne pouvez pas le sélectionner, le rechercher, le copier ou le traduire. L'outil OCR PDF de DocTranslating transforme un PDF scanné ou composé d'images en une vraie couche de texte sélectionnable en quelques clics : ouvrez l'outil, importez votre document scanné, définissez éventuellement la langue du document pour obtenir des résultats plus rapides et plus précis, puis cliquez sur Extraire le texte. Il prend en charge plus de 50 langues, les textes manuscrits et les écritures de droite à gauche comme l'arabe et l'hébreu. Une fois votre PDF traité par OCR, vous pouvez le traduire, le rechercher ou en copier le texte exactement comme pour un document ordinaire.

Mis à jour 19 juin 2026 · 8 min de lecture

Si vous avez essayé de sélectionner du texte dans un PDF et que rien ne se surligne, ou si vous avez effectué une recherche avec Ctrl+F sans obtenir de résultat, c'est que votre PDF est scanné — il s'agit d'une image de page et non de texte. C'est également la raison pour laquelle vous ne pouvez pas le traduire, le copier ou le modifier. La solution est la reconnaissance optique de caractères (OCR), qui lit l'image et crée une vraie couche de texte en dessous. Ce guide vous explique comment procéder avec l'outil OCR PDF de DocTranslating et quoi faire du résultat.

Comment savoir si mon PDF est scanné ?

Trois vérifications rapides vous permettent de savoir si un PDF nécessite une OCR :

Étape par étape : extraire le texte d'un PDF scanné

  1. 1

    Ouvrez l'outil OCR PDF

    Accédez directement à l'outil OCR PDF ou, si vous essayiez déjà de traduire un fichier scanné, cliquez sur le bouton « Ouvrir l'outil OCR PDF » dans la notification. Les deux options mènent au même outil.

  2. 2

    Importez votre PDF scanné

    Sélectionnez le fichier PDF scanné ou basé sur des images que vous souhaitez convertir. Il s'agit du fichier dont le texte ne peut actuellement pas être sélectionné ni recherché.

  3. 3

    Définissez la langue du document (optionnel)

    Si vous connaissez la langue du document, sélectionnez-la. C'est optionnel — l'outil détecte automatiquement la langue —, mais cela garantit des résultats plus rapides et plus précis, en particulier pour les écritures non latines comme l'arabe, le chinois, le cyrillique ou le devanagari, ainsi que pour les textes manuscrits.

  4. 4

    Cliquez sur Extraire le texte et téléchargez le résultat

    L'outil lit les pages et reconstruit une vraie couche de texte sélectionnable tout en conservant l'apparence originale du document. Téléchargez le PDF traité par OCR : vous pouvez désormais sélectionner, rechercher et copier son texte, et il est prêt à être traduit.

Ce que l'outil OCR PDF gère particulièrement bien

Le moteur OCR de DocTranslating est l'un des plus performants disponibles et va bien au-delà du texte imprimé basique en anglais :

Après l'OCR : traduire votre document

Une fois votre PDF traité par OCR obtenu, sa traduction se déroule exactement comme celle d'un PDF classique — importez-le, choisissez vos langues et le moteur de traduction, puis téléchargez la version traduite. Effectuer l'OCR au préalable sous forme d'étape distincte offre un avantage majeur : vous pouvez relire le texte extrait et vérifier son exactitude avant de traduire. Traduire un scan non vérifié risque de cumuler deux types d'erreurs — un mot mal lu devenant un mot mal traduit avec assurance —, la vérification préalable du résultat OCR constitue donc la meilleure méthode pour obtenir une traduction finale précise.

Conseils pour obtenir les meilleurs résultats OCR

La précision de l'OCR dépend fortement de la qualité du document scanné. Quelques détails permettent d'améliorer nettement les résultats :

Alternative : l'OCR sur PDFEquips

Si vous travaillez déjà sur PDFEquips — par exemple pour convertir, compresser ou fusionner des PDF —, la plateforme propose également un outil OCR pour rendre un PDF scanné recherchable. L'une ou l'autre de ces options vous fournira un fichier traité par OCR que vous pourrez ensuite importer dans DocTranslating pour le traduire. Utilisez la solution qui s'intègre le mieux à votre méthode de travail.

Foire aux questions

Comment extraire le texte d'un PDF scanné ?

Ouvrez l'outil OCR PDF de DocTranslating, importez votre PDF scanné, définissez éventuellement la langue du document pour des résultats plus rapides et précis, puis cliquez sur Extraire le texte. L'outil reconstruit une vraie couche de texte sélectionnable tout en conservant l'apparence originale du document, et vous permet de télécharger un PDF traité par OCR que vous pouvez sélectionner, rechercher, copier et traduire.

Comment savoir si un PDF est scanné ou s'il contient du texte réel ?

Essayez de sélectionner une ligne de texte avec votre curseur ou recherchez dans le document avec Ctrl+F (Cmd+F sur Mac). Si vous ne pouvez pas surligner de mots individuels ou si un mot bien visible ne renvoie aucun résultat, le PDF est scanné et nécessite une OCR. Dans DocTranslating, l'ouverture d'un fichier scanné affiche également le message « Ce document semble être scanné… » avec un bouton pour ouvrir l'outil OCR PDF.

Peut-il extraire du texte manuscrit à partir d'un PDF ?

Oui. L'outil OCR PDF reconnaît le texte manuscrit en plus du texte imprimé. Une écriture manuscrite claire et lisible offre les meilleurs résultats ; une écriture très brouillonne ou stylisée représente un défi plus important pour n'importe quel système OCR, les résultats varient donc selon la lisibilité.

L'OCR fonctionne-t-elle pour l'arabe, l'hébreu et les autres langues s'écrivant de droite à gauche ?

Oui. L'outil OCR PDF prend en charge les écritures de droite à gauche, notamment l'arabe, l'hébreu et le persan, et reconstruit le sens de lecture correct — ce qui constitue la partie la plus complexe pour les documents RTL scannés. Le texte extrait devient ainsi réellement utilisable pour la recherche et la traduction au lieu d'être désordonné.

Combien de langues l'outil OCR PDF prend-il en charge ?

Plus de 50 langues, dont de nombreuses langues à écritures non latines. Vous pouvez laisser l'outil détecter automatiquement la langue ou la définir manuellement pour une extraction plus rapide et précise — indiquer la langue est particulièrement utile pour les documents manuscrits ou non latins.

Dois-je exécuter l'OCR avant de traduire un PDF scanné ?

C'est la méthode recommandée. Exécuter l'OCR comme première étape distincte vous permet de vérifier l'exactitude du texte extrait avant la traduction, évitant ainsi de transmettre des erreurs de reconnaissance dans une autre langue. Une fois votre PDF traité par OCR en main, traduisez-le comme n'importe quel PDF ordinaire.

L'OCR va-t-elle modifier l'apparence de mon document ?

Non — l'outil OCR PDF conserve l'apparence originale du document et lui ajoute une couche de texte sélectionnable. Votre document scanné reste identique visuellement ; la seule différence est que son texte peut désormais être sélectionné, recherché, copié et traduit.

Pourquoi Google Traduction ou d'autres outils ne traduisent-ils pas mon PDF scanné ?

La plupart des outils de traduction ne lisent que la couche de texte existante d'un PDF, or un PDF scanné n'en possède pas — il s'agit d'une simple image. C'est pourquoi ces outils renvoient un fichier vide ou une erreur. Extraire d'abord le texte avec l'OCR fournit au document une vraie couche de texte, qui peut ensuite être traduite normalement.

How-to

Comment traduire un fichier PDF scanné (Scanné)

Les PDF scannés sont des images de texte et non du vrai texte ; c'est pourquoi la majorité des outils de traduction — y compris Google Traduction (Google Translate) — les refusent, renvoient un fichier vide ou affichent l'erreur "impossible de traduire ce fichier". Pour traduire un PDF scanné, vous avez besoin de la technologie de reconnaissance optique de caractères (OCR) pour extraire le texte avant la traduction. DocTranslating lance automatiquement l'OCR dans son processus de traduction, prend en charge plus de 100 langues et reconstruit le texte traduit dans une version identique au PDF d'origine. Pour garantir la précision des documents importants, vérifiez d'abord le rendu de l'OCR sur PDFEquips afin que les erreurs d'extraction de texte ne s'ajoutent pas aux erreurs de traduction.

8 min read

Prise en main

Comment traduire un document sans perdre la mise en page

DocTranslating traduit des fichiers PDF, Word, PowerPoint, Excel, du code et des sous-titres dans plus de 100 langues tout en préservant la mise en page d'origine, les polices, les tableaux et les images. Téléversez un fichier, choisissez une langue et l'un des quatre moteurs de traduction (DeepL, Microsoft Azure, Google Cloud ou Gemini), puis téléchargez une copie traduite identique à l'original. Ce guide couvre l'ensemble du processus ainsi que des cas particuliers du monde réel : PDF scannés, notes de bas de page et zones de texte, cohérence terminologique, limites de taille de fichier et langues s'écrivant de droite à gauche (RTL).

11 min read

← Tous les guides