PDF scanné en texte
Dans une numérisation, chaque page est une image du papier : il n’y a aucun texte à copier. La reconnaissance de texte (OCR) lit les caractères sur votre appareil et vous donne le texte dans un fichier .txt, ainsi qu’un PDF où vous pouvez désormais rechercher le texte.
Traité sur votre appareilRien n’est envoyé sur un serveur
Glissez un ou plusieurs PDF ici
Fichiers PDF
Les fichiers sont ouverts sur votre appareil et ne sont jamais envoyés.
Comment ça marche
Choisissez le document numérisé
Faites glisser le PDF numérisé (ou la photo d’un document enregistrée en PDF) dans la zone de travail, ou utilisez le bouton.
Vérifiez la langue
La langue de la page est déjà sélectionnée ; cochez les autres langues du document, s’il y en a. La première fois, MovaDoc télécharge les données de reconnaissance : environ 3 Mo par langue.
Téléchargez le texte
Le début du texte reconnu s’affiche à l’écran. Cliquez sur « Télécharger le texte (.txt) » pour obtenir le texte complet, ou téléchargez le PDF consultable.
Questions fréquentes
Pourquoi ne puis-je pas copier le texte de mon PDF ?
Parce qu’il s’agit d’une numérisation : chaque page est une image du papier, sans caractères enregistrés, et votre lecteur PDF n’y voit qu’une photo. L’OCR reconnaît les caractères de cette image et les transforme en texte que vous pouvez copier, modifier et rechercher.
Le texte conserve-t-il la mise en forme du document ?
Non. Le fichier .txt ne contient que le texte, ligne par ligne, avec une ligne vide entre les paragraphes : ni polices, ni gras, ni images, ni quadrillage des tableaux. Pour obtenir un document Word modifiable, avec titres, listes et tableaux, utilisez « PDF en Word », qui reconnaît aussi les pages numérisées.
Cela fonctionne-t-il avec des photos de documents et avec l’écriture manuscrite ?
Avec des photos enregistrées en PDF, oui, si elles sont nettes et droites : plus l’image est bonne, moins il y a d’erreurs. Si la photo est en JPG ou en PNG, placez-la d’abord dans un PDF avec « Images en PDF ». L’écriture manuscrite n’est pas reconnue : les données de reconnaissance ne conviennent qu’au texte imprimé.
Puis-je extraire le texte de plusieurs PDF à la fois ?
Oui, en deux étapes. Avec plusieurs PDF, vous obtenez un ZIP qui contient les PDF consultables (sans les fichiers .txt). Ensuite, « Continuer avec… » → « PDF en texte », qui traite lui aussi plusieurs fichiers à la fois, donne un .txt par PDF.
Le document est-il envoyé quelque part pour être lu ?
Non. La reconnaissance s’exécute dans votre navigateur, avec le moteur Tesseract. La première fois, MovaDoc télécharge le moteur et les données des langues depuis son propre site ; ensuite, elle fonctionne même sans internet. Le PDF et le texte reconnu ne quittent jamais votre appareil.