Aller au contenu

OCR PDF : reconnaître le texte des numérisations

Reconnaissez le texte des pages numérisées et ajoutez-le, invisible, par-dessus chaque page : le PDF garde le même aspect, mais vous pouvez désormais rechercher et copier son texte. Tout se passe sur votre appareil.

Traité sur votre appareilRien n’est envoyé sur un serveur

Glissez un ou plusieurs PDF ici

Fichiers PDF

Les fichiers sont ouverts sur votre appareil et ne sont jamais envoyés.

Comment ça marche

  1. Choisissez le PDF numérisé

    Faites glisser le fichier dans la zone de travail ou utilisez le bouton. Vous pouvez en choisir plusieurs à la fois.

  2. Choisissez les langues

    Cochez les langues du document (français, portugais, anglais, espagnol, allemand ou italien) et la qualité. La première fois, MovaDoc télécharge les données de reconnaissance : environ 3 Mo par langue.

  3. Téléchargez le PDF consultable

    Les pages gardent le même aspect, avec le texte reconnu caché par-dessus : vous pouvez maintenant le rechercher et le copier. Vous pouvez aussi télécharger uniquement le texte (.txt).

Questions fréquentes

Mes fichiers sont-ils envoyés sur un serveur ?

Non. La reconnaissance s’exécute dans votre navigateur, avec le moteur Tesseract. La première fois, MovaDoc télécharge depuis son propre site le moteur et les données des langues (environ 3 Mo par langue), au moment où vous commencez à utiliser l’outil (quand vous le touchez, cliquez dessus ou l’atteignez au clavier) et avant de traiter le moindre fichier ; votre PDF ne quitte jamais votre appareil.

Le texte reconnu est-il fiable ?

Cela dépend de la numérisation. Un texte imprimé, net et droit est reconnu presque sans erreur ; les numérisations de travers, floues ou en basse résolution donnent plus d’erreurs. L’écriture manuscrite n’est pas reconnue. Une page numérisée couchée doit d’abord être redressée (dans « Organiser PDF »). Vérifiez toujours ce qui est important.

Qu’est-ce qui change dans le PDF ?

Ce que vous voyez ne change pas : le texte reconnu est ajouté, invisible, par-dessus chaque page, à l’emplacement de chaque mot. Vous pouvez ainsi sélectionner, copier et rechercher le texte. Dans les tableaux, on peut rechercher les mots, mais le texte copié perd la forme du tableau.

Puis-je l’utiliser hors ligne ?

Oui, après la première fois : les fichiers de reconnaissance restent enregistrés dans le navigateur (en navigation privée, seulement jusqu’à ce que vous fermiez la fenêtre). La première fois (et quand vous choisissez une autre langue ou une autre qualité), une connexion internet est nécessaire pour les télécharger.

Quelles langues sont reconnues ? Et « Rapide » ou « Précis » ?

Le français, le portugais, l’anglais, l’espagnol, l’allemand et l’italien, y compris mélangés dans un même document. « Rapide » est plus léger et suffit pour un texte imprimé net ; « Précis » reconnaît mieux les petits caractères et les numérisations de mauvaise qualité, mais prend plus de temps. Sur un ordinateur, chaque page prend quelques secondes ; sur un téléphone, cela peut être bien plus long.