OCR PDF — extraire le texte des pages numérisées

Transformez les PDF numérisés et composés uniquement d'images en texte consultable et sélectionnable. Reconnaît 10 langues, extrait le texte vers un fichier .txt, ou crée un PDF interrogeable avec une couche de texte invisible. Tout s'exécute dans votre navigateur.

Fonctionnalités clés

Plus de 10 langues

Reconnaît l'anglais, le chinois (simplifié et traditionnel), le japonais, le coréen, l'espagnol, le français, l'allemand, le portugais et l'arabe — ou combinez-en plusieurs à la fois.

PDF interrogeable

Créez un PDF avec une couche de texte invisible, pour que les pages numérisées deviennent consultables et sélectionnables dans n'importe quel lecteur.

Extraction de texte

Extrayez le texte reconnu vers un fichier .txt brut, avec des séparateurs de pages, prêt à éditer ou copier.

Contrôle total

Choisissez le format de sortie, la qualité OCR et une plage de pages précise — pas besoin de traiter tout le document.

100 % privé

Tout le traitement s'effectue localement dans votre navigateur. Vos fichiers ne sont jamais téléversés vers un serveur.

Aucune installation, gratuit

Fonctionne sur n'importe quel appareil avec un navigateur. Aucune inscription, aucun filigrane, et entièrement gratuit.

Qu'est-ce que l'OCR de PDF ?

L'OCR (reconnaissance optique de caractères) convertit des images de texte en texte lisible par machine. Les PDF numérisés sont en réalité des images de pages — les mots ne peuvent être ni recherchés, ni copiés, ni sélectionnés. Cet outil rend chaque page et reconnaît le texte avec un moteur OCR à réseau de neurones, puis vous permet soit d'exporter le texte reconnu, soit de le réécrire dans le PDF comme couche de texte invisible. Le résultat est un document dans lequel vous pouvez rechercher des mots, sélectionner et copier des phrases, et indexer le contenu automatiquement. Tout le traitement s'effectue localement dans votre navigateur, pour que vos documents ne quittent jamais votre appareil.

Comment faire l'OCR d'un PDF

Lancer l'OCR ne prend que quelques étapes. Tout se passe dans votre navigateur.

1

Téléversez le PDF numérisé

Glissez-déposez un PDF numérisé ou composé uniquement d'images, ou cliquez sur la zone de téléversement pour le sélectionner.

2

Choisissez vos options

Sélectionnez la ou les langues, le format de sortie (texte ou PDF interrogeable), la qualité et une plage de pages facultative. Les valeurs par défaut conviennent à la plupart des documents.

3

Démarrez l'OCR

Cliquez sur Démarrer l'OCR. Chaque page sélectionnée est rendue et reconnue automatiquement.

4

Téléchargez le résultat

Téléchargez le fichier .txt extrait ou le PDF interrogeable. Pour la sortie texte, un aperçu montre le contenu reconnu.

Bon à savoir

Pour de meilleurs résultats, utilisez des numérisations claires et haute résolution et sélectionnez la ou les langues correctes. Les textes très petits, flous ou fortement stylisés peuvent être reconnus avec une précision moindre. Les PDF protégés par mot de passe doivent être déverrouillés avant l'OCR. La première exécution charge le moteur de reconnaissance et les données de langue, ce qui peut prendre quelques secondes ; les exécutions suivantes sont plus rapides. Des réglages de qualité plus élevés améliorent la précision mais ralentissent le traitement. L'arabe et certains systèmes d'écriture sont reconnus au mieux lorsque leur langue est sélectionnée seule.

Questions fréquentes