Aller au contenu
WoowPDF

OCR PDF – Rendre un PDF scanné consultable

Rendez vos PDF scannés et photos consultables grâce à l'OCR en 15 langues. PDF avec recherche ou texte brut, reconnus dans votre navigateur sans envoi.

Gratuit Fonctionne dans votre navigateur

Comment faire l'OCR d'un PDF scanné en ligne

Un document scanné n'est qu'une image de page : impossible d'y chercher un mot, de sélectionner une phrase ou de copier un chiffre. L'OCR PDF (reconnaissance optique de caractères) lit les lettres de cette image et les transforme en vrai texte. Vous pouvez conserver l'aspect d'origine et ajouter une couche de texte invisible, pour obtenir un PDF consultable, ou simplement télécharger le texte reconnu en .txt. La reconnaissance s'effectue dans votre navigateur avec le moteur libre Tesseract : votre scan ne quitte jamais votre appareil.

Comment faire l'OCR d'un PDF

  1. Ajoutez un PDF scanné ou une image (PDF, JPG, PNG, WebP ou BMP, jusqu'à 100 Mo). Vous pouvez aussi coller une capture avec Ctrl+V.
  2. Choisissez la langue du document, par défaut celle de cette page, et ajoutez si besoin une deuxième langue pour un document bilingue.
  3. Choisissez la sortie : PDF consultable ou Texte brut. Pour un PDF, vous pouvez limiter l'OCR à certaines pages, par exemple 1-3, 7.
  4. Cliquez sur Reconnaître le texte. Au premier usage, les données de langue sont téléchargées puis mises en cache. La progression s'affiche page par page.
  5. Téléchargez fichier-ocr.pdf ou fichier.txt.

Langues prises en charge

Anglais, français, espagnol, allemand, italien, portugais, russe, arabe, hindi, chinois simplifié et traditionnel, japonais, coréen, turc et ourdou. Le bon choix de langue est essentiel : il indique au moteur l'alphabet et les mots attendus. N'ajoutez une deuxième langue que si le document la contient vraiment, car chaque langue supplémentaire ralentit la reconnaissance.

À quoi ressemble le PDF consultable

Vos pages ne sont ni modifiées ni recompressées. Chaque page est rendue jusqu'à 300 DPI pour la reconnaissance, puis les mots reconnus sont placés en couche invisible exactement sur les mots imprimés. Le document a le même aspect, mais Ctrl+F trouve les mots, vous pouvez surligner et copier, et les outils de recherche peuvent indexer le fichier.

Quelle précision attendre ?

  • Meilleurs résultats : texte imprimé net, scanné à 300 DPI, pages droites et bon contraste.
  • Résultats moins bons : photos floues, très petits caractères, pages inclinées, fonds colorés et polices décoratives.
  • Non adapté : l'écriture manuscrite, que Tesseract ne lit pas de façon fiable.
  • L'arabe, le hindi et le chinois demandent en général un scan plus net que l'alphabet latin.

Relisez toujours les chiffres, noms et dates importants.

Conseils et outils liés

  • Vous photographiez des documents ? Scanner en PDF redresse et nettoie les pages avant l'OCR.
  • Pour un texte structuré, convertissez ensuite le PDF consultable avec PDF en Markdown.
  • Si le PDF contient déjà du texte sélectionnable, l'extracteur de texte PDF est instantané et exact.

Privé et gratuit

La reconnaissance se fait sur votre ordinateur ou téléphone : contrats, pièces d'identité ou courriers médicaux ne sont jamais envoyés à WoowPDF. Seul le modèle de langue est téléchargé. Pas d'inscription, pas de limite quotidienne, pas de filigrane. La vitesse dépend de votre appareil : quelques secondes par page sur un ordinateur portable.

Fonctionnalités

  • OCR en 15 langues, avec deuxième langue facultative
  • PDF consultable avec couche de texte invisible
  • Export en texte brut (.txt) avec repères de page
  • PDF scannés et images JPG, PNG, WebP, BMP
  • Toutes les pages ou une plage choisie
  • Dans le navigateur : aucun envoi du fichier

Questions fréquentes

Qu'est-ce que l'OCR PDF ?

La reconnaissance optique de caractères lit le texte des pages scannées ou photographiées et le transforme en caractères réels, que l'on peut rechercher et copier.

Mon document scanné est-il envoyé ?

Non. La reconnaissance s'effectue dans votre navigateur avec Tesseract. Seules les données de langue sont téléchargées une fois.

Quelles langues sont reconnues ?

Anglais, français, espagnol, allemand, italien, portugais, russe, arabe, hindi, chinois simplifié et traditionnel, japonais, coréen, turc et ourdou, combinables par deux.

PDF consultable ou texte brut : quelle différence ?

Le PDF consultable conserve vos pages et ajoute une couche de texte invisible. Le texte brut ne fournit que les mots reconnus dans un fichier .txt.

L'outil lit-il l'écriture manuscrite ?

Pas de façon fiable : le moteur est entraîné sur du texte imprimé.

Comment améliorer la précision ?

Utilisez un scan net d'environ 300 DPI, des pages droites et la bonne langue, sans deuxième langue inutile.

Ce n'est pas tout à fait ce qu'il vous faut ?