Extrayez le texte de vos numérisations et de vos photos
Un document numérisé est une image de texte : on ne peut donc ni le copier, ni le rechercher, ni le sélectionner. L'OCR en relit les caractères. Vous obtenez soit le texte brut, soit le même document enrichi d'une couche de texte invisible, qui se comporte alors comme un PDF ordinaire.
- PDF numérisés et photos, jusqu'à 200 pages
- Sept langues, dont le russe, le japonais et le chinois
- Le PDF consultable conserve l'aspect exact des pages
- Les fichiers sont supprimés automatiquement — 24 heures en gratuit, 7 jours sur les offres payantes
PDF, PNG, JPG, TIFF, BMP, GIF, WebP ou HEIC.
Choisissez la langue réellement présente sur la page. Une mauvaise langue ne provoque pas d'erreur : elle renvoie du charabia.
Comment extraire le texte d'une numérisation
- 01
Envoyez la numérisation ou la photo
Choisissez un PDF numérisé ou une image de la page. Les PDF de plusieurs pages sont lus page par page, dans l'ordre.
- 02
Choisissez la langue
Sélectionnez la langue dans laquelle le document est réellement rédigé. Cela compte plus qu'il n'y paraît : une mauvaise langue ne produit pas d'erreur, elle produit un charabia parfaitement assuré.
- 03
Choisissez le texte brut ou le PDF consultable
Le texte brut vous donne les caractères à copier. Le PDF consultable renvoie les pages d'origine avec une couche de texte masquée : le fichier a exactement le même aspect, mais on peut y faire des recherches et sélectionner son contenu.
- 04
Lisez ou téléchargez le résultat
Le texte s'affiche sur la page, prêt à être copié ; un PDF consultable se télécharge immédiatement.
Ce qui influe sur la précision
La résolution. Les pages sont rendues à 300 DPI avant la lecture, le niveau recommandé par la documentation de Tesseract elle-même. Une photo prise de loin, ou une numérisation réalisée à 100 DPI, offre beaucoup moins de matière au moteur.
La rectitude et la netteté. Une page photographiée de biais, ou dont le texte se courbe près de la reliure d'un livre, se lit nettement moins bien qu'une numérisation à plat.
La langue. Chaque langue possède son propre modèle entraîné. Passer du texte cyrillique ou japonais dans le modèle anglais renvoie un charabia d'apparence fluide plutôt qu'une erreur ; c'est pourquoi le sélecteur ne propose que les langues que le serveur peut réellement charger.
Ce que l'OCR ne fait pas. La mise en page n'est pas conservée : colonnes, tableaux et en-têtes reviennent sous forme de texte continu, dans l'ordre de lecture. Si le PDF d'origine contient déjà une couche de texte, sa conversion en texte utilise celle-ci — exacte, instantanée, et meilleure que n'importe quel OCR.
À quoi cela sert
Contrats et factures
Un PDF signé reçu sous forme de numérisation, transformé en fichier consultable pour retrouver plus tard un numéro de référence.
Reçus photographiés au téléphone
Récupérez les montants et les dates d'une photo au lieu de les ressaisir.
Documents anciens et archives
Des documents papier numérisés il y a des années, rendus consultables sans modifier l'aspect des pages.
Captures d'écran et diapositives
Récupérez le texte d'une image dont le fichier d'origine a disparu depuis longtemps.
Questions fréquentes
Qu'est-ce qu'un PDF consultable ?
Un PDF qui ressemble exactement à la numérisation que vous avez envoyée, avec une couche invisible de texte reconnu positionnée par-dessus les mots. Les pages sont visuellement inchangées, mais vous pouvez désormais les sélectionner, les copier et y faire des recherches — et d'autres logiciels aussi.
Quelles langues sont prises en charge ?
L'anglais, le russe, le français, l'allemand, l'espagnol, le japonais et le chinois simplifié. Le sélecteur liste exactement ce que le serveur peut charger — il ne propose jamais une langue qui produirait silencieusement du charabia.
Combien de pages peut-il traiter ?
Jusqu'à 200 pages par fichier. Chaque page est rendue et lue séparément : un document long prend donc proportionnellement plus de temps.
L'OCR est-il assez fiable pour qu'on s'y fie ?
Sur une numérisation propre et droite de texte imprimé, il est très précis. L'écriture manuscrite, les photos peu résolues, les pages de biais et les polices inhabituelles donnent des résultats nettement moins bons. Vérifiez toujours les chiffres qui comptent : les erreurs d'OCR ressemblent à du texte plausible, pas à des erreurs.
Conservez-vous mon document ?
Pas plus longtemps que la durée de conservation de votre offre : 24 heures en gratuit et pour les visiteurs sans compte, 7 jours sur les offres payantes. Le fichier est transféré via TLS et n'est utilisé à rien d'autre qu'à produire votre résultat.
Mon PDF contient déjà du texte sélectionnable. Ai-je besoin de l'OCR ?
Non. Si un PDF contient déjà une couche de texte, sa conversion en texte utilise directement cette couche, ce qui est exact et instantané. L'OCR ne s'exécute que lorsqu'il n'y a rien à extraire, c'est-à-dire quand la page n'est réellement qu'une image.