OCR

Text aus Scans und Fotos extrahieren

Ein gescanntes Dokument ist ein Bild von Text — Kopieren, Suchen und Markieren funktionieren darin nicht. OCR liest die Zeichen wieder heraus. Sie erhalten entweder den reinen Text oder dasselbe Dokument mit einer unsichtbaren Textebene, sodass es sich wie ein normales PDF verhält.

  • Gescannte PDFs und Fotos, bis zu 200 Seiten
  • Sieben Sprachen, darunter Russisch, Japanisch und Chinesisch
  • Das durchsuchbare PDF lässt die Seiten exakt so aussehen wie zuvor
  • Dateien werden automatisch gelöscht — 24 Stunden kostenlos, 7 Tage in kostenpflichtigen Tarifen

PDF, PNG, JPG, TIFF, BMP, GIF, WebP oder HEIC.

Wählen Sie die Sprache, die tatsächlich auf der Seite steht. Die falsche Sprache führt nicht zu einem Fehler — sie liefert Unsinn.

Ausgabe

Der erkannte Text, bereit zum Kopieren.

So extrahieren Sie Text aus einem Scan

  1. 01

    Scan oder Foto hochladen

    Wählen Sie ein gescanntes PDF oder ein Bild der Seite. Mehrseitige PDFs werden Seite für Seite in der richtigen Reihenfolge gelesen.

  2. 02

    Sprache wählen

    Wählen Sie die Sprache, in der das Dokument tatsächlich verfasst ist. Das ist wichtiger, als es klingt: Die falsche Sprache erzeugt keine Fehlermeldung, sondern überzeugend aussehenden Unsinn.

  3. 03

    Reinen Text oder durchsuchbares PDF wählen

    Reiner Text liefert Ihnen die Zeichen zum Kopieren. Das durchsuchbare PDF gibt die Originalseiten mit einer verborgenen Textebene zurück — die Datei sieht also gleich aus, lässt sich aber durchsuchen und markieren.

  4. 04

    Ergebnis lesen oder herunterladen

    Der Text erscheint direkt auf der Seite und kann kopiert werden; ein durchsuchbares PDF wird sofort heruntergeladen.

Was die Genauigkeit beeinflusst

Auflösung. Seiten werden vor dem Auslesen mit 300 DPI gerendert — das ist der Wert, den die Dokumentation von Tesseract selbst empfiehlt. Ein aus großer Entfernung aufgenommenes Foto oder ein Scan mit 100 DPI bietet der Engine deutlich weniger Substanz.

Ausrichtung und Schärfe. Eine schräg fotografierte Seite oder eine, bei der sich der Text am Buchrücken wölbt, wird merklich schlechter erkannt als ein flacher Scan.

Sprache. Jede Sprache hat ihr eigenes trainiertes Modell. Kyrillischer oder japanischer Text durch das englische Modell liefert flüssig wirkenden Unsinn statt einer Fehlermeldung — deshalb bietet die Auswahl nur Sprachen an, die der Server auch wirklich laden kann.

Was OCR nicht leistet. Das Layout bleibt nicht erhalten: Spalten, Tabellen und Kopfzeilen kommen als Fließtext in Lesereihenfolge zurück. Wenn das ursprüngliche PDF bereits eine Textebene besitzt, wird bei der Umwandlung in Text diese verwendet — exakt, sofort und besser als jede OCR.

Wofür das genutzt wird

Verträge und Rechnungen

Ein unterschriebenes PDF, das als Scan eintraf, wird zu einer durchsuchbaren Datei, in der sich eine Belegnummer später wiederfinden lässt.

Mit dem Handy fotografierte Belege

Beträge und Daten aus einem Foto herausholen, statt sie erneut abzutippen.

Alte Dokumente und Archive

Vor Jahren gescannte Papierunterlagen durchsuchbar machen, ohne das Aussehen der Seiten zu verändern.

Screenshots und Folien

Den Text aus einem Bild zurückgewinnen, wenn die Originaldatei längst verschwunden ist.

Häufig gestellte Fragen

Was ist ein durchsuchbares PDF?

Ein PDF, das genau wie der hochgeladene Scan aussieht, mit einer unsichtbaren Ebene erkannten Textes, die über den Wörtern liegt. Optisch sind die Seiten unverändert, aber Sie können sie nun markieren, kopieren und durchsuchen — und andere Software ebenso.

Welche Sprachen werden unterstützt?

Englisch, Russisch, Französisch, Deutsch, Spanisch, Japanisch und vereinfachtes Chinesisch. Die Auswahl listet genau das auf, was der Server laden kann — sie bietet nie eine Sprache an, die stillschweigend Unsinn erzeugen würde.

Wie viele Seiten sind möglich?

Bis zu 200 Seiten pro Datei. Jede Seite wird einzeln gerendert und gelesen, ein langes Dokument dauert daher entsprechend länger.

Ist OCR genau genug, um sich darauf zu verlassen?

Bei einem sauberen, geraden Scan von gedrucktem Text ist sie sehr genau. Handschrift, Fotos mit niedriger Auflösung, schräge Seiten und ungewöhnliche Schriften sind deutlich schlechter. Prüfen Sie Zahlen, auf die es ankommt, immer nach — OCR-Fehler sehen aus wie plausibler Text, nicht wie Fehler.

Behalten Sie mein Dokument?

Nicht länger als die Aufbewahrungsfrist Ihres Tarifs: 24 Stunden im Free-Tarif und für Besucher ohne Konto, 7 Tage in kostenpflichtigen Tarifen. Die Datei wird über TLS übertragen und für nichts anderes verwendet als für die Erstellung Ihres Ergebnisses.

Mein PDF enthält bereits markierbaren Text. Brauche ich OCR?

Nein. Wenn ein PDF bereits eine Textebene hat, wird bei der Umwandlung in Text direkt diese Ebene verwendet — exakt und sofort. OCR läuft nur dann, wenn es nichts zu extrahieren gibt, die Seite also tatsächlich nur ein Bild ist.