Zum Inhalt springen

OCR PDF: Text in gescannten PDFs erkennen

Erkenne den Text gescannter Seiten und lege ihn als unsichtbare Textebene über jede Seite: Das PDF sieht genauso aus wie vorher, aber du kannst den Text jetzt durchsuchen und kopieren. Alles passiert auf deinem Gerät.

Auf deinem Gerät verarbeitetNichts wird auf Server hochgeladen

Ein oder mehrere PDFs hierher ziehen

PDF-Dateien

Die Dateien werden auf deinem Gerät geöffnet und nie hochgeladen.

So funktioniert’s

  1. Gescanntes PDF auswählen

    Zieh die Datei in den Arbeitsbereich oder nutze die Schaltfläche. Du kannst auch mehrere auf einmal auswählen.

  2. Sprachen auswählen

    Kreuze die Sprachen des Dokuments an (Deutsch, Englisch, Französisch, Italienisch, Portugiesisch oder Spanisch) und wähle die Qualität. Beim ersten Mal lädt MovaDoc die Daten für die Texterkennung herunter: etwa 3 MB pro Sprache.

  3. Durchsuchbares PDF herunterladen

    Die Seiten sehen genauso aus wie vorher, mit dem erkannten Text unsichtbar darüber: Jetzt kannst du ihn durchsuchen und kopieren. Du kannst auch nur den Text herunterladen (.txt).

Häufige Fragen

Werden meine Dateien auf einen Server hochgeladen?

Nein. Die Texterkennung läuft in deinem Browser, mit der Tesseract-Engine. Beim ersten Mal lädt MovaDoc die Engine und die Sprachdaten (etwa 3 MB pro Sprache) von der eigenen Website herunter, sobald du das Tool zu nutzen beginnst (du tippst oder klickst darauf oder gelangst mit der Tastatur dorthin) und bevor eine Datei verarbeitet wird. Dein PDF verlässt nie dein Gerät.

Wie genau ist der erkannte Text?

Das hängt vom Scan ab. Klar und gerade gedruckter Text wird fast fehlerfrei erkannt; schiefe, unscharfe oder niedrig aufgelöste Scans führen zu mehr Fehlern. Handschrift wird nicht erkannt. Eine seitlich gescannte Seite muss zuerst gedreht werden (in „PDF organisieren“). Prüfe immer alles Wichtige.

Was ändert sich am PDF?

Das Aussehen bleibt gleich: Der erkannte Text wird unsichtbar über jede Seite gelegt, genau an die Stelle jedes Wortes. So kannst du den Text markieren, kopieren und durchsuchen. In Tabellen werden die Wörter durchsuchbar, aber kopierter Text verliert die Tabellenform.

Funktioniert das auch ohne Internet?

Ja, nach dem ersten Mal: Die Dateien für die Texterkennung bleiben im Browser gespeichert (in einem privaten Fenster nur, bis du es schließt). Beim ersten Mal (und wenn du eine andere Sprache oder Qualität wählst) brauchst du eine Internetverbindung, um sie herunterzuladen.

Welche Sprachen werden erkannt, und was bedeuten „Schnell“ und „Genau“?

Deutsch, Englisch, Französisch, Italienisch, Portugiesisch und Spanisch, auch gemischt im selben Dokument. „Schnell“ ist kompakter und reicht für klar gedruckten Text; „Genau“ erkennt kleine Schrift und schwache Scans besser, braucht aber länger. Am Computer dauert jede Seite einige Sekunden, auf dem Smartphone kann es deutlich länger dauern.