Zum Inhalt springen

Gescanntes PDF in Text umwandeln

Bei einem Scan ist jede Seite ein Bild des Papiers: Es gibt keinen Text zum Kopieren. Die Texterkennung (OCR) liest die Buchstaben auf deinem Gerät und liefert dir den Text als .txt-Datei – dazu ein PDF, das du jetzt durchsuchen kannst.

Auf deinem Gerät verarbeitetNichts wird auf Server hochgeladen

Ein oder mehrere PDFs hierher ziehen

PDF-Dateien

Die Dateien werden auf deinem Gerät geöffnet und nie hochgeladen.

So funktioniert’s

  1. Scan auswählen

    Zieh das gescannte PDF (oder ein als PDF gespeichertes Foto eines Dokuments) in den Arbeitsbereich oder nutze die Schaltfläche.

  2. Sprache prüfen

    Die Sprache der Website ist schon ausgewählt; kreuze die weiteren Sprachen an, die im Dokument vorkommen. Beim ersten Mal lädt MovaDoc die Daten für die Texterkennung herunter: etwa 3 MB pro Sprache.

  3. Text herunterladen

    Du siehst den Anfang des erkannten Texts auf dem Bildschirm. Wähle „Text herunterladen (.txt)“, um den ganzen Text zu bekommen, oder lade das durchsuchbare PDF herunter.

Häufige Fragen

Warum kann ich den Text aus meinem PDF nicht kopieren?

Weil es ein Scan ist: Jede Seite ist ein Bild des Papiers, ohne gespeicherte Buchstaben, und dein PDF-Reader sieht nur ein Foto. Die Texterkennung (OCR) erkennt die Buchstaben auf diesem Bild und macht daraus Text, den du kopieren, bearbeiten und durchsuchen kannst.

Bleibt die Formatierung des Dokuments erhalten?

Nein. Die .txt-Datei enthält nur den Text, Zeile für Zeile, mit einer Leerzeile zwischen den Absätzen: ohne Schriftarten, Fettdruck, Bilder oder Tabellenraster. Für ein bearbeitbares Word-Dokument mit Überschriften, Listen und Tabellen verwende „PDF in Word“ – das Tool erkennt auch gescannte Seiten.

Funktioniert das auch mit Fotos von Dokumenten und mit Handschrift?

Mit Fotos, die als PDF gespeichert sind, ja – sofern sie scharf und gerade sind: Je besser das Bild, desto weniger Fehler. Ist das Foto eine JPG- oder PNG-Datei, mach daraus zuerst mit „Bilder in PDF“ ein PDF. Handschrift wird nicht erkannt: Die Erkennungsdaten sind nur für gedruckten Text gedacht.

Kann ich den Text aus mehreren PDFs auf einmal holen?

Ja, in zwei Schritten. Bei mehreren PDFs bekommst du ein ZIP mit den durchsuchbaren PDFs (ohne .txt-Dateien). Danach liefert dir „Weiter mit …“ → „PDF in Text“, das ebenfalls mehrere Dateien auf einmal verarbeitet, eine .txt-Datei pro PDF.

Wird das Dokument zum Auslesen irgendwohin gesendet?

Nein. Die Texterkennung läuft in deinem Browser, mit der Tesseract-Engine. Beim ersten Mal lädt MovaDoc die Engine und die Sprachdaten von der eigenen Website herunter; danach funktioniert sie sogar ohne Internet. Das PDF und der erkannte Text verlassen nie dein Gerät.