Zum Inhalt springen
Mörsberger Tools
Bilder & Dateien

PDF durchsuchbar machen (Texterkennung)

Legt über ein gescanntes PDF eine unsichtbare Textebene (Texterkennung mit Tesseract, Deutsch und Englisch), damit Sie darin suchen und Text kopieren können; Verarbeitung auf unserem Server in Deutschland, sofortige Löschung.

Von Marvin Mörsberger Zuletzt geprüft: 08.10.2026 Grundlage: OCRmyPDF 17.13, Dokumentation: Introduction und Limitations (abgerufen am 08.10.2026) Verarbeitung auf unserem Server in Deutschland

1. Gescanntes PDF auswählen

Höchstens 25 MB und 80 Seiten. Passwortgeschützte PDFs vorher entsperren.

PDF hierher ziehen oder antippenErst beim Klick auf „Hochladen und Text erkennen“ wird die Datei an unseren Server gesendet.
Sprache des Textes
Ausgabe

Normales PDF. Seiten mit vorhandenem Text bleiben unverändert.

Datenschutz: Die PDF wird über Cloudflare verschlüsselt an unseren Server in Deutschland gesendet, dort in einem abgeschotteten Container ohne Internetzugang verarbeitet und sofort nach der Auslieferung gelöscht. Ins Protokoll kommen nur Zeitpunkt, Pfad, Status, Größe und Dauer, keine IP-Adresse; für das Stundenlimit speichert der Dienst statt der IP nur einen daraus gebildeten Prüfwert, höchstens eine Stunde lang.

2. Ergebnis und Bericht

Wählen Sie ein PDF oder laden Sie den Beispiel-Scan.

PDF in zwei Schritten durchsuchbar machen

Ein Scanner liefert meist ein PDF, in dem jede Seite nur ein Foto ist. Sie sehen den Text, aber der Rechner sieht ein Bild: Die Suche findet nichts, und markieren lässt sich auch nichts. Die Texterkennung (OCR) liest die Buchstaben aus dem Bild und legt sie als unsichtbare Textebene genau unter die passenden Stellen.

Ziehen Sie das PDF in das Feld, wählen Sie die Sprache und klicken Sie auf „Hochladen und Text erkennen“. Erst dieser Klick schickt die Datei an unseren Server. Zurück kommen das durchsuchbare PDF und ein Bericht: wie viele Seiten erkannt wurden, welche übersprungen wurden, weil sie schon Text hatten, und wie viele Zeichen gefunden wurden. Auf Wunsch bekommen Sie den erkannten Text zusätzlich als TXT-Datei.

Ein Beispiel aus unserem Test vom 08.10.2026: Ein einseitiger deutscher Brief, mit 300 dpi gescannt, ergab alle 89 Wörter des Originals, Umlaute und ß eingeschlossen. Die Rechenzeit liegt bei etwa 0,6 bis 0,8 Sekunden je dicht beschriebener Seite; für 50 Seiten rechnen Sie also mit etwa 40 Sekunden. Mit „Beispiel laden“ sehen Sie den Ablauf an einem erzeugten Scan ohne Textebene.

Was Texterkennung kann und was nicht

Gearbeitet wird mit OCRmyPDF 17.13 und der Texterkennung Tesseract 5.5. Sie erkennt gedruckte Schrift in Briefen, Rechnungen, Verträgen und Büchern zuverlässig, wenn der Scan sauber ist. Wählen Sie die Sprache passend zum Text: Mit „Deutsch“ kennt Tesseract Umlaute und ß und die typischen deutschen Wortformen. „Beides“ hilft bei gemischten Dokumenten, etwa englischen Fachbegriffen in einem deutschen Gutachten.

Was Sie wissen sollten, bevor Sie sich auf die Textebene verlassen:

  • Seiten mit Text bleiben unberührt. Hat eine Seite schon echten Text, etwa weil das PDF aus Word stammt, wird sie übersprungen. Haben alle Seiten Text, bekommen Sie Ihre Datei unverändert zurück, Byte für Byte.
  • Spalten und Tabellen: Tesseract kann die Lesereihenfolge falsch deuten und zwei Spalten zu einer Zeile verbinden. Die Suche funktioniert trotzdem, kopierter Text braucht dann Nacharbeit.
  • Keine Gliederung: Die Textebene kennt keine Überschriften oder Absätze. Für ein bearbeitbares Dokument nutzen Sie danach PDF in Word umwandeln.
  • Formulare: Ausfüllbare Felder bleiben erhalten. Hat das PDF Formularfelder oder andere Anmerkungen, schaltet der Dienst das Geraderücken ab, weil es die Seite neu rastert und die Felder dabei verlieren würde; der Bericht sagt das. Er zählt außerdem die Felder auf den Seiten vorher und nachher und warnt, wenn die Zahl abweicht.

Durchsuchbar und archivfest (PDF/A)

Mit der Ausgabe „PDF/A-2b“ wird das Ergebnis zusätzlich in das Archivformat nach ISO 19005-2 gebracht und gleich danach mit veraPDF geprüft, dem Referenzprüfprogramm der PDF Association. Der Bericht zeigt, ob die Prüfung bestanden ist. Läuft das Prüfprogramm einmal nicht, steht dort „nicht geprüft“, nie „konform“. PDF/A lohnt sich für Unterlagen, die Sie lange aufbewahren oder bei Archiven und Ausschreibungsportalen einreichen. Ob eine Stelle PDF/A oder ein durchsuchbares PDF verlangt, steht in ihren Vorgaben. Ein PDF, das schon Text hat, wandeln Sie direkt mit PDF in PDF/A umwandeln um.

Handschrift und schlechte Scans

Handschrift erkennt Tesseract nicht. Das steht so auch in der Dokumentation von OCRmyPDF. Handschriftliche Randnotizen oder Unterschriften bleiben Bild; manchmal macht die Erkennung daraus ein paar sinnlose Zeichen. Findet sie auf einer Seite gar nichts, sagt der Bericht das.

Bei gedruckter Schrift entscheidet die Vorlage. Tesseract empfiehlt in seiner Dokumentation Scans mit mindestens 300 dpi. Handyfotos mit Schatten, starkem Schrägwinkel oder Unschärfe liefern schlechtere Treffer. Bessere Ausgangsbilder bekommen Sie mit Dokument scannen: Es erkennt die Blattkanten, zieht die Seite gerade und macht ein A4-PDF daraus, das Sie hier weiterverarbeiten. Leicht schiefe Seiten richtet die Option „Geraderücken“ aus. Quer oder kopfüber gescannte Seiten dreht die Option „Seiten automatisch drehen“, wenn Tesseract die Lage erkennt. Auf Seiten mit wenig Text klappt das nicht immer. Deshalb prüft der Dienst danach jede Seite: Ist der erkannte Text kaum lesbar oder fehlt er ganz, nennt der Bericht die Seitennummer, statt Erfolg zu melden. Solche Seiten drehen Sie mit PDF zusammenfügen & teilen aufrecht und starten die Texterkennung neu.

Grenzen

Erlaubt sind PDFs bis 25 MB und 80 Seiten. Die Texterkennung darf höchstens 90 Sekunden rechnen, und mehr als 80 dicht beschriebene Seiten passen nicht in diese Zeit. Größere Dateien teilen Sie vorher mit PDF zusammenfügen & teilen. Pro Stunde sind zehn Aufträge je Anschluss möglich. Passwortgeschützte PDFs lehnt der Dienst ab; entfernen Sie den Schutz vorher mit PDF-Passwort entfernen, wenn Sie das Passwort kennen. Digital signierte PDFs werden ebenfalls abgelehnt, weil jede Änderung die Signatur ungültig machen würde. Wird das Ergebnis zu groß für ein Upload-Portal, hilft PDF verkleinern.

Datenschutz

Anders als die meisten Werkzeuge auf dieser Seite läuft dieses nicht im Browser. Eine Texterkennung in dieser Qualität braucht Sprachmodelle und Rechenzeit, die ein Handy nicht verlässlich hergibt. Deshalb geht die Datei über Cloudflare verschlüsselt an unseren Server in Deutschland. Sie landet in einem abgeschotteten Container ohne Internetzugang, wird nur im Arbeitsspeicher verarbeitet und unmittelbar nach der Antwort gelöscht, zusammen mit dem erkannten Text. Was nach einem Abbruch übrig bleibt, räumt ein Kehrprozess weg, der alle 15 Minuten alles löscht, was älter als 30 Minuten ist.

Protokolliert wird an drei Stellen, alle ohne Inhalt, Dateiname, IP-Adresse, Kopfzeilen und Abfrage-Parameter. Der vorgeschaltete Webserver notiert je Anfrage Zeitpunkt, Methode, Pfad, Status, Größe und Dauer; diese Datei wird ab 20 MB gewechselt, die letzten fünf bleiben liegen. Kann er eine Anfrage nicht an den Dienst weiterreichen, schreibt er zusätzlich eine Fehlermeldung mit Zeitpunkt und Pfad in ein eigenes Fehlerprotokoll, das ab 10 MB gewechselt wird; auch davon bleiben die letzten fünf liegen. Der Dienst selbst notiert nur Werkzeug, Status, Größe und Dauer. Ihre IP-Adresse kommt über Cloudflare mit und dient allein dem Stundenlimit. Gespeichert wird dafür nicht die Adresse, sondern ein Prüfwert, den der Dienst mit einem geheimen Schlüssel daraus bildet (HMAC-SHA-256), zusammen mit den Zeitpunkten Ihrer Aufträge der letzten Stunde. Damit das Limit einen Neustart des Dienstes übersteht, liegt diese Liste in einer Datei auf dem Server, die nur der Dienst lesen kann. Zeitpunkte, die älter als eine Stunde sind, entfernt er beim nächsten Auftrag aus der Datei.

Häufige Fragen

Wie mache ich ein gescanntes PDF durchsuchbar?

Laden Sie das PDF hier hoch und klicken Sie auf „Hochladen und Text erkennen“. Die Texterkennung legt eine unsichtbare Textebene über jede Bildseite. Danach finden Sie Wörter mit Strg+F und können Text markieren und kopieren.

Erkennt das Werkzeug Handschrift?

Nein. Die Texterkennung Tesseract ist für gedruckte Schrift gebaut, Handschrift erkennt sie laut OCRmyPDF-Dokumentation nicht. Handschriftliche Notizen bleiben ein Bild.

Bleibt das Aussehen gleich?

Ja, der Text liegt unsichtbar unter dem Bild, die Seite sieht aus wie vorher. Nur wenn Sie „Geraderücken“ oder „Drehen“ eingeschaltet lassen, werden schiefe oder quer liegende Seiten ausgerichtet, sofern die Lage sicher erkannt wird. Seiten, die schon Text haben, bleiben unverändert.

Wo wird die Datei verarbeitet?

Auf unserem Server in Deutschland, in einem abgeschotteten Container ohne Internetzugang. Die Datei liegt dort nur im Arbeitsspeicher und wird direkt nach der Antwort gelöscht.

Wie groß darf das PDF sein?

Bis 25 MB und 80 Seiten. Mehr dicht beschriebene Seiten schafft die Texterkennung nicht sicher im Zeitlimit von 90 Sekunden. Teilen Sie größere PDFs vorher und laden Sie die Teile einzeln hoch.

Quellen

↑ ↓ auswählenEnter öffnen