PDF in zwei Schritten durchsuchbar machen
Ein Scanner liefert meist ein PDF, in dem jede Seite nur ein Foto ist. Sie sehen den Text, aber der Rechner sieht ein Bild: Die Suche findet nichts, und markieren lässt sich auch nichts. Die Texterkennung (OCR) liest die Buchstaben aus dem Bild und legt sie als unsichtbare Textebene genau unter die passenden Stellen.
Ziehen Sie das PDF in das Feld, wählen Sie die Sprache und klicken Sie auf „Hochladen und Text erkennen“. Erst dieser Klick schickt die Datei an unseren Server. Zurück kommen das durchsuchbare PDF und ein Bericht: wie viele Seiten erkannt wurden, welche übersprungen wurden, weil sie schon Text hatten, und wie viele Zeichen gefunden wurden. Auf Wunsch bekommen Sie den erkannten Text zusätzlich als TXT-Datei.
Ein Beispiel aus unserem Test vom 08.10.2026: Ein einseitiger deutscher Brief, mit 300 dpi gescannt, ergab alle 89 Wörter des Originals, Umlaute und ß eingeschlossen. Die Rechenzeit liegt bei etwa 0,6 bis 0,8 Sekunden je dicht beschriebener Seite; für 50 Seiten rechnen Sie also mit etwa 40 Sekunden. Mit „Beispiel laden“ sehen Sie den Ablauf an einem erzeugten Scan ohne Textebene.
Was Texterkennung kann und was nicht
Gearbeitet wird mit OCRmyPDF 17.13 und der Texterkennung Tesseract 5.5. Sie erkennt gedruckte Schrift in Briefen, Rechnungen, Verträgen und Büchern zuverlässig, wenn der Scan sauber ist. Wählen Sie die Sprache passend zum Text: Mit „Deutsch“ kennt Tesseract Umlaute und ß und die typischen deutschen Wortformen. „Beides“ hilft bei gemischten Dokumenten, etwa englischen Fachbegriffen in einem deutschen Gutachten.
Was Sie wissen sollten, bevor Sie sich auf die Textebene verlassen:
- Seiten mit Text bleiben unberührt. Hat eine Seite schon echten Text, etwa weil das PDF aus Word stammt, wird sie übersprungen. Haben alle Seiten Text, bekommen Sie Ihre Datei unverändert zurück, Byte für Byte.
- Spalten und Tabellen: Tesseract kann die Lesereihenfolge falsch deuten und zwei Spalten zu einer Zeile verbinden. Die Suche funktioniert trotzdem, kopierter Text braucht dann Nacharbeit.
- Keine Gliederung: Die Textebene kennt keine Überschriften oder Absätze. Für ein bearbeitbares Dokument nutzen Sie danach PDF in Word umwandeln.
- Formulare: Ausfüllbare Felder bleiben erhalten. Hat das PDF Formularfelder oder andere Anmerkungen, schaltet der Dienst das Geraderücken ab, weil es die Seite neu rastert und die Felder dabei verlieren würde; der Bericht sagt das. Er zählt außerdem die Felder auf den Seiten vorher und nachher und warnt, wenn die Zahl abweicht.
Durchsuchbar und archivfest (PDF/A)
Mit der Ausgabe „PDF/A-2b“ wird das Ergebnis zusätzlich in das Archivformat nach ISO 19005-2 gebracht und gleich danach mit veraPDF geprüft, dem Referenzprüfprogramm der PDF Association. Der Bericht zeigt, ob die Prüfung bestanden ist. Läuft das Prüfprogramm einmal nicht, steht dort „nicht geprüft“, nie „konform“. PDF/A lohnt sich für Unterlagen, die Sie lange aufbewahren oder bei Archiven und Ausschreibungsportalen einreichen. Ob eine Stelle PDF/A oder ein durchsuchbares PDF verlangt, steht in ihren Vorgaben. Ein PDF, das schon Text hat, wandeln Sie direkt mit PDF in PDF/A umwandeln um.
Handschrift und schlechte Scans
Handschrift erkennt Tesseract nicht. Das steht so auch in der Dokumentation von OCRmyPDF. Handschriftliche Randnotizen oder Unterschriften bleiben Bild; manchmal macht die Erkennung daraus ein paar sinnlose Zeichen. Findet sie auf einer Seite gar nichts, sagt der Bericht das.
Bei gedruckter Schrift entscheidet die Vorlage. Tesseract empfiehlt in seiner Dokumentation Scans mit mindestens 300 dpi. Handyfotos mit Schatten, starkem Schrägwinkel oder Unschärfe liefern schlechtere Treffer. Bessere Ausgangsbilder bekommen Sie mit Dokument scannen: Es erkennt die Blattkanten, zieht die Seite gerade und macht ein A4-PDF daraus, das Sie hier weiterverarbeiten. Leicht schiefe Seiten richtet die Option „Geraderücken“ aus. Quer oder kopfüber gescannte Seiten dreht die Option „Seiten automatisch drehen“, wenn Tesseract die Lage erkennt. Auf Seiten mit wenig Text klappt das nicht immer. Deshalb prüft der Dienst danach jede Seite: Ist der erkannte Text kaum lesbar oder fehlt er ganz, nennt der Bericht die Seitennummer, statt Erfolg zu melden. Solche Seiten drehen Sie mit PDF zusammenfügen & teilen aufrecht und starten die Texterkennung neu.
Grenzen
Erlaubt sind PDFs bis 25 MB und 80 Seiten. Die Texterkennung darf höchstens 90 Sekunden rechnen, und mehr als 80 dicht beschriebene Seiten passen nicht in diese Zeit. Größere Dateien teilen Sie vorher mit PDF zusammenfügen & teilen. Pro Stunde sind zehn Aufträge je Anschluss möglich. Passwortgeschützte PDFs lehnt der Dienst ab; entfernen Sie den Schutz vorher mit PDF-Passwort entfernen, wenn Sie das Passwort kennen. Digital signierte PDFs werden ebenfalls abgelehnt, weil jede Änderung die Signatur ungültig machen würde. Wird das Ergebnis zu groß für ein Upload-Portal, hilft PDF verkleinern.
Datenschutz
Anders als die meisten Werkzeuge auf dieser Seite läuft dieses nicht im Browser. Eine Texterkennung in dieser Qualität braucht Sprachmodelle und Rechenzeit, die ein Handy nicht verlässlich hergibt. Deshalb geht die Datei über Cloudflare verschlüsselt an unseren Server in Deutschland. Sie landet in einem abgeschotteten Container ohne Internetzugang, wird nur im Arbeitsspeicher verarbeitet und unmittelbar nach der Antwort gelöscht, zusammen mit dem erkannten Text. Was nach einem Abbruch übrig bleibt, räumt ein Kehrprozess weg, der alle 15 Minuten alles löscht, was älter als 30 Minuten ist.
Protokolliert wird an drei Stellen, alle ohne Inhalt, Dateiname, IP-Adresse, Kopfzeilen und Abfrage-Parameter. Der vorgeschaltete Webserver notiert je Anfrage Zeitpunkt, Methode, Pfad, Status, Größe und Dauer; diese Datei wird ab 20 MB gewechselt, die letzten fünf bleiben liegen. Kann er eine Anfrage nicht an den Dienst weiterreichen, schreibt er zusätzlich eine Fehlermeldung mit Zeitpunkt und Pfad in ein eigenes Fehlerprotokoll, das ab 10 MB gewechselt wird; auch davon bleiben die letzten fünf liegen. Der Dienst selbst notiert nur Werkzeug, Status, Größe und Dauer. Ihre IP-Adresse kommt über Cloudflare mit und dient allein dem Stundenlimit. Gespeichert wird dafür nicht die Adresse, sondern ein Prüfwert, den der Dienst mit einem geheimen Schlüssel daraus bildet (HMAC-SHA-256), zusammen mit den Zeitpunkten Ihrer Aufträge der letzten Stunde. Damit das Limit einen Neustart des Dienstes übersteht, liegt diese Liste in einer Datei auf dem Server, die nur der Dienst lesen kann. Zeitpunkte, die älter als eine Stunde sind, entfernt er beim nächsten Auftrag aus der Datei.