Zum Inhalt springen
Mörsberger Tools
Bilder & Dateien

PDF-Suche funktioniert nicht: warum, und wie Sie einen Scan durchsuchbar machen

Wenn die Suche in einem PDF nichts findet, besteht die Datei fast immer aus Bildern statt aus Text, typisch für Scans und Faxe. Abhilfe schafft eine Texterkennung (OCR), die den Text aus dem Bild liest und als unsichtbare Ebene unter die Seite legt; danach finden Strg+F und die Dateisuche jedes erkannte Wort.

Zum Werkzeug: PDF durchsuchbar machen (OCR)Texterkennung für gescannte PDFs: unsichtbare Textebene, Deutsch und Englisch, auf Wunsch PDF/A-2b.

Ein Mietvertrag mit 23 Seiten, eingescannt im Copyshop. Sie suchen nach „Kaution“ und bekommen: keine Treffer. Dabei steht das Wort dreimal im Vertrag, Sie sehen es ja. Das PDF ist nicht kaputt. Es enthält nur keine Buchstaben, sondern Fotos von Buchstaben.

Warum die Suche in manchen PDFs nichts findet

Ein PDF kann zwei sehr verschiedene Dinge enthalten. Wer ein Dokument in Word schreibt und als PDF speichert, bekommt echten Text: Jedes Zeichen ist als Zeichen gespeichert, mit Schrift und Position. Ein Scanner dagegen fotografiert das Blatt. In der Datei liegt dann pro Seite ein Rasterbild, so wie bei einem Handyfoto. Für Sie sieht beides gleich aus. Für den Rechner ist das eine Text, das andere eine Fläche aus Bildpunkten.

Die Suchfunktion im PDF-Programm durchsucht nur echten Text. Dasselbe gilt für die Dateisuche von Windows und macOS, für Dokumentenablagen und für Upload-Portale, die den Inhalt auslesen. Ein reiner Scan ist für alle diese Programme leer.

Es gibt einen zweiten, selteneren Grund. Auch ein PDF mit echtem Text kann bei der Suche versagen, wenn die eingebettete Schrift keine Zuordnung von ihren Glyphen zu Unicode-Zeichen mitbringt. Die PDF-Norm ISO 32000-1 beschreibt in Abschnitt 9.10, welche Angaben ein Programm braucht, um aus einem PDF wieder Text zu gewinnen. Fehlen sie, sieht die Seite richtig aus, aber beim Kopieren entsteht Zeichensalat, und die Suche findet nichts. Das kommt bei manchen älteren Druckertreibern und Export-Programmen vor.

So erkennen Sie, ob ein PDF nur aus Bildern besteht

Drei Handgriffe genügen, und Sie brauchen dafür kein besonderes Programm:

TestEchter TextNur Bild (Scan)Text ohne Unicode-Zuordnung
Strg+F (Mac: Befehlstaste+F) nach einem sichtbaren WortTrefferkein Trefferkein Treffer oder falsche Stellen
Mit der Maus eine Zeile markiereneinzelne Wörter markierbarnur ein Rechteck über die ganze Seite oder gar nichtsmarkierbar
Markierten Text kopieren und in einen Editor einfügenlesbarer TextnichtsZeichensalat
Stark hineinzoomenBuchstaben bleiben scharfBuchstaben werden pixeligBuchstaben bleiben scharf

Bei Scans hilft eine Texterkennung. Bei Text ohne Unicode-Zuordnung hilft ein neuer Export aus dem Ursprungsprogramm. Geht das nicht, bleibt eine Texterkennung, die die Seite komplett neu rastert, bei OCRmyPDF etwa mit --force-ocr. Unser Werkzeug kann das nicht: Es überspringt jede Seite, die schon eine Textebene hat, auch eine unbrauchbare. Ein PDF, das teils aus Word-Seiten und teils aus Scans besteht, ist übrigens häufig. Dann finden Sie Treffer nur auf manchen Seiten.

PDF durchsuchbar machen mit Texterkennung (OCR)

OCR steht für „optical character recognition“, auf Deutsch Texterkennung. Das Programm sucht im Bild nach Zeilen, Wörtern und Buchstabenformen und rät daraus den Text. Die OCRmyPDF-Dokumentation sagt es so deutlich: OCR „rät“ den Text, der in Bildern steckt. Das Ergebnis wird als unsichtbare Textebene genau an die Stellen gelegt, an denen die Wörter im Bild stehen. Die Seite sieht danach aus wie vorher. Markieren Sie ein Wort, markieren Sie in Wahrheit den unsichtbaren Text darunter.

Unser Werkzeug PDF durchsuchbar machen arbeitet genau so, mit OCRmyPDF 17.13 und Tesseract 5.5. So gehen Sie vor:

  1. PDF in das Feld ziehen. Größe und Seitenzahl prüft schon Ihr Browser: erlaubt sind 25 MB und 80 Seiten.
  2. Sprache wählen: Deutsch, Englisch oder beides. Die Wahl zählt, denn laut OCRmyPDF-Dokumentation leidet das Ergebnis, wenn ein Dokument Sprachen enthält, die nicht angegeben sind.
  3. Ausgabe wählen: normales PDF oder PDF/A-2b.
  4. Auf „Hochladen und Text erkennen“ klicken. Erst dieser Klick schickt die Datei an unseren Server.
  5. Ergebnis herunterladen und den Bericht lesen. Er sagt, auf wie vielen Seiten die Erkennung lief, welche Seiten übersprungen wurden und wie viele Zeichen erkannt wurden. Den erkannten Text gibt es auf Wunsch zusätzlich als TXT-Datei.

Seiten, die schon echten Text haben, rührt das Werkzeug nicht an. Haben alle Seiten Text und wählen Sie als Ausgabe ein normales PDF, bekommen Sie die Datei unverändert zurück. Bei der Ausgabe als PDF/A wird sie in jedem Fall umgewandelt. Bei gemischten Dokumenten werden also nur die gescannten Seiten bearbeitet.

Beispiel: der gescannte Mietvertrag

Zurück zum Mietvertrag. 23 Seiten, Format A4. Wie lange dauert die Erkennung, und passt die Datei überhaupt durch?

Rechenzeit. Auf der Werkzeugseite steht ein gemessener Wert von etwa 0,6 bis 0,8 Sekunden je dicht beschriebener Seite. Mit 0,8 Sekunden gerechnet: 23 × 0,8 s = 18,4 s. Dazu kommen ein paar Sekunden für Hochladen und Verpacken. Nach gut 20 Sekunden ist der Vertrag durchsuchbar. Die Grenze von 80 Seiten ist weit weg.

Dateigröße. Interessanter ist die Größe. Eine A4-Seite misst 210 × 297 mm, das sind 8,27 × 11,69 Zoll. Bei 300 dpi ergibt das 2.480 × 3.508 = 8.699.840 Bildpunkte je Seite. Unkomprimiert braucht jeder Bildpunkt:

ScanmodusSpeicher je BildpunktEine Seite unkomprimiert23 Seiten unkomprimiert
Farbe (RGB)3 Byte26.099.520 Byte ≈ 24,9 MB≈ 573 MB
Graustufen1 Byte8.699.840 Byte ≈ 8,3 MB≈ 191 MB
Schwarzweiß1 Bit1.087.480 Byte ≈ 1,0 MB≈ 24 MB

(MB hier als 1.024 × 1.024 Byte, so wie das Werkzeug die 25-MB-Grenze rechnet.) In der Praxis komprimiert jeder Scanner die Bilder, die echte Datei ist deshalb viel kleiner. Die Tabelle zeigt aber, wo das Problem herkommt: Ein Farbscan von Textseiten ist ein Vielfaches größer als nötig. Für reine Textdokumente reichen Graustufen. Ist die fertige Datei trotzdem größer als 25 MB, teilen Sie sie vorher und lassen die Teile einzeln erkennen.

Wie gut die Texterkennung ist, entscheidet der Scan

Die OCRmyPDF-Dokumentation fasst es in einem Satz zusammen: Die Qualität der Ausgabe hängt von der Qualität der Eingabe ab. Was das konkret heißt, steht in der Tesseract-Dokumentation:

  • Auflösung: Tesseract arbeitet am besten mit Bildern von mindestens 300 dpi. Stellen Sie den Scanner so ein.
  • Schräglage: Ist die Seite zu schief, erkennt Tesseract die Zeilen deutlich schlechter. Unser Werkzeug hat dafür die Option „Geraderücken“.
  • Ränder: Dunkle Scanränder werden leicht als zusätzliche Zeichen gelesen.
  • Helle Schrift auf dunklem Grund: Tesseract ab Version 4 kommt mit dunkler Schrift auf hellem Grund besser zurecht.

Ein Test der Werkzeugseite vom 08.10.2026 zeigt, was ein sauberer Scan bringt: Ein einseitiger deutscher Brief mit 300 dpi ergab alle 89 Wörter des Originals, mit Umlauten und ß. Fotografieren Sie Dokumente mit dem Handy statt sie zu scannen, holen Sie mit Dokument scannen mehr heraus: Es erkennt die Blattkanten, zieht die Seite gerade und macht ein A4-PDF daraus.

Typische Fehler

  • Falsche Sprache gewählt: Wer ein deutsches Dokument mit „Englisch“ erkennen lässt, bekommt mehr Fehler bei Umlauten und ß. Bei gemischten Texten nehmen Sie „Beides“.
  • Kopfüber gescannte Seiten: Liegt eine Seite quer oder auf dem Kopf, entsteht oft Unsinn. Das Werkzeug dreht solche Seiten, wenn es die Lage sicher erkennt, und nennt im Bericht Seiten, deren Text kaum lesbar ist.
  • Erst signieren, dann erkennen: Digital signierte PDFs lehnt das Werkzeug ab, weil jede Änderung die Signatur ungültig machen würde. Lassen Sie die Texterkennung vor dem Signieren laufen.
  • Passwortschutz: Geschützte PDFs werden ebenfalls abgelehnt. Entfernen Sie den Schutz vorher, wenn Sie das Passwort kennen.
  • Kopierten Text ungeprüft übernehmen: Für die Suche reicht ein Wort, das richtig erkannt wurde. Wer den Text weiterverwendet, liest ihn gegen, vor allem Zahlen, Beträge und Namen.

Grenzen der Texterkennung

Die OCRmyPDF-Dokumentation zählt die Grenzen von Tesseract offen auf. Die wichtigsten für den Alltag:

  • Keine Handschrift. Tesseract kann sie nicht erkennen. Randnotizen und Unterschriften bleiben Bild.
  • Spalten: Tesseract kann die Lesereihenfolge falsch deuten und Text über zwei Spalten hinweg zu einer Zeile verbinden. Die Suche findet einzelne Wörter trotzdem, Wortgruppen über den Spaltenrand hinweg nicht unbedingt.
  • Keine Gliederung. Tesseract liefert nur Text und seine Position, keine Überschriften und Absätze. Das PDF wird durchsuchbar, aber nicht zu einem bearbeitbaren Dokument. Wer weiterschreiben will, wandelt das durchsuchbare PDF anschließend mit PDF in Word umwandeln um. Dieser Konverter hat selbst keine Texterkennung, deshalb muss die OCR vorher laufen.
  • Unsinn wird mitgeliefert. Laut Dokumentation kann Tesseract Zeichensalat erkennen und als Text ausgeben, etwa aus Stempeln, Logos oder Mustern.

Dazu kommen die Grenzen des Werkzeugs: 25 MB, 80 Seiten, 90 Sekunden Rechenzeit, zehn Aufträge pro Stunde. Die Verarbeitung läuft auf unserem Server in Deutschland, nicht im Browser. Dort liegt die Datei laut Werkzeugseite in einem abgeschotteten Container ohne Internetzugang, wird nur im Arbeitsspeicher verarbeitet und unmittelbar nach der Antwort gelöscht. Was dabei protokolliert wird, beschreiben die Werkzeugseite und die Datenschutzerklärung im Einzelnen.

Durchsuchbar und archivtauglich: OCR mit PDF/A

Wer Scans lange aufbewahren oder bei einem Portal einreichen will, das PDF/A verlangt, wählt im Werkzeug die Ausgabe „PDF/A-2b“. Das Ergebnis wird danach mit veraPDF geprüft, und der Bericht sagt, ob die Prüfung bestanden ist. PDF/A allein macht einen Scan nicht durchsuchbar, das leistet nur die Texterkennung. Was PDF/A ist und welche Version Sie brauchen, erklärt der Ratgeber PDF/A: Was ist das?.

Wer bereits Acrobat Pro hat, findet die Texterkennung dort laut Adobe unter „Scannen & OCR“ und „Text erkennen“. Das Prinzip ist dasselbe: Eine Textebene kommt unter das Bild, und die Suche findet danach, was die Erkennung gelesen hat.

Jetzt ausprobieren: PDF durchsuchbar machen (OCR)Kostenlos, ohne Anmeldung.

Häufige Fragen

Warum kann man in manchen PDFs nicht suchen?

Weil die Seiten keinen Text enthalten, sondern nur ein Bild davon. Das ist bei Scans, Faxen und Fotos von Dokumenten der Normalfall. Seltener steckt zwar Text in der Datei, aber die Schrift hat keine Zuordnung zu Unicode-Zeichen; dann findet die Suche ebenfalls nichts oder nur Zeichensalat.

Wie mache ich ein PDF kostenlos durchsuchbar?

Mit einer Texterkennung. Unser Werkzeug „PDF durchsuchbar machen“ ist kostenlos und ohne Anmeldung nutzbar, für PDFs bis 25 MB und 80 Seiten und zehn Aufträge pro Stunde. Es arbeitet mit OCRmyPDF und Tesseract und erkennt Deutsch, Englisch oder beides.

Geht das auch am Mac?

Ja. Unser Werkzeug läuft im Browser, also auch in Safari am Mac. Das Ergebnis durchsuchen Sie danach in Vorschau mit Befehlstaste+F wie jedes andere PDF.

Verändert die Texterkennung das Aussehen?

Nein. Der erkannte Text liegt unsichtbar unter dem Bild. Nur wenn Sie Geraderücken oder Drehen einschalten, werden schiefe oder quer liegende Seiten ausgerichtet.

Erkennt OCR auch Handschrift?

Tesseract nicht. Die OCRmyPDF-Dokumentation sagt ausdrücklich, dass die Software Handschrift nicht erkennen kann. Handschriftliche Notizen bleiben Bild, manchmal entstehen daraus ein paar sinnlose Zeichen.

Wird mein PDF dabei gespeichert?

Die Texterkennung läuft auf unserem Server in Deutschland, in einem abgeschotteten Container ohne Internetzugang. Laut Werkzeugseite wird die Datei nur im Arbeitsspeicher verarbeitet und unmittelbar nach der Antwort gelöscht. Was genau protokolliert wird, steht auf der Werkzeugseite und in der Datenschutzerklärung.

Quellen

↑ ↓ auswählenEnter öffnen