Wie wendet man OCR auf ein gescanntes PDF an? Schritt-für-Schritt-Anleitung
6 Min. Lesezeit
Sie haben ein PDF, das von einem Scanner oder einer Handykamera stammt, und versuchen, den Text darin zu kopieren, aber nichts lässt sich auswählen. Bei der Suche mit Strg+F erhalten Sie null Ergebnisse. Das ist eines der häufigsten PDF-Probleme, denn ein gescanntes Dokument ist eigentlich kein Text, sondern ein Bild. Auch wenn jeder Buchstabe auf der Seite für Sie lesbar ist, besteht er für den Computer nur aus Pixeln.
OCR (Optical Character Recognition — optische Zeichenerkennung) ist der Vorgang, der das Dokument "zum Leben erweckt", indem er eine unsichtbare, aber auswählbare Textebene über diese Bilder legt. In dieser Anleitung erkläre ich Schritt für Schritt, wie Sie ein gescanntes PDF durchsuchbar und kopierbar machen, worauf Sie bei deutschen Texten achten müssen und welche Fehler am häufigsten gemacht werden.
Was bringt OCR einem gescannten PDF?
Klären wir zunächst, was Sie erhalten, denn zu wissen, was OCR tut und was nicht, stellt Ihre Erwartungen richtig ein:
- Suchfähigkeit: Sie können mit Strg+F nach Wörtern im Dokument suchen.
- Kopieren-Einfügen: Sie können den Text auswählen und in eine andere Datei übertragen.
- Kompatibilität mit Bildschirmlesern: Die Barrierefreiheit für sehbehinderte Nutzer wird erhöht.
- Die Dateigröße bleibt meist nahezu gleich: Es wird nur eine unsichtbare Textebene hinzugefügt, das Bild bleibt unverändert.
OCR ändert das Erscheinungsbild des Dokuments nicht. Die Seite sieht weiterhin wie ein Scan aus; es wird nur Textdaten dahinter platziert. Erwarten Sie also kein "sauberes, neu geschriebenes PDF" — optisch sehen Sie exakt den ursprünglichen Scan, den Unterschied spüren Sie nur daran, dass Sie den Text auswählen können.
Schritt für Schritt: Einem gescannten PDF eine Textebene hinzufügen
1. Schritt: Bereiten Sie Ihre Datei vor
Überprüfen Sie vor Beginn der OCR die Qualität Ihres Scans. Wenn Ihre Datei in sehr niedriger Auflösung (zum Beispiel unter 100 DPI) oder schräg/unscharf gescannt wurde, wird auch der resultierende Text entsprechend fehlerhaft. Wenn möglich:
- Scannen Sie die Seiten gerade und ohne Schatten.
- Scannen Sie im Bereich von 200-300 DPI (der Standardwert der meisten Bürodrucker liegt bereits in diesem Bereich).
- Wenn Sie mit dem Handy fotografiert haben, stellen Sie sicher, dass alle vier Ränder des Dokuments klar sichtbar sind.
2. Schritt: Laden Sie die Datei in das OCR-Tool hoch
Ziehen Sie Ihre PDF-Datei per Drag & Drop oder laden Sie sie über den Dateiauswahldialog hoch. Der Upload-Vorgang findet vollständig im Browser statt; Ihre Datei bleibt während der Verarbeitung auf Ihrem Gerät, ohne an einen Server gesendet zu werden. Dies ist besonders bei sensiblen Dokumenten wie Verträgen, Rechnungen oder Ausweisdokumenten ein wichtiges Detail.
3. Schritt: Überprüfen Sie die Sprachauswahl
Die OCR-Engine muss wissen, in welcher Sprache sie nach Zeichen suchen soll. Wenn Ihr Dokument auf Deutsch ist, stellen Sie sicher, dass die Spracheinstellung auf Deutsch gesetzt ist. Überspringen Sie diesen Schritt, können für die deutsche Sprache typische Zeichen wie "ä", "ö", "ü", "ß" falsch oder gar nicht erkannt werden — zum Beispiel kann das Wort "Änderung" als "Anderung" oder als bedeutungslose Zeichenfolge erscheinen. Wenn Ihr Dokument mehrere Sprachen enthält (zum Beispiel ein gemischt deutsch-englischer Bericht), verbessert die entsprechende Angabe das Ergebnis deutlich.
4. Schritt: Starten Sie den Vorgang und warten Sie
Je nach Seitenzahl und Scanqualität kann der Vorgang von wenigen Sekunden bis zu mehreren Minuten dauern. Haben Sie bei umfangreichen Dateien Geduld; jede Seite wird einzeln analysiert und die Textebene wird speziell für diese Seite platziert.
5. Schritt: Laden Sie das Ergebnis herunter und testen Sie es
Wenn der Vorgang abgeschlossen ist, laden Sie Ihre Datei herunter und führen Sie sofort eine Kontrolle durch: Suchen Sie in Ihrem PDF-Viewer mit Strg+F nach einem Wort, von dem Sie wissen, dass es im Dokument vorkommt. Wird es gefunden, war die OCR erfolgreich. Versuchen Sie anschließend, ein paar Sätze auszuwählen und zu kopieren, um zu sehen, ob der Text korrekt ausgegeben wird.
Praktische Tipps für ein korrektes Ergebnis
- Schräg gescannte Seiten verursachen Probleme. Wenn das Dokument beim Scannen um einige Grad schräg lag, hat die OCR-Engine Schwierigkeiten, den Zeilen zu folgen. Korrigieren Sie nach Möglichkeit den Scan und versuchen Sie es erneut.
- Dokumente mit geringem Kontrast sind herausfordernd. Alte Dokumente mit verblasster Tinte oder graue Fotokopien führen zu mehr Erkennungsfehlern als klare Schwarz-Weiß-Scans.
- Handschrift ist die Grenze von OCR. OCR-Technologie ist in erster Linie für gedruckten Text konzipiert; bei Handschrift kann es schwierig sein, ein konsistentes Ergebnis zu erzielen.
- Achten Sie bei mehrsprachigen Dokumenten auf die Sprachauswahl. Wenn ein deutscher Vertrag englische Klauseltitel enthält, kann die alleinige Auswahl von Deutsch dazu führen, dass diese Abschnitte falsch erkannt werden.
- Bei Tabellen und mehrspaltigen Seiten kann die Textreihenfolge durcheinandergeraten. OCR versucht, das Seitenlayout zu interpretieren, aber bei komplexen, zeitungsartigen Spalten kann die Wortreihenfolge anders ausfallen als erwartet; in diesem Fall müssen Sie den kopierten Text möglicherweise manuell nachbearbeiten.
Häufige Fehler
Fehler 1: Die Spracheinstellung auf dem Standardwert belassen. Dies ist das am häufigsten auftretende Problem. Den Vorgang bei einem deutschen Dokument zu starten, ohne die Spracheinstellung zu überprüfen, führt besonders bei deutschen Sonderzeichen zu fehlerhaften Ergebnissen.
Fehler 2: Erneutes Anwenden von OCR auf ein bereits durchsuchbares PDF. Manche PDFs wirken zwar gescannt, verfügen aber bereits über eine Textebene. Ohne vorherige Überprüfung mit Strg+F direkt OCR anzuwenden ist ein unnötiger Schritt — er schadet nicht, kostet aber Zeit.
Fehler 3: Einen minderwertigen Scan ohne Verbesserung verarbeiten. Von einer unscharfen oder sehr klein gescannten Seite ein perfektes Ergebnis zu erwarten, ist unrealistisch. Die Verbesserung der Quelle wirkt sich direkt auf das OCR-Ergebnis aus.
Fehler 4: Das Ergebnis ohne Kontrolle verwenden. OCR-Ergebnisse sind nicht zu 100 % fehlerfrei; besonders bei Eigennamen, Zahlen und Fremdwörtern können kleine Fehler auftreten. Wenn Sie das Dokument für einen offiziellen Vorgang verwenden (zum Beispiel Archivierung oder rechtliche Referenz), überprüfen Sie zumindest die kritischen Abschnitte.
Wann ist OCR nötig, wann nicht?
Wenn Ihr PDF direkt aus einer Textverarbeitung (Word, Google Docs usw.) mit "Als PDF speichern" erstellt wurde, verfügt es höchstwahrscheinlich bereits über eine Textebene und benötigt keine OCR. Die Fälle, in denen Sie OCR wirklich benötigen, sind:
- Papierdokumente, die über einen Desktop-Scanner gelaufen sind
- Mit der Handykamera fotografierte und in PDF umgewandelte Seiten
- Digitalisierte Versionen alter Archivdokumente
- Per Fax eingegangene und in PDF umgewandelte Dateien
Das gemeinsame Merkmal dieser Dokumente ist, dass der Inhalt wie eine Bilddatei in das PDF eingebettet ist. Sie können Zeit sparen, indem Sie vor der Anwendung von OCR schnell einen Strg+F-Test durchführen.
Fazit
Ein gescanntes PDF durchsuchbar zu machen ist ein einfacherer Vorgang, als es scheint: die richtige Spracheinstellung zu wählen und eine Quelle mit angemessener Qualität bereitzustellen, bestimmt den Großteil des Ergebnisses. Machen Sie es sich nach Abschluss des Vorgangs zur Gewohnheit, unbedingt einen Suchtest durchzuführen, um zu überprüfen, ob der Text korrekt erkannt wurde. So können Sie sowohl Dokumente in Ihrem Archiv leicht finden als auch deren Inhalte in andere Dokumente übertragen.
Häufig gestellte Fragen
Ändert sich das Erscheinungsbild des PDFs nach der Anwendung von OCR?
Nein. OCR ändert das visuelle Erscheinungsbild der Seite nicht; das gescannte Bild bleibt unverändert. Der Vorgang fügt lediglich eine unsichtbare Textebene hinter dem Bild hinzu, sodass Sie den Text durchsuchen und kopieren können.
Verursachen deutsche Sonderzeichen (ä, ö, ü, ß) während der OCR Probleme?
Wenn die Spracheinstellung nicht auf Deutsch gesetzt ist, ja, es können Probleme auftreten. Bei korrekt gewählter Sprache werden diese Zeichen größtenteils richtig erkannt; dennoch können bei minderwertigen Scans kleine Fehler auftreten, weshalb eine Überprüfung des Ergebnisses sinnvoll ist.
Kann ich ein handschriftlich ausgefülltes Formular mit OCR durchsuchbar machen?
OCR-Technologie ist in erster Linie für gedruckten Text optimiert. Bei Handschrift, besonders bei unregelmäßiger oder verbundener Schrift, sinkt die Erkennungsgenauigkeit deutlich, und ein konsistentes Ergebnis zu erzielen kann schwierig sein.
Probieren Sie es gleich mit OCR (Taranmış PDF) aus.
OCR (Taranmış PDF) ausprobieren