Anleitung
Text aus einer gescannten PDF-Datei extrahieren
Ein gescanntes PDF ist ein Bild von Text – Sie können ihn also nicht auswählen, durchsuchen, kopieren oder übersetzen. Das OCR-PDF-Tool von DocTranslating verwandelt ein gescanntes oder bildbasiertes PDF mit wenigen Klicks in eine echte, auswählbare Textschicht: Öffnen Sie das Tool, laden Sie Ihren Scan hoch, stellen Sie optional die Dokumentsprache für schnellere und genauere Ergebnisse ein und klicken Sie auf Text extrahieren. Es unterstützt 50+ Sprachen, handschriftlichen Text und von rechts nach links geschriebene Skripte wie Arabisch und Hebräisch. Sobald Sie das per OCR verarbeitete PDF zurückerhalten, können Sie es wie ein normales Dokument übersetzen, durchsuchen oder Text daraus kopieren.
Aktualisiert 19. Juni 2026 · 8 Min. Lesedauer
Wenn Sie versucht haben, Text in einem PDF auszuwählen, und nichts hervorgehoben wird, oder wenn Sie mit Strg+F gesucht und keine Ergebnisse erhalten haben, ist Ihr PDF gescannt – es ist ein Bild einer Seite, kein Text. Das ist auch der Grund, warum Übersetzen, Kopieren oder Bearbeiten nicht funktioniert. Die Lösung ist OCR (Optische Zeichenerkennung / Optical Character Recognition), die das Bild liest und darunter eine echte Textschicht aufbaut. Diese Anleitung zeigt, wie das mit dem OCR-PDF-Tool von DocTranslating funktioniert und was Sie mit dem Ergebnis tun können.
Woran erkenne ich, ob mein PDF gescannt ist?
Drei schnelle Prüfungen verraten Ihnen, ob ein PDF OCR benötigt:
- Versuchen Sie, eine Textzeile auszuwählen. Wenn Ihr Cursor keine einzelnen Wörter markieren kann – oder die gesamte Seite als ein einziges Bild auswählt –, ist es gescannt.
- Suchen Sie mit Strg+F (Cmd+F auf dem Mac). Wenn ein Wort, das Sie klar sehen können, keine Treffer liefert, gibt es keine durchsuchbare Textschicht.
- Achten Sie auf den Hinweis in der App. Wenn Sie eine gescannte Datei in DocTranslating öffnen, erscheint ein Banner mit dem Text „Dieses Dokument scheint gescannt zu sein…“ und der Schaltfläche OCR-PDF-Tool öffnen – die App hat erkannt, dass keine nutzbare Textschicht vorhanden ist.
Schritt für Schritt: Text aus einem gescannten PDF extrahieren
- 1
OCR-PDF-Tool öffnen
Gehen Sie direkt zum OCR-PDF-Tool oder klicken Sie – falls Sie bereits versucht haben, eine gescannte Datei zu übersetzen – beim Hinweis „Dieses Dokument scheint gescannt zu sein“ auf die Schaltfläche „OCR-PDF-Tool öffnen“. Beide Wege führen zum selben Tool.
- 2
Gescanntes PDF hochladen
Wählen Sie das gescannte oder bildbasierte PDF aus, das Sie umwandeln möchten. Das ist die Datei, in der Text derzeit weder ausgewählt noch durchsucht werden kann.
- 3
Optional Dokumentsprache festlegen
Wenn Sie die Sprache des Dokuments kennen, stellen Sie diese ein. Dies ist optional – das Tool erkennt die Sprache automatisch –, aber die Angabe sorgt für schnellere und genauere Ergebnisse, insbesondere bei nicht-lateinischen Schriften wie Arabisch, Chinesisch, Kyrillisch oder Devanagari sowie bei Handschriften.
- 4
Auf Text extrahieren klicken und Ergebnis herunterladen
Das Tool liest die Seiten und baut eine echte, auswählbare Textschicht auf, während das ursprüngliche Erscheinungsbild des Dokuments erhalten bleibt. Laden Sie das OCR-PDF herunter – Sie können den Text nun auswählen, durchsuchen und kopieren, und es ist bereit für die Übersetzung.
Was das OCR-PDF-Tool besonders gut beherrscht
Die OCR von DocTranslating gehört zu den leistungsfähigsten verfügbaren Engines und geht weit über einfaches gedrucktes Englisch hinaus:
- 50+ Sprachen — einschließlich Sprachen mit nicht-lateinischen Schriften.
- Handschriftlicher Text — deutliche Handschrift wird erkannt, nicht nur Druckschrift.
- Rechts-nach-links-Schriften (RTL) — Arabisch, Hebräisch und Persisch werden mit hoher Genauigkeit verarbeitet, einschließlich der korrekten Lesereihenfolge.
- Mehrsprachige Seiten — Dokumente, die mehr als eine Sprache auf einer Seite enthalten.
- Alltägliche Scanqualität — Fotos von Dokumenten und typische Büro-Scans, nicht nur makellose Flachbett-Ergebnisse.
Nach der OCR: Übersetzen Sie Ihr Dokument
Sobald Sie das per OCR verarbeitete PDF haben, entspricht das Übersetzen dem eines normalen PDFs — hochladen, Sprachen und Übersetzungs-Engine auswählen und die übersetzte Kopie herunterladen. Die OCR zuerst als separaten Schritt auszuführen, hat einen großen Vorteil: Sie können den extrahierten Text durchlesen und überprüfen, ob er korrekt ist, bevor Sie übersetzen. Wenn Sie einen unüberprüften Scan übersetzen, riskieren Sie die Vervielfachung von Fehlern — ein falsch gelesenes Wort wird zu einem selbstbewusst falsch übersetzten Wort. Die vorherige Prüfung der OCR-Ausgabe ist daher der beste Weg zu einer genauen Endübersetzung.
Tipps für beste OCR-Ergebnisse
Die OCR-Genauigkeit hängt stark von der Qualität des eingegebenen Scans ab. Ein paar Dinge verbessern die Ergebnisse spürbar:
- Stellen Sie die Dokumentsprache ein, wenn Sie sie kennen — das ist der einfachste Weg, Genauigkeit und Geschwindigkeit zu steigern.
- Verwenden Sie einen klaren, geraden Scan. Scannen Sie schiefe oder gedrehte Seiten erneut, damit der Text auf horizontalen Linien liegt.
- Bevorzugen Sie eine höhere Auflösung. Scans mit etwa 300 DPI oder höher bieten der OCR schärfere Zeichen als niedrige Auflösungen.
- Verbessern Sie den Kontrast bei verblassten Dokumenten, damit sich der Text deutlich vom Hintergrund abhebt.
- Stellen Sie sicher, dass die Datei nicht passwortgeschützt ist — verschlüsselte PDFs können nicht gelesen werden, bevor sie entsperrt sind.
Alternative: OCR auf PDFEquips
Wenn Sie bereits mit PDFEquips arbeiten — zum Beispiel zum Konvertieren, Komprimieren oder Zusammenfügen von PDFs —, steht Ihnen dort ebenfalls ein OCR-Tool zur Verfügung, um gescannte PDFs durchsuchbar zu machen. Beide Wege liefern eine OCR-verarbeitete Datei, die Sie anschließend zu DocTranslating bringen können. Nutzen Sie den Weg, der am besten zu Ihrem Workflow passt.
Häufig gestellte Fragen
Wie extrahiere ich Text aus einem gescannten PDF?
Öffnen Sie das OCR-PDF-Tool von DocTranslating, laden Sie Ihr gescanntes PDF hoch, stellen Sie optional die Dokumentsprache für schnellere und genauere Ergebnisse ein und klicken Sie auf Text extrahieren. Das Tool baut eine echte, auswählbare Textschicht auf, während das ursprüngliche Erscheinungsbild erhalten bleibt. Anschließend laden Sie das OCR-PDF herunter, das Sie auswählen, durchsuchen, kopieren und übersetzen können.
Woran erkenne ich, ob ein PDF gescannt ist oder echten Text enthält?
Versuchen Sie, eine Textzeile mit dem Cursor auszuwählen, oder durchsuchen Sie das Dokument mit Strg+F (Cmd+F auf dem Mac). Wenn Sie keine einzelnen Wörter markieren können oder ein klar sichtbares Wort kein Suchergebnis liefert, ist das PDF gescannt und benötigt OCR. In DocTranslating zeigt das Öffnen einer gescannten Datei außerdem den Hinweis „Dieses Dokument scheint gescannt zu sein…“ mit einer Schaltfläche zum Öffnen des OCR-PDF-Tools.
Kann das Tool auch handschriftlichen Text aus einem PDF extrahieren?
Ja. Das OCR-PDF-Tool erkennt neben Druckschrift auch handschriftlichen Text. Deutliche, gut lesbare Handschrift liefert die besten Ergebnisse; sehr unleserliche oder stark stilisierte Handschrift ist für jedes OCR-System eine Herausforderung, daher variieren die Ergebnisse mit der Lesbarkeit.
Funktioniert OCR auch für Arabisch, Hebräisch und andere Rechts-nach-links-Sprachen?
Ja. Das OCR-PDF-Tool unterstützt Rechts-nach-links-Schriften einschließlich Arabisch, Hebräisch und Persisch und rekonstruiert die korrekte Lesereihenfolge — genau den Teil, der bei gescannten RTL-Dokumenten normalerweise am schwierigsten ist. Dadurch wird der extrahierte Text für Suchen und Übersetzungen nutzbar, anstatt verdreht ausgegeben zu werden.
Wie viele Sprachen unterstützt das OCR-PDF-Tool?
50+ Sprachen, darunter viele mit nicht-lateinischen Schriften. Sie können die Sprache automatisch vom Tool erkennen lassen oder sie manuell festlegen — das Auswählen der Sprache ist besonders bei nicht-lateinischen und handschriftlichen Dokumenten hilfreich.
Muss ich OCR ausführen, bevor ich ein gescanntes PDF übersetze?
Das ist die empfohlene Vorgehensweise. Wenn Sie OCR als ersten, separaten Schritt ausführen, können Sie überprüfen, ob der extrahierte Text korrekt ist, bevor Sie übersetzen, damit sich Erkennungsfehler nicht in eine andere Sprache übertragen. Sobald Sie das OCR-PDF haben, übersetzen Sie es genau wie ein normales PDF.
Verändert OCR das Aussehen meines Dokuments?
Nein — das OCR-PDF-Tool behält das ursprüngliche Erscheinungsbild des Dokuments bei und fügt ihm eine auswählbare Textschicht hinzu. Ihr Scan sieht genauso aus wie vorher; der Unterschied ist, dass der Text nun ausgewählt, durchsucht, kopiert und übersetzt werden kann.
Warum übersetzen Google Übersetzer oder andere Tools mein gescanntes PDF nicht?
Die meisten Übersetzer lesen nur die vorhandene Textschicht eines PDFs — und ein gescanntes PDF besitzt keine, da es sich um ein Bild handelt. Deshalb liefern diese Tools eine leere Datei oder eine Fehlermeldung. Durch die vorherige Textextraktion mit OCR erhält das Dokument eine echte Textschicht und kann anschließend normal übersetzt werden.