Anleitung

Text aus einer gescannten PDF-Datei extrahieren

Extrahieren von auswählbarem Text aus einem gescannten PDF mittels OCR und anschließendes Übersetzen des Ergebnisses

Ein gescanntes PDF ist ein Bild von Text – Sie können ihn also nicht auswählen, durchsuchen, kopieren oder übersetzen. Das OCR-PDF-Tool von DocTranslating verwandelt ein gescanntes oder bildbasiertes PDF mit wenigen Klicks in eine echte, auswählbare Textschicht: Öffnen Sie das Tool, laden Sie Ihren Scan hoch, stellen Sie optional die Dokumentsprache für schnellere und genauere Ergebnisse ein und klicken Sie auf Text extrahieren. Es unterstützt 50+ Sprachen, handschriftlichen Text und von rechts nach links geschriebene Skripte wie Arabisch und Hebräisch. Sobald Sie das per OCR verarbeitete PDF zurückerhalten, können Sie es wie ein normales Dokument übersetzen, durchsuchen oder Text daraus kopieren.

Aktualisiert 19. Juni 2026 · 8 Min. Lesedauer

Wenn Sie versucht haben, Text in einem PDF auszuwählen, und nichts hervorgehoben wird, oder wenn Sie mit Strg+F gesucht und keine Ergebnisse erhalten haben, ist Ihr PDF gescannt – es ist ein Bild einer Seite, kein Text. Das ist auch der Grund, warum Übersetzen, Kopieren oder Bearbeiten nicht funktioniert. Die Lösung ist OCR (Optische Zeichenerkennung / Optical Character Recognition), die das Bild liest und darunter eine echte Textschicht aufbaut. Diese Anleitung zeigt, wie das mit dem OCR-PDF-Tool von DocTranslating funktioniert und was Sie mit dem Ergebnis tun können.

Woran erkenne ich, ob mein PDF gescannt ist?

Drei schnelle Prüfungen verraten Ihnen, ob ein PDF OCR benötigt:

Schritt für Schritt: Text aus einem gescannten PDF extrahieren

  1. 1

    OCR-PDF-Tool öffnen

    Gehen Sie direkt zum OCR-PDF-Tool oder klicken Sie – falls Sie bereits versucht haben, eine gescannte Datei zu übersetzen – beim Hinweis „Dieses Dokument scheint gescannt zu sein“ auf die Schaltfläche „OCR-PDF-Tool öffnen“. Beide Wege führen zum selben Tool.

  2. 2

    Gescanntes PDF hochladen

    Wählen Sie das gescannte oder bildbasierte PDF aus, das Sie umwandeln möchten. Das ist die Datei, in der Text derzeit weder ausgewählt noch durchsucht werden kann.

  3. 3

    Optional Dokumentsprache festlegen

    Wenn Sie die Sprache des Dokuments kennen, stellen Sie diese ein. Dies ist optional – das Tool erkennt die Sprache automatisch –, aber die Angabe sorgt für schnellere und genauere Ergebnisse, insbesondere bei nicht-lateinischen Schriften wie Arabisch, Chinesisch, Kyrillisch oder Devanagari sowie bei Handschriften.

  4. 4

    Auf Text extrahieren klicken und Ergebnis herunterladen

    Das Tool liest die Seiten und baut eine echte, auswählbare Textschicht auf, während das ursprüngliche Erscheinungsbild des Dokuments erhalten bleibt. Laden Sie das OCR-PDF herunter – Sie können den Text nun auswählen, durchsuchen und kopieren, und es ist bereit für die Übersetzung.

Was das OCR-PDF-Tool besonders gut beherrscht

Die OCR von DocTranslating gehört zu den leistungsfähigsten verfügbaren Engines und geht weit über einfaches gedrucktes Englisch hinaus:

Nach der OCR: Übersetzen Sie Ihr Dokument

Sobald Sie das per OCR verarbeitete PDF haben, entspricht das Übersetzen dem eines normalen PDFs — hochladen, Sprachen und Übersetzungs-Engine auswählen und die übersetzte Kopie herunterladen. Die OCR zuerst als separaten Schritt auszuführen, hat einen großen Vorteil: Sie können den extrahierten Text durchlesen und überprüfen, ob er korrekt ist, bevor Sie übersetzen. Wenn Sie einen unüberprüften Scan übersetzen, riskieren Sie die Vervielfachung von Fehlern — ein falsch gelesenes Wort wird zu einem selbstbewusst falsch übersetzten Wort. Die vorherige Prüfung der OCR-Ausgabe ist daher der beste Weg zu einer genauen Endübersetzung.

Tipps für beste OCR-Ergebnisse

Die OCR-Genauigkeit hängt stark von der Qualität des eingegebenen Scans ab. Ein paar Dinge verbessern die Ergebnisse spürbar:

Alternative: OCR auf PDFEquips

Wenn Sie bereits mit PDFEquips arbeiten — zum Beispiel zum Konvertieren, Komprimieren oder Zusammenfügen von PDFs —, steht Ihnen dort ebenfalls ein OCR-Tool zur Verfügung, um gescannte PDFs durchsuchbar zu machen. Beide Wege liefern eine OCR-verarbeitete Datei, die Sie anschließend zu DocTranslating bringen können. Nutzen Sie den Weg, der am besten zu Ihrem Workflow passt.

Häufig gestellte Fragen

Wie extrahiere ich Text aus einem gescannten PDF?

Öffnen Sie das OCR-PDF-Tool von DocTranslating, laden Sie Ihr gescanntes PDF hoch, stellen Sie optional die Dokumentsprache für schnellere und genauere Ergebnisse ein und klicken Sie auf Text extrahieren. Das Tool baut eine echte, auswählbare Textschicht auf, während das ursprüngliche Erscheinungsbild erhalten bleibt. Anschließend laden Sie das OCR-PDF herunter, das Sie auswählen, durchsuchen, kopieren und übersetzen können.

Woran erkenne ich, ob ein PDF gescannt ist oder echten Text enthält?

Versuchen Sie, eine Textzeile mit dem Cursor auszuwählen, oder durchsuchen Sie das Dokument mit Strg+F (Cmd+F auf dem Mac). Wenn Sie keine einzelnen Wörter markieren können oder ein klar sichtbares Wort kein Suchergebnis liefert, ist das PDF gescannt und benötigt OCR. In DocTranslating zeigt das Öffnen einer gescannten Datei außerdem den Hinweis „Dieses Dokument scheint gescannt zu sein…“ mit einer Schaltfläche zum Öffnen des OCR-PDF-Tools.

Kann das Tool auch handschriftlichen Text aus einem PDF extrahieren?

Ja. Das OCR-PDF-Tool erkennt neben Druckschrift auch handschriftlichen Text. Deutliche, gut lesbare Handschrift liefert die besten Ergebnisse; sehr unleserliche oder stark stilisierte Handschrift ist für jedes OCR-System eine Herausforderung, daher variieren die Ergebnisse mit der Lesbarkeit.

Funktioniert OCR auch für Arabisch, Hebräisch und andere Rechts-nach-links-Sprachen?

Ja. Das OCR-PDF-Tool unterstützt Rechts-nach-links-Schriften einschließlich Arabisch, Hebräisch und Persisch und rekonstruiert die korrekte Lesereihenfolge — genau den Teil, der bei gescannten RTL-Dokumenten normalerweise am schwierigsten ist. Dadurch wird der extrahierte Text für Suchen und Übersetzungen nutzbar, anstatt verdreht ausgegeben zu werden.

Wie viele Sprachen unterstützt das OCR-PDF-Tool?

50+ Sprachen, darunter viele mit nicht-lateinischen Schriften. Sie können die Sprache automatisch vom Tool erkennen lassen oder sie manuell festlegen — das Auswählen der Sprache ist besonders bei nicht-lateinischen und handschriftlichen Dokumenten hilfreich.

Muss ich OCR ausführen, bevor ich ein gescanntes PDF übersetze?

Das ist die empfohlene Vorgehensweise. Wenn Sie OCR als ersten, separaten Schritt ausführen, können Sie überprüfen, ob der extrahierte Text korrekt ist, bevor Sie übersetzen, damit sich Erkennungsfehler nicht in eine andere Sprache übertragen. Sobald Sie das OCR-PDF haben, übersetzen Sie es genau wie ein normales PDF.

Verändert OCR das Aussehen meines Dokuments?

Nein — das OCR-PDF-Tool behält das ursprüngliche Erscheinungsbild des Dokuments bei und fügt ihm eine auswählbare Textschicht hinzu. Ihr Scan sieht genauso aus wie vorher; der Unterschied ist, dass der Text nun ausgewählt, durchsucht, kopiert und übersetzt werden kann.

Warum übersetzen Google Übersetzer oder andere Tools mein gescanntes PDF nicht?

Die meisten Übersetzer lesen nur die vorhandene Textschicht eines PDFs — und ein gescanntes PDF besitzt keine, da es sich um ein Bild handelt. Deshalb liefern diese Tools eine leere Datei oder eine Fehlermeldung. Durch die vorherige Textextraktion mit OCR erhält das Dokument eine echte Textschicht und kann anschließend normal übersetzt werden.

How-to

Wie man eine gescannte PDF-Datei übersetzt

Gescannte PDFs sind Bilder von Text, kein echter Text – weshalb die meisten Übersetzungstools einschließlich Google Übersetzer sie entweder ablehnen, eine leere Datei zurückgeben oder den Fehler "Diese Datei kann nicht übersetzt werden" anzeigen. Um ein gescanntes PDF zu übersetzen, ist vor der Übersetzung eine Texterkennung (OCR) erforderlich. DocTranslating führt OCR automatisch als Teil des Übersetzungsprozesses aus, unterstützt über 100 Sprachen und baut den übersetzten Text wieder in eine exakte Kopie des Original-PDFs ein. Für maximale Genauigkeit bei wichtigen Dokumenten sollten Sie die OCR-Ausgabe zuerst auf PDFEquips überprüfen, damit sich Erkennungsfehler nicht mit Übersetzungsfehlern vermischen.

8 min read

Erste Schritte

So übersetzen Sie Dokumente, ohne die Formatierung zu verlieren

DocTranslating übersetzt PDF-, Word-, PowerPoint-, Excel-, Code- und Untertiteldateien in über 100 Sprachen und behält dabei das ursprüngliche Layout, Schriftarten, Tabellen und Bilder bei. Laden Sie eine Datei hoch, wählen Sie eine Sprache sowie eine von vier Übersetzungs-Engines (DeepL, Microsoft Azure, Google Cloud oder Gemini) aus und laden Sie eine übersetzte Kopie herunter, die wie das Original aussieht. Dieser Leitfaden behandelt den gesamten Prozess sowie Sonderfälle aus der Praxis – gescannte PDFs, Fußnoten und Textfelder, Konsistenz der Terminologie, Dateigrößenbeschränkungen und von rechts nach links geschriebene Sprachen (RTL).

11 min read

← Alle Anleitungen