गाइड

स्कैन किए गए PDF से टेक्स्ट कैसे निकालें (Extract)

OCR का उपयोग करके स्कैन किए गए PDF से सेलेक्ट योग्य टेक्स्ट निकालना और फिर परिणाम का अनुवाद करना

स्कैन किया गया PDF दरअसल एक इमेज होता है, इसलिए आप इसके टेक्स्ट को सेलेक्ट, सर्च, कॉपी या अनुवाद नहीं कर सकते। DocTranslating का OCR PDF टूल स्कैन किए गए या इमेज-आधारित PDF को कुछ ही क्लिक में एक असली, सेलेक्ट करने योग्य टेक्स्ट लेयर में बदल देता है: टूल खोलें, अपना स्कैन अपलोड करें, तेज़ और अधिक सटीक परिणामों के लिए यदि चाहें तो दस्तावेज़ की भाषा चुनें, और 'टेक्स्ट निकालें' पर क्लिक करें। यह 50+ भाषाओं, हाथ से लिखे गए टेक्स्ट (handwriting) और अरबी व हिब्रू जैसी दाएँ-से-बाएँ (RTL) लिखी जाने वाली भाषाओं का समर्थन करता है। एक बार जब आपको OCR-प्रोसेस किया गया PDF मिल जाता है, तो आप इसे किसी भी सामान्य दस्तावेज़ की तरह अनुवाद कर सकते हैं, सर्च कर सकते हैं या टेक्स्ट कॉपी कर सकते हैं।

अपडेट किया गया 19 जून 2026 · 8 मिनट पढ़ने का समय

यदि आपने किसी PDF में टेक्स्ट को सेलेक्ट करने का प्रयास किया है और कुछ भी हाईलाइट नहीं होता है, या Ctrl+F से सर्च करने पर कोई परिणाम नहीं मिलता है, तो आपका PDF स्कैन किया गया है — यह एक पेज की इमेज है, टेक्स्ट नहीं। यही कारण है कि इसका अनुवाद करना, कॉपी करना या एडिट करना काम नहीं करता। इसका समाधान OCR (ऑप्टिकल कैरेक्टर रिकग्निशन) तकनीक है, जो इमेज को पढ़ती है और उसके नीचे एक असली टेक्स्ट लेयर बनाती है। यह गाइड बताता है कि DocTranslating के OCR PDF टूल का उपयोग करके ऐसा कैसे करें और प्राप्त परिणाम के साथ क्या करें।

मुझे कैसे पता चलेगा कि मेरा PDF स्कैन किया गया है?

तीन त्वरित परीक्षण आपको बताएंगे कि क्या PDF को OCR की आवश्यकता है:

चरण-दर-चरण: स्कैन किए गए PDF से टेक्स्ट कैसे निकालें

  1. 1

    OCR PDF टूल खोलें

    सीधे OCR PDF टूल पर जाएँ, या — यदि आप पहले से ही किसी स्कैन की गई फाइल का अनुवाद करने का प्रयास कर रहे थे — नोटिफिकेशन में दिए गए "OCR PDF टूल खोलें" बटन पर क्लिक करें। दोनों रास्ते एक ही टूल पर ले जाते हैं।

  2. 2

    अपना स्कैन किया गया PDF अपलोड करें

    वह स्कैन किया गया या इमेज-आधारित PDF चुनें जिसे आप बदलना चाहते हैं। यह वह फाइल है जिसका टेक्स्ट वर्तमान में सेलेक्ट या सर्च नहीं किया जा सकता है।

  3. 3

    दस्तावेज़ की भाषा चुनें (वैकल्पिक)

    यदि आप दस्तावेज़ की भाषा जानते हैं, तो उसे चुनें। यह वैकल्पिक है — टूल स्वचालित रूप से भाषा की पहचान कर लेता है — लेकिन इसे सेट करने से तेज़ और अधिक सटीक परिणाम मिलते हैं, विशेष रूप से अरबी, चीनी, सिरिलिक या देवनागरी जैसी गैर-लैटिन लिपियों और हस्तलिखित टेक्स्ट के लिए।

  4. 4

    टेक्स्ट निकालें (Extract Text) पर क्लिक करें और परिणाम डाउनलोड करें

    टूल पेजों को पढ़ता है और दस्तावेज़ के मूल स्वरूप को बनाए रखते हुए एक असली, सेलेक्ट करने योग्य टेक्स्ट लेयर तैयार करता है। OCR किया गया PDF डाउनलोड करें — अब आप इसके टेक्स्ट को सेलेक्ट, सर्च और कॉपी कर सकते हैं, और यह अनुवाद के लिए तैयार है।

OCR PDF टूल किन मामलों में बेहतरीन काम करता है

DocTranslating का OCR इंजन सबसे सक्षम इंजनों में से एक है और यह साधारण प्रिंटेड अंग्रेजी टेक्स्ट से कहीं आगे काम करता है:

OCR के बाद: अपने दस्तावेज़ का अनुवाद करें

एक बार जब आपके पास OCR-प्रोसेस किया गया PDF आ जाता है, तो इसका अनुवाद करना किसी भी सामान्य PDF का अनुवाद करने जैसा ही है — इसे अपलोड करें, अपनी भाषाएँ और ट्रांसलेशन इंजन चुनें, और अनूदित कॉपी डाउनलोड करें। पहले एक अलग चरण के रूप में OCR चलाने का एक बड़ा लाभ है: आप अनुवाद करने से पहले निकले हुए टेक्स्ट को पढ़कर यह पुष्टि कर सकते हैं कि यह सही है। बिना जांचे गए स्कैन का अनुवाद करने से दो तरह की त्रुटियाँ होने का जोखिम रहता है — एक गलत पढ़ा गया शब्द अनुवाद में आत्मविश्वास से भरी एक गलत शब्द बन जाता है — इसलिए पहले OCR आउटपुट की जांच करना सटीक अंतिम अनुवाद प्राप्त करने का सबसे अच्छा तरीका है।

सर्वोत्तम OCR परिणाम प्राप्त करने के लिए युक्तियाँ

OCR की सटीकता काफी हद तक इनपुट स्कैन की गुणवत्ता पर निर्भर करती है। कुछ बातें परिणामों को काफी बेहतर बनाती हैं:

विकल्प: PDFEquips पर OCR

यदि आप पहले से ही PDFEquips के भीतर काम कर रहे हैं — उदाहरण के लिए PDF को कनवर्ट, कंप्रेस या मर्ज करने के लिए — तो इसमें एक OCR टूल भी शामिल है जिसका उपयोग आप स्कैन किए गए PDF को सर्च योग्य बनाने के लिए कर सकते हैं। दोनों में से कोई भी तरीका आपको एक OCR-प्रोसेस फाइल देगा जिसे आप अनुवाद के लिए DocTranslating पर ला सकते हैं। वही तरीका उपयोग करें जो आपके काम के प्रवाह के अनुकूल हो।

अक्सर पूछे जाने वाले प्रश्न

मैं स्कैन किए गए PDF से टेक्स्ट कैसे निकालूँ?

DocTranslating का OCR PDF टूल खोलें, अपना स्कैन किया गया PDF अपलोड करें, तेज़ और अधिक सटीक परिणामों के लिए यदि चाहें तो दस्तावेज़ की भाषा चुनें, और 'टेक्स्ट निकालें' पर क्लिक करें। यह टूल दस्तावेज़ के मूल स्वरूप को बनाए रखते हुए एक असली, सेलेक्ट करने योग्य टेक्स्ट लेयर तैयार करता है, और आप एक OCR किया गया PDF डाउनलोड कर सकते हैं जिसे आप सेलेक्ट, सर्च, कॉपी और अनुवाद कर सकते हैं।

मुझे कैसे पता चलेगा कि कोई PDF स्कैन किया गया है या उसमें असली टेक्स्ट है?

अपने कर्सर से टेक्स्ट की एक पंक्ति को सेलेक्ट करने का प्रयास करें, या Ctrl+F (Mac पर Cmd+F) के साथ दस्तावेज़ में खोजें। यदि आप अलग-अलग शब्दों को हाईलाइट नहीं कर सकते हैं, या स्पष्ट रूप से दिखाई देने वाला शब्द सर्च में नहीं आता है, तो PDF स्कैन किया गया है और इसके लिए OCR की आवश्यकता है। DocTranslating में, एक स्कैन की गई फाइल खोलने पर "ऐसा लगता है कि यह दस्तावेज़ स्कैन किया गया है…" नोटिफिकेशन के साथ OCR टूल खोलने का बटन भी दिखाई देता है।

क्या यह PDF से हाथ से लिखे गए टेक्स्ट (Handwriting) को निकाल सकता है?

हाँ। OCR PDF टूल प्रिंटेड टेक्स्ट के अलावा हस्तलिखित टेक्स्ट को भी पहचानता है। साफ-सुथरी और पढ़ने योग्य लिखावट सबसे अच्छे परिणाम देती है; जबकि बहुत खराब या स्टाइल वाली लिखावट किसी भी OCR सिस्टम के लिए एक चुनौती होती है, इसलिए परिणाम पढ़ने योग्यता के आधार पर भिन्न हो सकते हैं।

क्या OCR अरबी, हिब्रू और दाएँ-से-बाएँ लिखी जाने वाली अन्य भाषाओं के लिए काम करता है?

हाँ। OCR PDF टूल अरबी, हिब्रू और फ़ारसी सहित दाएँ-से-बाएँ (RTL) लिखी जाने वाली लिपियों का समर्थन करता है और सही पढ़ने के क्रम को फिर से व्यवस्थित करता है — जो आमतौर पर स्कैन किए गए RTL दस्तावेज़ों में सबसे कठिन हिस्सा होता है। यह निकाले गए टेक्स्ट को उल्टा-पुल्टा होने के बजाय सर्च और अनुवाद के लिए वास्तव में उपयोगी बनाता है।

OCR PDF टूल कितनी भाषाओं का समर्थन करता है?

50+ भाषाएँ, जिनमें गैर-लैटिन लिपियों वाली कई भाषाएँ शामिल हैं। आप टूल को स्वचालित रूप से भाषा की पहचान करने दे सकते हैं, या तेज़ और अधिक सटीक निष्कर्षण के लिए इसे मैन्युअल रूप से सेट कर सकते हैं — भाषा चुनना विशेष रूप से गैर-लैटिन और हस्तलिखित दस्तावेज़ों के लिए सहायक होता है।

क्या मुझे स्कैन किए गए PDF का अनुवाद करने से पहले OCR चलाना होगा?

यह अनुशंसित तरीका है। पहले एक अलग चरण के रूप में OCR चलाने से आप अनुवाद करने से पहले निकाले गए टेक्स्ट की जांच कर सकते हैं, ताकि पहचान संबंधी गलतियाँ दूसरी भाषा में न जाएँ। एक बार जब आपके पास OCR किया गया PDF आ जाता है, तो आप इसका किसी भी सामान्य PDF की तरह अनुवाद कर सकते हैं।

क्या OCR मेरे दस्तावेज़ का लुक बदल देगा?

नहीं — OCR PDF टूल दस्तावेज़ के मूल स्वरूप को बनाए रखता है और इसमें एक सेलेक्ट करने योग्य टेक्स्ट लेयर जोड़ता है। आपका स्कैन किया गया फाइल दिखने में पहले जैसा ही रहेगा; एकमात्र अंतर यह है कि अब इसके टेक्स्ट को सेलेक्ट, सर्च, कॉपी और अनुवाद किया जा सकता है।

गूगल ट्रांसलेट या अन्य टूल मेरे स्कैन किए गए PDF का अनुवाद क्यों नहीं करते?

अधिकांश अनुवादक केवल PDF की मौजूदा टेक्स्ट लेयर को पढ़ते हैं, और स्कैन किए गए PDF में ऐसी कोई लेयर नहीं होती — यह केवल एक इमेज होती है। इसीलिए वे एक खाली फाइल या एरर मैसेज देते हैं। पहले OCR के साथ टेक्स्ट निकालने से दस्तावेज़ को एक असली टेक्स्ट लेयर मिल जाती है, जिसके बाद इसे सामान्य रूप से अनूदित किया जा सकता है।

How-to

स्कैन की गई PDF फाइल का अनुवाद कैसे करें

स्कैन की गई PDF टेक्स्ट की इमेज होती हैं, वास्तविक टेक्स्ट नहीं — यही कारण है कि Google Translate सहित अधिकांश ट्रांसलेटर या तो उन्हें रिजेक्ट कर देते हैं, खाली परिणाम देते हैं, या "फाइल का अनुवाद नहीं किया जा सकता" एरर दिखाते हैं। स्कैन किए गए PDF का अनुवाद करने के लिए आपको अनुवाद से पहले OCR (टेक्स्ट निष्कर्षण) की आवश्यकता होती है। DocTranslating अनुवाद प्रक्रिया के हिस्से के रूप में स्वचालित रूप से OCR चलाता है, 100+ भाषाओं का समर्थन करता है, और अनुवादित टेक्स्ट को मूल PDF की एक कॉपी में वापस सेट कर देता है। महत्वपूर्ण दस्तावेजों पर सटीकता के लिए, पहले PDFEquips पर OCR आउटपुट की जांच कर लें ताकि टेक्स्ट निकालने की गलतियां अनुवाद की गलतियों के साथ मिलकर बड़ी न हो जाएं।

8 min read

शुरुआती गाइड

बिना फॉर्मेटिंग खोए दस्तावेज का अनुवाद कैसे करें

DocTranslating मूल लेआउट, फ़ॉन्ट, टेबल और छवियों को सुरक्षित रखते हुए PDF, Word, PowerPoint, Excel, कोड और सबटाइटल फ़ाइलों का 100 से अधिक भाषाओं में अनुवाद करता है। एक फ़ाइल अपलोड करें, भाषा और चार अनुवाद इंजनों (DeepL, Microsoft Azure, Google Cloud, या Gemini) में से एक चुनें, और मूल के समान अनुवादित प्रति डाउनलोड करें। यह गाइड पूरी प्रक्रिया के साथ-साथ व्यावहारिक मामलों को भी कवर करती है: स्कैन की गई PDF, फ़ुटनोट और टेक्स्ट बॉक्स, शब्दावली की निरंतरता, फ़ाइल आकार की सीमाएं और दाएं-से-बाएं (RTL) भाषाएं।

11 min read

← सभी गाइड