गाइड
स्कैन किए गए PDF से टेक्स्ट कैसे निकालें (Extract)
स्कैन किया गया PDF दरअसल एक इमेज होता है, इसलिए आप इसके टेक्स्ट को सेलेक्ट, सर्च, कॉपी या अनुवाद नहीं कर सकते। DocTranslating का OCR PDF टूल स्कैन किए गए या इमेज-आधारित PDF को कुछ ही क्लिक में एक असली, सेलेक्ट करने योग्य टेक्स्ट लेयर में बदल देता है: टूल खोलें, अपना स्कैन अपलोड करें, तेज़ और अधिक सटीक परिणामों के लिए यदि चाहें तो दस्तावेज़ की भाषा चुनें, और 'टेक्स्ट निकालें' पर क्लिक करें। यह 50+ भाषाओं, हाथ से लिखे गए टेक्स्ट (handwriting) और अरबी व हिब्रू जैसी दाएँ-से-बाएँ (RTL) लिखी जाने वाली भाषाओं का समर्थन करता है। एक बार जब आपको OCR-प्रोसेस किया गया PDF मिल जाता है, तो आप इसे किसी भी सामान्य दस्तावेज़ की तरह अनुवाद कर सकते हैं, सर्च कर सकते हैं या टेक्स्ट कॉपी कर सकते हैं।
अपडेट किया गया 19 जून 2026 · 8 मिनट पढ़ने का समय
यदि आपने किसी PDF में टेक्स्ट को सेलेक्ट करने का प्रयास किया है और कुछ भी हाईलाइट नहीं होता है, या Ctrl+F से सर्च करने पर कोई परिणाम नहीं मिलता है, तो आपका PDF स्कैन किया गया है — यह एक पेज की इमेज है, टेक्स्ट नहीं। यही कारण है कि इसका अनुवाद करना, कॉपी करना या एडिट करना काम नहीं करता। इसका समाधान OCR (ऑप्टिकल कैरेक्टर रिकग्निशन) तकनीक है, जो इमेज को पढ़ती है और उसके नीचे एक असली टेक्स्ट लेयर बनाती है। यह गाइड बताता है कि DocTranslating के OCR PDF टूल का उपयोग करके ऐसा कैसे करें और प्राप्त परिणाम के साथ क्या करें।
मुझे कैसे पता चलेगा कि मेरा PDF स्कैन किया गया है?
तीन त्वरित परीक्षण आपको बताएंगे कि क्या PDF को OCR की आवश्यकता है:
- टेक्स्ट की एक पंक्ति को सेलेक्ट करने का प्रयास करें। यदि आपका कर्सर अलग-अलग शब्दों को हाईलाइट नहीं कर पा रहा है — या पूरे पेज को एक ही इमेज के रूप में सेलेक्ट करता है — तो यह स्कैन किया गया है।
- Ctrl+F (Mac पर Cmd+F) से सर्च करें। यदि कोई शब्द जो आपको स्पष्ट रूप से दिख रहा है, सर्च में नहीं आता है, तो उसमें सर्च करने योग्य टेक्स्ट लेयर मौजूद नहीं है।
- ऐप में नोटिफिकेशन देखें। जब आप DocTranslating में स्कैन की गई फाइल खोलते हैं, तो एक बैनर दिखाई देता है: "ऐसा लगता है कि यह दस्तावेज़ स्कैन किया गया है…" जिसके साथ OCR PDF टूल खोलें बटन होता है — ऐप ने पहचान लिया है कि इसमें कोई उपयोग योग्य टेक्स्ट लेयर नहीं है।
चरण-दर-चरण: स्कैन किए गए PDF से टेक्स्ट कैसे निकालें
- 1
OCR PDF टूल खोलें
सीधे OCR PDF टूल पर जाएँ, या — यदि आप पहले से ही किसी स्कैन की गई फाइल का अनुवाद करने का प्रयास कर रहे थे — नोटिफिकेशन में दिए गए "OCR PDF टूल खोलें" बटन पर क्लिक करें। दोनों रास्ते एक ही टूल पर ले जाते हैं।
- 2
अपना स्कैन किया गया PDF अपलोड करें
वह स्कैन किया गया या इमेज-आधारित PDF चुनें जिसे आप बदलना चाहते हैं। यह वह फाइल है जिसका टेक्स्ट वर्तमान में सेलेक्ट या सर्च नहीं किया जा सकता है।
- 3
दस्तावेज़ की भाषा चुनें (वैकल्पिक)
यदि आप दस्तावेज़ की भाषा जानते हैं, तो उसे चुनें। यह वैकल्पिक है — टूल स्वचालित रूप से भाषा की पहचान कर लेता है — लेकिन इसे सेट करने से तेज़ और अधिक सटीक परिणाम मिलते हैं, विशेष रूप से अरबी, चीनी, सिरिलिक या देवनागरी जैसी गैर-लैटिन लिपियों और हस्तलिखित टेक्स्ट के लिए।
- 4
टेक्स्ट निकालें (Extract Text) पर क्लिक करें और परिणाम डाउनलोड करें
टूल पेजों को पढ़ता है और दस्तावेज़ के मूल स्वरूप को बनाए रखते हुए एक असली, सेलेक्ट करने योग्य टेक्स्ट लेयर तैयार करता है। OCR किया गया PDF डाउनलोड करें — अब आप इसके टेक्स्ट को सेलेक्ट, सर्च और कॉपी कर सकते हैं, और यह अनुवाद के लिए तैयार है।
OCR PDF टूल किन मामलों में बेहतरीन काम करता है
DocTranslating का OCR इंजन सबसे सक्षम इंजनों में से एक है और यह साधारण प्रिंटेड अंग्रेजी टेक्स्ट से कहीं आगे काम करता है:
- 50+ भाषाएँ — गैर-लैटिन लिपियों वाली भाषाओं सहित।
- हस्तलिखित टेक्स्ट (Handwritten Text) — न केवल प्रिंटेड टेक्स्ट, बल्कि साफ-सुथरी लिखावट की भी पहचान की जाती है।
- दाएँ-से-बाएँ (RTL) लिखी जाने वाली लिपियाँ — सही पढ़ने के क्रम (reading order) के साथ अरबी, हिब्रू और फ़ारसी को उच्च सटीकता के साथ प्रोसेस किया जाता है।
- बहुभाषी पेज (Multilingual Pages) — ऐसे दस्तावेज़ जिनमें एक ही पेज पर एक से अधिक भाषाएँ होती हैं।
- दैनिक स्कैन गुणवत्ता — दस्तावेज़ों की तस्वीरें और सामान्य ऑफिस स्कैन, न कि केवल एकदम सही फ्लैटबेड स्कैन।
OCR के बाद: अपने दस्तावेज़ का अनुवाद करें
एक बार जब आपके पास OCR-प्रोसेस किया गया PDF आ जाता है, तो इसका अनुवाद करना किसी भी सामान्य PDF का अनुवाद करने जैसा ही है — इसे अपलोड करें, अपनी भाषाएँ और ट्रांसलेशन इंजन चुनें, और अनूदित कॉपी डाउनलोड करें। पहले एक अलग चरण के रूप में OCR चलाने का एक बड़ा लाभ है: आप अनुवाद करने से पहले निकले हुए टेक्स्ट को पढ़कर यह पुष्टि कर सकते हैं कि यह सही है। बिना जांचे गए स्कैन का अनुवाद करने से दो तरह की त्रुटियाँ होने का जोखिम रहता है — एक गलत पढ़ा गया शब्द अनुवाद में आत्मविश्वास से भरी एक गलत शब्द बन जाता है — इसलिए पहले OCR आउटपुट की जांच करना सटीक अंतिम अनुवाद प्राप्त करने का सबसे अच्छा तरीका है।
सर्वोत्तम OCR परिणाम प्राप्त करने के लिए युक्तियाँ
OCR की सटीकता काफी हद तक इनपुट स्कैन की गुणवत्ता पर निर्भर करती है। कुछ बातें परिणामों को काफी बेहतर बनाती हैं:
- यदि आपको पता हो तो दस्तावेज़ की भाषा सेट करें — सटीकता और गति में सुधार करने का यह सबसे आसान तरीका है।
- स्पष्ट और सीधे स्कैन का उपयोग करें। तिरछे या घूमे हुए पेजों को फिर से स्कैन करें ताकि टेक्स्ट क्षैतिज रेखाओं (horizontal lines) पर रहे।
- उच्च रिज़ॉल्यूशन को प्राथमिकता दें। कम रिज़ॉल्यूशन वाली इमेजेस की तुलना में लगभग 300 DPI या उससे अधिक के स्कैन OCR को काम करने के लिए अधिक स्पष्ट अक्षर प्रदान करते हैं।
- धुंधले दस्तावेज़ों में कंट्रास्ट बढ़ाएँ ताकि टेक्स्ट बैकग्राउंड से स्पष्ट रूप से अलग दिखाई दे।
- सुनिश्चित करें कि फाइल पासवर्ड से सुरक्षित नहीं है — एन्क्रिप्टेड PDF को तब तक नहीं पढ़ा जा सकता जब तक कि उन्हें अनलॉक न किया जाए।
विकल्प: PDFEquips पर OCR
यदि आप पहले से ही PDFEquips के भीतर काम कर रहे हैं — उदाहरण के लिए PDF को कनवर्ट, कंप्रेस या मर्ज करने के लिए — तो इसमें एक OCR टूल भी शामिल है जिसका उपयोग आप स्कैन किए गए PDF को सर्च योग्य बनाने के लिए कर सकते हैं। दोनों में से कोई भी तरीका आपको एक OCR-प्रोसेस फाइल देगा जिसे आप अनुवाद के लिए DocTranslating पर ला सकते हैं। वही तरीका उपयोग करें जो आपके काम के प्रवाह के अनुकूल हो।
अक्सर पूछे जाने वाले प्रश्न
मैं स्कैन किए गए PDF से टेक्स्ट कैसे निकालूँ?
DocTranslating का OCR PDF टूल खोलें, अपना स्कैन किया गया PDF अपलोड करें, तेज़ और अधिक सटीक परिणामों के लिए यदि चाहें तो दस्तावेज़ की भाषा चुनें, और 'टेक्स्ट निकालें' पर क्लिक करें। यह टूल दस्तावेज़ के मूल स्वरूप को बनाए रखते हुए एक असली, सेलेक्ट करने योग्य टेक्स्ट लेयर तैयार करता है, और आप एक OCR किया गया PDF डाउनलोड कर सकते हैं जिसे आप सेलेक्ट, सर्च, कॉपी और अनुवाद कर सकते हैं।
मुझे कैसे पता चलेगा कि कोई PDF स्कैन किया गया है या उसमें असली टेक्स्ट है?
अपने कर्सर से टेक्स्ट की एक पंक्ति को सेलेक्ट करने का प्रयास करें, या Ctrl+F (Mac पर Cmd+F) के साथ दस्तावेज़ में खोजें। यदि आप अलग-अलग शब्दों को हाईलाइट नहीं कर सकते हैं, या स्पष्ट रूप से दिखाई देने वाला शब्द सर्च में नहीं आता है, तो PDF स्कैन किया गया है और इसके लिए OCR की आवश्यकता है। DocTranslating में, एक स्कैन की गई फाइल खोलने पर "ऐसा लगता है कि यह दस्तावेज़ स्कैन किया गया है…" नोटिफिकेशन के साथ OCR टूल खोलने का बटन भी दिखाई देता है।
क्या यह PDF से हाथ से लिखे गए टेक्स्ट (Handwriting) को निकाल सकता है?
हाँ। OCR PDF टूल प्रिंटेड टेक्स्ट के अलावा हस्तलिखित टेक्स्ट को भी पहचानता है। साफ-सुथरी और पढ़ने योग्य लिखावट सबसे अच्छे परिणाम देती है; जबकि बहुत खराब या स्टाइल वाली लिखावट किसी भी OCR सिस्टम के लिए एक चुनौती होती है, इसलिए परिणाम पढ़ने योग्यता के आधार पर भिन्न हो सकते हैं।
क्या OCR अरबी, हिब्रू और दाएँ-से-बाएँ लिखी जाने वाली अन्य भाषाओं के लिए काम करता है?
हाँ। OCR PDF टूल अरबी, हिब्रू और फ़ारसी सहित दाएँ-से-बाएँ (RTL) लिखी जाने वाली लिपियों का समर्थन करता है और सही पढ़ने के क्रम को फिर से व्यवस्थित करता है — जो आमतौर पर स्कैन किए गए RTL दस्तावेज़ों में सबसे कठिन हिस्सा होता है। यह निकाले गए टेक्स्ट को उल्टा-पुल्टा होने के बजाय सर्च और अनुवाद के लिए वास्तव में उपयोगी बनाता है।
OCR PDF टूल कितनी भाषाओं का समर्थन करता है?
50+ भाषाएँ, जिनमें गैर-लैटिन लिपियों वाली कई भाषाएँ शामिल हैं। आप टूल को स्वचालित रूप से भाषा की पहचान करने दे सकते हैं, या तेज़ और अधिक सटीक निष्कर्षण के लिए इसे मैन्युअल रूप से सेट कर सकते हैं — भाषा चुनना विशेष रूप से गैर-लैटिन और हस्तलिखित दस्तावेज़ों के लिए सहायक होता है।
क्या मुझे स्कैन किए गए PDF का अनुवाद करने से पहले OCR चलाना होगा?
यह अनुशंसित तरीका है। पहले एक अलग चरण के रूप में OCR चलाने से आप अनुवाद करने से पहले निकाले गए टेक्स्ट की जांच कर सकते हैं, ताकि पहचान संबंधी गलतियाँ दूसरी भाषा में न जाएँ। एक बार जब आपके पास OCR किया गया PDF आ जाता है, तो आप इसका किसी भी सामान्य PDF की तरह अनुवाद कर सकते हैं।
क्या OCR मेरे दस्तावेज़ का लुक बदल देगा?
नहीं — OCR PDF टूल दस्तावेज़ के मूल स्वरूप को बनाए रखता है और इसमें एक सेलेक्ट करने योग्य टेक्स्ट लेयर जोड़ता है। आपका स्कैन किया गया फाइल दिखने में पहले जैसा ही रहेगा; एकमात्र अंतर यह है कि अब इसके टेक्स्ट को सेलेक्ट, सर्च, कॉपी और अनुवाद किया जा सकता है।
गूगल ट्रांसलेट या अन्य टूल मेरे स्कैन किए गए PDF का अनुवाद क्यों नहीं करते?
अधिकांश अनुवादक केवल PDF की मौजूदा टेक्स्ट लेयर को पढ़ते हैं, और स्कैन किए गए PDF में ऐसी कोई लेयर नहीं होती — यह केवल एक इमेज होती है। इसीलिए वे एक खाली फाइल या एरर मैसेज देते हैं। पहले OCR के साथ टेक्स्ट निकालने से दस्तावेज़ को एक असली टेक्स्ट लेयर मिल जाती है, जिसके बाद इसे सामान्य रूप से अनूदित किया जा सकता है।