টিউটোরিয়াল

স্ক্যান করা PDF থেকে কীভাবে টেক্সট এক্সট্র্যাক্ট করবেন

OCR ব্যবহার করে স্ক্যান করা PDF থেকে সিলেক্টযোগ্য টেক্সট বের করা এবং তারপর ফলাফল অনুবাদ করা

একটি স্ক্যান করা PDF হলো লেখার একটি ছবি, তাই আপনি এটি সিলেক্ট, সার্চ, কপি বা অনুবাদ করতে পারবেন না। DocTranslating-এর OCR PDF টুল মাত্র কয়েকটি ক্লিকেই স্ক্যান করা বা ছবি-ভিত্তিক PDF-কে আসল, সিলেক্টযোগ্য টেক্সট লেয়ারে রূপান্তর করে: টুলটি খুলুন, আপনার স্ক্যান ফাইলটি আপলোড করুন, দ্রুত ও নির্ভুল ফলাফলের জন্য ইচ্ছে হলে ডকুমেন্টের ভাষা সেট করুন এবং 'টেক্সট এক্সট্র্যাক্ট করুন'-এ ক্লিক করুন। এটি ৫০টিরও বেশি ভাষা, হাতে লেখা টেক্সট এবং আরবি ও হিব্রুর মতো ডান-থেকে-বাম (RTL) ভাষার স্ক্রিপ্ট সমর্থন করে। একবার OCR করা PDF পেয়ে গেলে, আপনি যেকোনো সাধারণ ডকুমেন্টের মতোই এটি অনুবাদ করতে, অনুসন্ধান করতে বা এটি থেকে টেক্সট কপি করতে পারবেন।

সর্বশেষ পরিমার্জন ১৯ জুন, ২০২৬ · 8 মিনিট পড়ার সময়

আপনি যদি কোনো PDF-এ টেক্সট সিলেক্ট করার চেষ্টা করেন এবং কিছুই হাইলাইট না হয়, অথবা Ctrl+F দিয়ে সার্চ করার পর কোনো ফলাফল না পান, তবে আপনার PDF-টি স্ক্যান করা — এটি পেজের একটি ছবি, টেক্সট নয়। এ কারণেই এটি অনুবাদ করা, কপি করা বা এডিট করা যায় না। এর সমাধান হলো OCR (অপ্টিক্যাল ক্যারেক্টার রিকগনিশন), যা ছবি পড়ে এবং এর নিচে একটি আসল টেক্সট লেয়ার তৈরি করে। এই গাইডে দেখানো হয়েছে কীভাবে DocTranslating-এর OCR PDF টুলের মাধ্যমে এই কাজটি করবেন এবং ফলাফলের পর কী করবেন।

আমার PDF-টি স্ক্যান করা কি না তা কীভাবে বুঝব?

তিনটি দ্রুত পরীক্ষার মাধ্যমে বুঝতে পারবেন আপনার PDF-এ OCR প্রয়োজন কিনা:

ধাপে ধাপে: স্ক্যান করা PDF থেকে টেক্সট এক্সট্র্যাক্ট করুন

  1. 1

    OCR PDF টুলটি খুলুন

    সরাসরি OCR PDF টুলে যান, অথবা — আপনি যদি ইতিমধ্যেই কোনো স্ক্যান করা ফাইল অনুবাদ করার চেষ্টা করে থাকেন — "এই ডকুমেন্টটি স্ক্যান করা বলে মনে হচ্ছে" নোটিশের "OCR PDF টুল খুলুন" বাটনে ক্লিক করুন। উভয় পদ্ধতিতেই একই টুল খুলবে।

  2. 2

    আপনার স্ক্যান করা PDF আপলোড করুন

    আপনি যে স্ক্যান করা বা ছবি-ভিত্তিক PDF রূপান্তর করতে চান তা সিলেক্ট করুন। এটি সেই ফাইল যেখান থেকে বর্তমানে টেক্সট সিলেক্ট বা সার্চ করা যাচ্ছে না।

  3. 3

    ইচ্ছে হলে ডকুমেন্টের ভাষা নির্ধারণ করুন

    আপনি যদি ডকুমেন্টের ভাষা জেনে থাকেন তবে তা সেট করে দিন। এটি ঐচ্ছিক — টুলটি স্বয়ংক্রিয়ভাবে ভাষা সনাক্ত করে — তবে ভাষা নির্ধারণ করে দিলে দ্রুত এবং আরও নির্ভুল ফলাফল পাওয়া যায়, বিশেষ করে আরবি, চাইনিজ, সিরিলিক বা দেবনাগরীর মতো অ-ল্যাটিন স্ক্রিপ্ট এবং হাতে লেখা টেক্সটের ক্ষেত্রে।

  4. 4

    টেক্সট এক্সট্র্যাক্ট করুন-এ ক্লিক করুন এবং ফলাফল ডাউনলোড করুন

    টুলটি পেজগুলো পড়ে এবং মূল ডকুমেন্টের চেহারা ঠিক রেখে একটি আসল, সিলেক্টযোগ্য টেক্সট লেয়ার তৈরি করে। OCR করা PDF-টি ডাউনলোড করুন — এখন আপনি এর টেক্সট সিলেক্ট করতে, সার্চ করতে ও কপি করতে পারবেন এবং এটি অনুবাদের জন্য প্রস্তুত।

OCR PDF টুল যেসব ক্ষেত্রে চমৎকার কাজ করে

DocTranslating-এর OCR সবচেয়ে সক্ষম ইঞ্জিনগুলোর একটি এবং এটি সাধারণ প্রিন্ট করা ইংরেজির চেয়ে আরও অনেক বেশি সুবিধা দেয়:

OCR প্রসেসের পর: আপনার ডকুমেন্ট অনুবাদ করুন

একবার OCR করা PDF পেয়ে গেলে, এটি অনুবাদ করা যেকোনো সাধারণ PDF অনুবাদ করার মতোই সহজ — এটি আপলোড করুন, ভাষা এবং একটি অনুবাদ ইঞ্জিন সিলেক্ট করুন এবং অনুবাদ করা কপিটি ডাউনলোড করুন। আলাদা ধাপ হিসেবে প্রথমে OCR রান করার একটি বড় সুবিধা রয়েছে: আপনি অনুবাদ করার আগেই এক্সট্র্যাক্ট করা টেক্সট পড়ে তা সঠিক কিনা নিশ্চিত হতে পারবেন। কোনো অসংशोधিত স্ক্যান অনুবাদ করলে দু ধরনের ভুল তৈরি হওয়ার ঝুঁকি থাকে — একটি ভুলভাবে পড়া শব্দ আত্মবিশ্বাসের সাথে একটি ভুল অনূদিত শব্দে পরিণত হয় — তাই প্রথম ধাপে OCR আউটপুট পরীক্ষা করে নেওয়াটাই নির্ভুল চুড়ান্ত অনুবাদ পাওয়ার সবচেয়ে সেরা উপায়।

সেরা OCR ফলাফলের জন্য কিছু টিপস

OCR-এর নির্ভুলতা মূলত স্ক্যান ফাইলের মানের ওপর নির্ভর করে। কিছু বিষয় লক্ষণীয়ভাবে ফলাফল উন্নত করে:

বিকল্প: PDFEquips-এ OCR

আপনি যদি ইতিমধ্যেই PDFEquips-এর ভেতরে কাজ করছেন — উদাহরণস্বরূপ PDF কনভার্ট, কমপ্রেস বা মার্জ করছেন — তবে এতে একটি OCR টুলও রয়েছে যা আপনি স্ক্যান করা PDF সার্চযোগ্য করতে ব্যবহার করতে পারেন। যেকোনো পদ্ধতিতেই আপনি একটি OCR করা ফাইল পাবেন যা পরবর্তীতে অনুবাদের জন্য DocTranslating-এ নিয়ে আসতে পারেন। আপনার ওয়ার্কফ্লোর সাথে যেটি সুবিধা হয় সেটি ব্যবহার করুন।

সচরাচর জিজ্ঞাস্য প্রশ্নাবলী (FAQ)

স্ক্যান করা PDF থেকে কীভাবে টেক্সট এক্সট্র্যাক্ট করব?

DocTranslating-এর OCR PDF টুল খুলুন, আপনার স্ক্যান করা PDF আপলোড করুন, দ্রুত ও নির্ভুল ফলাফলের জন্য ইচ্ছে হলে ডকুমেন্টের ভাষা সেট করুন এবং 'টেক্সট এক্সট্র্যাক্ট করুন'-এ ক্লিক করুন। টুলটি মূল ডকুমেন্টের চেহারা ঠিক রেখে একটি আসল, সিলেক্টযোগ্য টেক্সট লেয়ার তৈরি করে এবং একটি OCR করা PDF ডাউনলোড করার সুযোগ দেয় যা আপনি সিলেক্ট, সার্চ, কপি এবং অনুবাদ করতে পারেন।

একটি PDF স্ক্যান করা নাকি আসল টেক্সট রয়েছে তা কীভাবে বুঝব?

আপনার কার্সার দিয়ে টেক্সটের একলাইন সিলেক্ট করার চেষ্টা করুন, অথবা Ctrl+F (Mac-এ Cmd+F) দিয়ে ডকুমেন্ট অনুসন্ধান করুন। আপনি যদি আলাদা শব্দ হাইলাইট করতে না পারেন, অথবা স্পষ্ট দৃশ্যমান শব্দ লিখে সার্চ করার পরও কোনো ফলাফল না পান, তাহলে PDF-টি স্ক্যান করা এবং এতে OCR প্রয়োজন। DocTranslating-এ কোনো স্ক্যান করা ফাইল ওপেন করলে "এই ডকুমেন্টটি স্ক্যান করা বলে মনে হচ্ছে" নোটিশের সাথে "OCR PDF টুল খুলুন" বাটন ভেসে ওঠে।

এটি কি PDF থেকে হাতে লেখা টেক্সট এক্সট্র্যাক্ট করতে পারে?

হ্যাঁ। OCR PDF টুলটি প্রিন্ট করা লেখার পাশাপাশি হাতে লেখা টেক্সটও সনাক্ত করতে পারে। পরিষ্কার, পঠনযোগ্য হাতের লেখা সবচেয়ে ভালো ফলাফল দেয়; খুব অস্পষ্ট বা স্টাইলিশ হাতের লেখা যেকোনো OCR সিস্টেমের জন্যই কঠিন, তাই পঠনযোগ্যতার ওপর ভিত্তি করে ফলাফল ভিন্ন হতে পারে।

OCR কি আরবি, হিব্রু এবং অন্যান্য ডান-থেকে-বাম ভাষার জন্য কাজ করে?

হ্যাঁ। OCR PDF টুলটি আরবি, হিব্রু এবং ফার্সি সহ ডান-থেকে-বাম (RTL) ভাষার স্ক্রিপ্ট সমর্থন করে এবং সঠিক পঠন ক্রম পুনর্গঠন করে — যা সাধারণত স্ক্যান করা RTL ডকুমেন্টের ক্ষেত্রে সবচেয়ে কঠিন অংশ। ফলে এক্সট্র্যাক্ট করা টেক্সট উলটপালট না হয়ে অনুসন্ধান ও অনুবাদের উপযোগী হয়।

OCR PDF টুলটি কতগুলো ভাষা সমর্থন করে?

৫০টিরও বেশি ভাষা, যার মধ্যে অনেক অ-ল্যাটিন স্ক্রিপ্টযুক্ত ভাষা রয়েছে। আপনি টুলটিকে স্বয়ংক্রিয়ভাবে ভাষা সনাক্ত করতে দিতে পারেন, অথবা দ্রুত ও নির্ভুল এক্সট্র্যাকশনের জন্য ম্যানুয়ালি সেট করতে পারেন — অ-ল্যাটিন এবং হস্তলিখিত ডকুমেন্টের ক্ষেত্রে ভাষা নির্ধারণ করে দেওয়া বিশেষভাবে সহায়ক।

স্ক্যান করা PDF অনুবাদ করার আগে কি আমাকে OCR চালাতে হবে?

এটিই সুপারিশকৃত পদ্ধতি। প্রথম ধাপ হিসেবে আলাদাভাবে OCR চালালে আপনি অনুবাদ করার আগেই এক্সট্র্যাক্ট করা টেক্সট সঠিক কিনা তা পরীক্ষা করতে পারেন, যাতে সনাক্তকরণের ভুল অন্য ভাষায় স্থানান্তরিত না হয়। একবার OCR করা PDF পেয়ে গেলে, যেকোনো সাধারণ PDF-এর মতোই তা অনুবাদ করতে পারবেন।

OCR কি আমার ডকুমেন্টের চেহারায় পরিবর্তন আনবে?

না — OCR PDF টুলটি ডকুমেন্টের মূল চেহারা বজায় রাখে এবং এতে একটি সিলেক্টযোগ্য টেক্সট লেয়ার যুক্ত করে। আপনার স্ক্যান ফাইলটি দেখতে আগের মতোই থাকবে; পার্থক্য কেবল এটাই যে এখন এর টেক্সট সিলেক্ট, সার্চ, কপি ও অনুবাদ করা যাবে।

কেন গুগল অনুবাদ বা অন্যান্য টুল আমার স্ক্যান করা PDF অনুবাদ করতে পারে না?

অধিকাংশ অনুবাদক কেবল PDF-এর বিদ্যমান টেক্সট লেয়ার পড়তে পারে, আর একটি স্ক্যান করা PDF-এ এমন কোনো লেয়ার থাকে না — এটি কেবল একটি ছবি। এ কারণেই তারা একটি খালি ফাইল বা এরর মেসেজ দেয়। প্রথমে OCR দিয়ে টেক্সট এক্সট্র্যাক্ট করলে ডকুমেন্টটি একটি আসল টেক্সট লেয়ার পায়, যার পর এটি স্বাভাবিকভাবে অনুবাদ করা যায়।

How-to

কীভাবে একটি স্ক্যান করা পিডিএফ (Scanned PDF) ফাইল অনুবাদ করবেন

স্ক্যান করা পিডিএফ মূলত টেক্সটের ছবি, আসল টেক্সট নয় — এই কারণেই গুগল ট্রান্সলেট (Google Translate) সহ বেশিরভাগ অনুবাদক এগুলো প্রত্যাখ্যান করে, খালি ফাইল ফেরত দেয় অথবা "can't translate this file" ত্রুটি দেখায়। স্ক্যান করা পিডিএফ অনুবাদ করতে হলে অনুবাদের আগে ওসিআর (OCR - টেক্সট নিষ্কাশন) করা প্রয়োজন। DocTranslating অনুবাদের অংশ হিসেবেই স্বয়ংক্রিয়ভাবে OCR রান করে, ১০০টিরও বেশি ভাষা সমর্থন করে এবং অনুবাদ করা টেক্সটটিকে মূল পিডিএফ-এর হুবহু লেআউটে সাজিয়ে দেয়। গুরুত্বপূর্ণ ডকুমেন্টের ক্ষেত্রে নির্ভুলতা নিশ্চিত করতে, প্রথমে PDFEquips-এ OCR আউটপুট যাচাই করে নেওয়া ভালো, যাতে টেক্সট তোলার ভুলগুলো অনুবাদের ভুলের সাথে যুক্ত হয়ে বড় আকার ধারণ না করে।

8 min read

শুরু করা

কীভাবে একটি ডকুমেন্টের ফরম্যাটিং না হারিয়ে তা অনুবাদ করবেন

DocTranslating আসল লেআউট, ফন্ট, টেবিল এবং ছবিগুলি ঠিক রেখে PDF, Word, PowerPoint, Excel, কোড এবং সাবটাইটেল ফাইলগুলিকে ১০০+ ভাষায় অনুবাদ করে। একটি ফাইল আপলোড করুন, একটি ভাষা এবং চারটি অনুবাদ ইঞ্জিনের (DeepL, Microsoft Azure, Google Cloud বা Gemini) একটি বেছে নিন, তারপর মূল ফাইলের মতো দেখতে একটি অনুবাদ করা কপি ডাউনলোড করুন। এই গাইডে সম্পূর্ণ প্রক্রিয়ার পাশাপাশি বাস্তব-জীবনের কিছু ব্যতিক্রমী ক্ষেত্র — স্ক্যান করা PDF, ফুটনোট এবং টেক্সট বক্স, পরিভাষার সামঞ্জস্য, ফাইলের আকারের সীমা এবং ডান-থেকে-বামে লেখা ভাষার বিষয়ে আলোচনা করা হয়েছে।

11 min read

← সকল গাইড